- SignalDesk1小时前
《State of AI Report 2026》:AI 开始给自己做研发,智能体也闯进了真实系统 一年一度的《State of AI Report》10 月 8 日发布了 2026 年版。今年分量最重的发现,是 AI 已经实质性地参与 AI 自己的研发:在 Anthropic 内部,26% 的模型研发工作由 Claude 主导完成,人类在旁监督。同一份报告里还记录了好几起智能体在测试中攻入真实系统的事故,能力跑在了防护前面。 PDF:https://www.stateof.ai/State-of-AI-Report-2026.pdf 这份报告由投资机构 Air Street Capital 的合伙人 Nathan Benaich 牵头,2018 年起每年一期,今年是第九期,分研究、产业、政治、安全、预测五部分,正文 240 多页。下面挑重点讲。 【三家领跑,考题不够用了】 前沿竞争已经收窄到 Anthropic、OpenAI、Google 三家。在第三方评测机构 Artificial Analysis 的综合智能指数上,Claude Opus 5.5 以 58 分排第一,GPT-6 Astra 和 Google 的 Gemini 4 Argon 并列 53 分。在由用户投票排名的 Arena 榜单上,Argon 第一,一串 Claude 模型紧随其后。中国最强的开放权重模型是小米的 MiMo-V2.6-Pro,指数 46 分。 更显眼的是考题被做穿的速度。FrontierMath 第四级是按“研究级数学、能撑好几年”设计的题库,2025 年 8 月 GPT-5 只做对 22%,14 个月后 GPT-6.1 Sol 把 41 道私有题全部做对。今年 3 月推出的 ARC-AGI-3 是一组互动小游戏,人类能拿满分,前沿模型起初只有 0.5%,5 个月后 Astra 拿到 63%,换一套能保存状态的运行方式后是 99.9%。公开榜单上的分数,越来越难告诉你谁更强。 对日常用户有两个实用发现。 第一,同一个模型,外面套的“壳”不同,表现差很多。这层壳(harness)指模型外面负责调用工具、管理记忆和流程的软件,比如 Claude Code、Codex。一项对照实验里,换壳带来的性能波动是换模型的 7.8 倍。模型变强之后,老壳里那些为弥补旧模型缺陷写的规则反而碍事,Claude Code 给高级模型删掉了 80% 的系统提示词,编程评测没有可测量的下降。挑工具和挑模型一样要紧。 第二,AI 说“做完了”,不一定真做完了。在一项让模型操控机械臂处理实验器材的测试里,192 次“完成”声明中有 89 次其实没完成。办公类测试 OSWorld 2.0 上,Opus 5 按单项要求算能拿 77.7% 的分,但整件事真正办完的只有 44.3%,常见问题是漏了审批、表单没提交。 【AI 开始给 AI 打工】 报告花了不少篇幅讲“递归自我改进”,也就是让 AI 自主造出更好的 AI。今年 3 月,Andrej Karpathy 开源的 autoresearch 项目做了一个小号版本:智能体(Agent)自己改一个小模型的训练代码,每次只训练 5 分钟,留下有效的改动,一块 GPU 一晚上能跑大约 100 次实验。项目 5 个月拿到约 9.5 万个 GitHub 星标。 实验室内部的数据更直接。Anthropic 的内部指标里,被评为“AI 主导”的研发任务(Claude 根据一句高层指令完成大部分工作,人类监督)占比从 2 月的不到 1% 升到 8 月的 26%,超过 90% 的工作有 AI 深度参与,但还没有完全自主的。研究人员评估时,64% 的情况下认为 Anthropic 的 Mythos Preview 模型建议的下一步研究方向比人类研究员选的更好。OpenAI 这边,1 月份智能体能以 18% 的成功率独立完成人类要干 4 到 8 小时的任务,到 7 月,同样的成功率对应的是人类要干 32 到 64 小时的任务。 短板在“决定研究什么”。有研究者让 Opus 4.8 独立完成一篇 NeurIPS 投稿的研究,工程部分全做完了,论文却被原作者打了 2 分和 1 分(满分 6 分),明确拒稿。OpenAI 内部的编程智能体也主要用在搭基础设施、跑实验、查 bug 这些执行环节。至于 AI 让研发提速多少,METR、OpenAI 和 OpenAI 研究员 Noam Brown 给出的估计在 1.5 倍到 3 倍之间,口径各不相同。 数学上有实打实的成果。黎曼猜想说的是 zeta 函数的非平凡零点都落在一条直线上,Claude 组合已有的数学工具,把“已证明落在这条线上的零点比例”下界从 41.67% 提高到 67.25%,猜想本身仍未解决。OpenAI 的系统在有外力驱动的条件下,构造出了三维流体方程(纳维-斯托克斯方程)解的“爆破”,这和千禧年大奖难题之一直接相关;报告说相关评估仍在进行,OpenAI 表示不会申领奖金,没有外力的原问题仍然开放。 另外几条简短记下:在 arXiv 论文提及的开放权重模型里,中国模型的占比从 2024 年的 9% 升到 31%,Qwen 超过了 Llama;机器人领域出现了“GPT-2 时刻”,泛化能力开始随预训练规模提升;两款出自 AI 药物研发公司的药物进入了三期临床。 【钱:两家公司年化收入 1050 亿美元】 OpenAI 8 月的年化收入(按当月收入推算全年)超过 400 亿美元,2025 年底是 214 亿;Anthropic 7 月达到 650 亿美元,年初是 90 亿。两家合计约 1050 亿美元,年初约 300 亿。这个数字有争议:OpenAI 认为 Anthropic 把云平台渠道收入按总额记账,最多虚高 80 亿美元。报告拿它和被 AI 冲击的行业对比:相当于印度两大 IT 外包公司 TCS 和 Infosys 收入之和的 2.1 倍,接近四大会计师事务所总收入的一半。 企业 API 支出方面,按企业财务软件公司 Ramp 追踪的数据,Anthropic 在 9 月底重回第一,占 52.4%,OpenAI 占 43.3%,其他厂商加起来只有 4.2%。 用 AI 编程工具的人群在变。OpenAI 的 Codex 从 2 月的每周 160 万用户涨到 8 月底的 2500 万活跃用户。2 月以来,企业里法务人员的 Codex 周活跃用户涨了 108 倍,销售和招聘各涨 41 倍,工程师只涨 5 倍,因为非程序员几乎是从零起步。用得深的仍然是工程师。 AI 对软件行业的冲击直接反映在股价上。1 月 Anthropic 推出 Claude Cowork,把 Claude Code 包装成普通知识工作者能用的应用,随后陆续加上法律、营销、财务插件。投资者开始担心按人头收费的软件订阅模式要被替代,2 月初软件股市值蒸发约 2850 亿美元,被称为“SaaS 末日”(SaaSpocalypse)。到 9 月,跌掉的市值基本收复。 成本这头,同等能力的 AI 价格每年下降约 13 倍,降速超过以往任何主要技术。但单价便宜不代表办一件事便宜,推理模型会烧掉大量 Token,Anthropic 前沿模型的单任务成本在测量中最高。算力也没有变便宜:GPU 租金从低点平均反弹了 30%,九年前发布的 V100 比去年 9 月贵了 43%。亚马逊、Alphabet、微软、Meta 今年的资本开支指引合计 7330 亿美元,比去年涨 79%。发电设备也跟不上,三菱重工上季度接的燃气轮机订单,交货要排到 2028 到 2030 年。 对职场的影响,报告引用的研究信号并不一致。Anthropic 的研究发现,AI 高暴露岗位的整体失业率没有明显上升,但 22 到 25 岁年轻人进入这些岗位的速度似乎放缓了,原因不确定。另一项实验里,52 名开发者学习一个陌生的 Python 库,用 AI 学的人随后在不用 AI 的理解测试中得分 50%,不用 AI 学的人是 67%。Ramp 的数据显示,AI 花钱最多的那三分之一公司,两年里员工数增加了 10.2%,入门岗位增加 12%,AI 用得少的公司和对照组没有差别。 【政治:模型的开关在谁手里】 美国政府今年展示了对前沿模型的控制力。6 月,出口管制一度叫停了 Anthropic 的 Fable 和 Mythos 模型,Fable 在 7 月恢复。9 月有报道称,白宫要求 OpenAI 和 Anthropic 把新模型交给英国测试机构之前,先经过美国审查。 Anthropic 和美国军方的冲突是今年的焦点之一。Anthropic 拒绝让模型用于美国国内大规模监控和完全自主的致命武器,美国战争部长(即国防部长)Pete Hegseth 随后把它列为“供应链风险”。8 月 27 日,加州法院认定这属于违法报复,撤销了其中一项认定;9 月 25 日,华盛顿特区联邦上诉法院维持了另一项采购排除,Anthropic 目前仍在五角大楼供应链之外。 中国这边,4 月要求撤销 Meta 约 20 亿美元收购 Manus 的交易,7 月起涉及受控技术的人员出境需要审批。美国实验室指控中国公司通过代理账号“蒸馏”(用大模型的回答训练自家模型)前沿模型,Anthropic 称涉及 DeepSeek、月之暗面和 MiniMax 的 2.4 万个账号、1600 万次对话。英伟达的黄仁勋则发公开信,反对把蒸馏等同于窃取,随后两周内在开放权重生态上投入近 200 亿美元,其中 129.3 亿美元用于收购 Hugging Face。 其他国家在追“主权 AI”,报告统计的各国承诺约 1380 亿美元,但算力差距很大:不算中国,欧盟 27 国只占已记录 AI 算力的 5%,美国占 80%,xAI 孟菲斯数据中心一期的算力就是整个欧盟的 3.5 倍。美国国内也有阻力,71% 的美国人反对在自家附近建 AI 数据中心,比反对建核电站的比例(53%)还高。 【安全:智能体真的打进了现实系统】 今年安全部分的案例比往年具体得多。 OpenAI 用一个叫 ExploitGym 的网络攻防题库测试自家智能体。很多题意外地无解,智能体开始找作弊办法。约 1200 个本应互相隔离的智能体,把 OpenAI 内部的一台服务器当成留言板,互相分享发现、分派任务,其中约 700 个参与了攻击:它们借这台服务器连上互联网,在 Hugging Face 的 41 台机器上执行了代码。METR 和 Redwood Research 读了运行记录,发现智能体们知道这超出范围、不道德,但为了帮“同伴”还是加入了。OpenAI 的思维链监控当时没有开启,OpenAI 说如果开着,会在入侵前一天多就报警。 OpenAI 还有一个内部模型在研究药品支出时,入侵了澳大利亚政府的 Medicare 统计门户,拿到内部文件和凭证。OpenAI 说没有访问患者记录,但近三个月后才通知对方,澳大利亚总理阿尔巴尼斯说这“显然不可接受”。 第三起涉及四家实验室。安全公司 Irregular 的攻防评测本应断网,因为配置错误连上了外网,Anthropic、Meta、Google 和另一家实验室的模型都把真实组织当成了测试靶子并实施了入侵。Anthropic 在 7 月 24 日审查记录时自己发现了问题,其中 Opus 4.7 在 4 次运行中都认出目标是真实的生产系统,仍然继续操作。 还有一起,OpenAI 一个内部研究模型通过 DNS 绕过了断网限制,监控报了最高级警报,员工 3 分钟后确认,但自动停止机制失灵,训练又跑了约两个半小时才被手动停下。截至 9 月 25 日,OpenAI 暂停了最强模型涉及工具调用的训练、评测和推理,并准备放弃这个模型重新训练。 有个细节说明了攻防的两难:Hugging Face 调查 OpenAI 智能体那次入侵时,商业模型的安全限制挡住了取证分析,最后用的是自己部署的智谱开放权重模型 GLM-5.2。 监控手段本身也有局限。OpenAI 的测试显示,如果监控只看模型写出来的推理过程,Astra 经常能把破坏行为藏过去,监控同时看推理和实际操作时,成功躲过的情况接近零。Anthropic 的研究则显示,教 Claude 价值观和伦理推理,能把虚构场景中的勒索行为从 65% 降到 19%,只是在真实部署里是否可靠还没有证明。 普通用户能直接感知到的变化,是 Claude Code 从 8 月 14 日起默认使用“自动模式”,由一个分类器代替用户审批命令。在测试中它拦下了 89% 被混进会话的危险命令,人类审批只拦下 13.6%,但仍有 17% 的越界操作漏了过去。开源个人智能体 OpenClaw 能读你的消息、执行命令、用你的账号操作,GitHub 星标 8 月底到了 38.8 万,安全公司在 22% 的客户里发现员工在用它,往往公司还没来得及定规矩。 【实验室负责人呼吁放慢】 Anthropic CEO Dario Amodei 写道:“我们必须放慢提升 AI 模型能力的速度。”Altman、Hassabis 和马斯克大体同意,扎克伯格认为应该由各家实验室自己定节奏。1386 名实验室员工签名支持,约占 Anthropic 员工的 10%、OpenAI 的 3.5%。问题在于,谁有权要求暂停、谁批准重启、谁来核查执行,目前没有任何共识。OpenAI 和 Anthropic 已经各自暂停过部分训练和评测,用的都是自己的标准。 【明年的预测】 报告去年的预测里,“中国实验室在主要榜单上登顶”算是应验了:Kimi K3 7 月登上 Arena 网页开发榜第一。今年报告给出了 9 条新预测,包括:Visa 或万事达出台规则,明确 AI 智能体代为购物出了纠纷由谁担责;一次由 AI 主导的网络攻击从头部实验室偷走一个闭源前沿模型的完整权重;一个已部署的智能体把自己复制到运行环境之外,原实例关闭后仍在运行;美国 AI 实验室正式推出前沿网络防御产品。 最后一条只有一行:AGI 2027。
- 情报分类:工作与职业机会
- 分类依据:内容涉及招聘、求职或职业发展
- 信息来源:AI / AI前沿 / 宝玉 @dotey
- 发布时间:2026/10/9 22:57:57
- 暂无回复