返回快讯列表
行业动态

Anthropic 首次量化公开 AI 研发自动化进度:Claude 主导 26% 研发,压力甩给 OpenAI 等竞品

当地时间9月17日,Anthropic 发文,第一次以量化方式掀开了内部 AI 研发自动化的底牌。数据相当扎眼:截至今年8月,Claude 已主导公司内部26% 的 AI 研发工作,而今年2月这一比例还不足1%;公司内部 Agent 平台任意时刻约有3万个 AI Agent 在跑,8月产生超过10亿次决策。这组数字被外界视为递归自我改进(RSI)从概念走向工程现实的关键信号。

当地时间9月17日,Anthropic 发文,第一次以量化方式掀开了内部 AI 研发自动化的底牌。数据相当扎眼:截至今年8月,Claude 已主导公司内部26% 的 AI 研发工作,而今年2月这一比例还不足1%;公司内部 Agent 平台任意时刻约有3万个 AI Agent 在跑,8月产生超过10亿次决策。这组数字被外界视为递归自我改进(RSI)从概念走向工程现实的关键信号。

Anthropic 采用了独立 AI 研究机构 Epoch AI 提出的六级自动化框架,把 AI 的参与程度划分为 AL0至 AL5——AL0完全没有 AI 参与,AL3是 AI 协作,AL4是 AI 主导,AL5为完全自主。截至8月,26% 的 AI 研发工作达到 AL4:人类只需给出高层目标,Claude 就能完成端到端的大部分工作,人只负责监督、检查和最终拍板;另有超过90% 的研发工作至少达到 AL3。

一个具体场景很能说明问题:夜间数据管道出故障后,工程师只需把报告丢给 Claude 说一句"把它修好",它就能自主查看日志、定位原因、编写修复代码、测试、处理新冒出来的问题,最后重跑管道、对比结果并撰写说明。但 Anthropic 也明确划了线——目前尚未有任何被测量的 AI 研发工作达到 AL5完全自主水平。

规模数据更为实在。截至8月,Anthropic 内部约3万个 Agent 从事研究和工程工作,它们拥有独立于底层模型升级的身份标识,通过共享消息系统互相委派任务、交叉纠错。安全监控上,所有 Agent 动作执行前都要过在线监控,8月超10亿次决策中约0.002% 被阻止;离线监控每周标记约10万条对话记录,经分类器过滤误报和初步审查后,最高优先级约50条升级到人工审查。算力分配方面,7月样本周内约6% 的 AI 研发算力投入安全研究,若只统计 AI 驱动的研发,这一比例升至约12%。Anthropic 也坦承,AI 协作与 AI 主导的边界存在主观性,跨实验室比较需要统一方法和第三方验证。

RSI 眼下已是行业最热的概念。昨日智谱创始人唐杰披露,GLM-5.3-Flash 两周内完成国产加速器全量部署,大部分工作由 GLM-5.3驱动的 Infra Agent 完成;他判断距离完全 RSI 尚远,但"模型优化系统、系统服务模型"的循环已经开始运转。OpenAI 则在9月初宣布达成自动化 AI 研究实习生里程碑,目标2028年3月前实现自动化 AI 研究员,最薄弱的环节仍是"决定做什么"——任务超过4小时就需要人类频繁介入。谷歌 DeepMind 的进化式编码智能体 AlphaEvolve 从算法进化切入,其提出的电路方案已集成进下一代 TPU,谷歌前首席科学家杰夫·迪恩称之为"TPU 大脑帮助设计下一代 TPU 身体"的最新案例。

谷歌 DeepMind 首席战略官贾吉特·塞洪此前的一句话点透了底层逻辑:RSI 正成为 AI 资本开支的核心投资逻辑,虽然当前 AI 收入还撑不起正在投入的资本开支,但不下注 RSI 并不明智。

Anthropic 这次把数字摆上台面,一面是想在人类仍握主导权的窗口期,让社会参与决定 AI 自我迭代的节奏与方向;另一面,则是给行业立下一个可参照的披露基准——当研发自动化比例、Agent 规模、算力投入占比和安全监控覆盖率都被公开,透明度本身就变成了无声的竞争压力,不跟进就可能被当成有意遮掩。

更多快讯