发生了什么
Anthropic公开了一组测量指标,目的是帮助公众了解前沿AI实验室内部的AI发展进度。公司表示,此举意在缩小前沿实验室所知与公众所知之间的信息差距。
数据显示,截至2026年8月,Claude主导了公司26%的AI研发工作,超过90%的任务自动化程度达到或高于“AI协作”级别。不过在所测量的全部AI研发工作子集中,Claude尚未实现完全自主运行。
8月份约有30,000个智能体同时在Anthropic内部从事研究和工程工作。在线监控系统在整个8月拦截了约0.002%的智能体决策,约相当于47,000次决策中的1次。
在7月13日至20日那一周,Anthropic约6%的AI研发算力被分配用于安全工作;同一周内,用于AI驱动型AI研发的算力中约12%投入了安全相关任务。
Anthropic还计划引入独立的第三方评估机构,使其能够访问内部流程和数据,负责验证安全实践、报告事故并监控关键指标。
为什么重要
前沿AI实验室的内部研发进展长期处于外界难以观察的状态,Anthropic主动披露指标,等于把一部分原本不透明的信息放到公众视野中。
从披露的数据看,AI已在研发工作中承担相当比例的任务,但完全自主运行尚未出现,这为外界判断当前自动化水平提供了一个具体的参照。
引入第三方评估机构若能真正获得内部流程和数据的访问权,可能改变安全实践由实验室自我报告的局面,但实际效果仍取决于评估机构的权限与独立性。
关键事实
截至2026年8月,Claude主导了Anthropic 26%的AI研发工作。
超过90%的任务自动化程度达到或高于“AI协作”级别。
在所有被测量的AI研发工作子集中,Claude尚未实现完全自主运行。
8月份约有30,000个智能体同时在Anthropic内部从事研究和工程工作。
在线监控系统在整个8月拦截了约0.002%的智能体决策,约相当于47,000次决策中的1次。
7月13-20日那一周,约6%的AI研发算力被分配用于安全工作。
同一周内,用于AI驱动型AI研发的算力中约12%被投入安全相关任务。
Anthropic计划引入独立第三方评估机构,负责验证安全实践、报告事故并监控关键指标。
接下来看什么
第三方评估机构能否真正获得内部流程和数据的访问权限,以及其评估结果是否会公开。
Anthropic后续是否会持续、定期更新这组指标,使公众能够观察其变化趋势。
其他前沿AI实验室是否会跟进披露类似指标,从而形成可比较的行业信息。
