What happened
Anthropic公开了一组测量指标,目的是帮助公众了解前沿AI实验室内部的AI发展进度。公司表示,此举意在缩小前沿实验室所知与公众所知之间的信息差距。
数据显示,截至2026年8月,Claude主导了该公司26%的AI研发工作,超过90%的任务自动化程度达到或高于“AI协作”级别。不过,在所有被测量的AI研发工作子集中,Claude尚未实现完全自主运行。
8月份约有30,000个智能体同时在Anthropic内部从事研究和工程工作。在线监控系统在整个8月期间拦截了约0.002%的智能体决策,相当于约47,000次决策中拦截1次。
在7月13日至20日那一周,Anthropic约6%的AI研发算力被分配用于安全工作;同一周内,用于AI驱动型AI研发的算力中约12%投入了安全相关任务。
Anthropic还计划引入独立的第三方评估机构,使其能够访问内部流程和数据,由第三方负责验证安全实践、报告事故并监控关键指标。
Why it matters
前沿AI实验室的内部研发进度长期缺乏对外可见的衡量标准,Anthropic此次公开指标,等于把“实验室知道什么”部分转化为“公众能看到什么”,这与其缩小信息差距的目标一致。
从披露的数字看,AI已在研发流程中承担相当比例的工作,但完全自主运行尚未出现在被测量的子集中,这说明当前阶段的人机分工仍以协作和监控为主。
安全算力占比和监控拦截率这类指标,为外界评估实验室安全投入提供了可比较的锚点;而引入第三方评估,则可能影响未来外界对这类自我披露数据的信任程度。
Key facts
截至2026年8月,Claude主导了Anthropic 26%的AI研发工作。
超过90%的任务自动化程度达到或高于“AI协作”级别。
在所有被测量的AI研发工作子集中,Claude尚未实现完全自主运行。
8月份约有30,000个智能体同时在Anthropic内部从事研究和工程工作。
在线监控系统在整个8月拦截了约0.002%的智能体决策,约合47,000次决策中1次。
7月13日至20日那一周,约6%的AI研发算力用于安全工作。
同一周内,用于AI驱动型AI研发的算力中约12%投入安全相关任务。
Anthropic计划引入独立第三方评估机构,访问内部流程和数据,验证安全实践、报告事故并监控关键指标。
What to watch next
第三方评估机构能否真正获得内部流程和数据的访问权限,以及其验证结果是否会对外公开,将决定这套指标是自我披露还是可被独立核验。
后续月份中Claude在研发工作中的占比、智能体数量以及监控拦截率是否变化,可作为观察AI研发自动化程度走向的参考。
安全算力占比这一指标是否会持续披露并形成趋势,关系到外界能否判断安全投入相对于研发投入的消长。
