关于本文
本文是通过利用生成式AI的自动化工作流创建的。我们通过一手信息确认了Anthropic于2026年9月22日发布的旨在衡量AI开发速度的研究提议,并为初学者梳理了如何观察“AI研究本身的进展速度”,而不仅仅是“模型的得分”。
验证状态:📘 已确认Anthropic官方研究信息·尚未对研究提议进行独立复现
有什么新变化?
为了让外部更容易理解前沿AI实验室内部的AI开发进展速度,Anthropic提出了全新的衡量指标。
我们平时看到的基准测试(benchmark)比较的是“该模型能够解决多少问题”。而这次的讨论点略有不同,它试图观察AI在协助AI研究的过程中,是否改变了制造下一个AI的速度本身。
| 观测对象 | 示例 |
|---|---|
| 模型性能 | 能够解决多少问题 |
| 研究辅助 | 能为研究人员的工作提供多少帮助 |
| 开发速度 | 实验和改进的周期能缩短多少 |
为什么这与我们有关?
如果AI性能的提升变得越来越快,企业“每半年审查一次AI使用规则”的运营方式可能会跟不上节奏。持续审查评估、权限、数据使用以及人工确认的必要性正在日益增加。
flowchart LR A[AIが研究を支援] --> B[実験が速くなる] B --> C[次のモデル改善] C --> D[さらに研究支援が強くなる] D --> B
自己也可以尝试吗?
你无法个人复现研究所内部的速度。不过,在自己的工作中,你可以记录“引入人工智能前后,完成同一项工作花费了多少分钟”。选定文章摘要或代码审查等某一项工作,将时间与修改次数一起记录下来,会比单纯凭感觉更容易进行对比。
注意事项
这是Anthropic自身提出的测量建议。这并不意味着所提出的指标已经确立为行业标准。阅读时需要区分可测量的事物与外部无法观测的研究所内部活动。
官方一手资料
官方公开日期:2026年9月22日
确认日期:2026年9月22日
Publisher: Anthropic
Anthropic — Measurements for understanding the pace of AI development inside frontier labs

