Anthropic发布AI发展评估指标 呼吁全行业建立统一衡量体系

(原标题:Anthropic发布AI发展评估指标 呼吁全行业建立统一衡量体系)

大湾区经济网9月18日讯 AI安全公司Anthropic近日发布了一套全新的AI发展评估指标体系,旨在为行业提供一个客观、可量化的标准,衡量AI模型在能力、安全性和社会影响等维度的发展速度。

这套名为“AI Progress Metrics”的指标体系涵盖四大维度:能力基准、安全评估、环境影响和社会经济效应。Anthropic表示,当前AI行业缺乏统一的发展衡量标准,不同公司各自为政,导致外界难以准确评估AI技术的真实进展。

在能力基准方面,该指标体系涵盖了推理、数学、编程、语言理解、视觉感知等多个子维度,并引入了“能力加速度”的概念——不仅衡量模型当前的性能水平,还量化性能提升的速度。Anthropic的数据显示,过去18个月主流AI模型的综合能力提升幅度约为35%,但部分子领域(如复杂推理)的进步速度明显放缓。

安全评估维度是该指标体系的亮点。Anthropic提出了“安全-能力比”的概念,即在衡量模型能力的同时,量化其安全风险水平。数据显示,最新一代模型的安全-能力比相比两年前改善了约60%,但随着模型能力的持续提升,新的安全风险也在不断涌现。

Anthropic CEO达里奥·阿莫迪表示,发布这套指标的目的是推动全行业建立共识。“AI的发展速度不应该由各公司自行宣传,而应该由客观、可复现的指标来衡量。”他呼吁OpenAI、Google、Meta等主要AI公司共同参与到标准制定中来。

业内观察人士指出,缺乏统一的评估标准不仅导致企业间难以横向比较,也使得投资者在判断AI系统真实能力时面临巨大盲区。Anthropic此番率先提出框架性指标,某种程度上是在争夺行业话语权。后续能否获得主要竞争对手的响应和监管机构的认可,将决定这套体系能否真正发挥行业基准的作用。

目前,已有多家研究机构对该指标体系表示支持。斯坦福大学人工智能研究所表示,这套指标为AI发展的量化评估提供了有价值的框架,但建议进一步扩大评估样本量和测试场景的覆盖面。

文/王鹏飞,封面图/资料图

APP下载
广告
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-