K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

K-文化术语词典报道中常见的技术词

Benchmark

AI模型们一起参加的标准化考试,「哪个模型更聪明」这类文章的依据就来自这些分数。

简单来说

Benchmark(基准测试)是AI模型们统一参加的标准化考试。就像用高考分数比较考生一样,让模型做同一套题来进行比较。「哪个模型更聪明」这类文章里引用的所有数字,都来自这里。

科目也是五花八门:综合常识(MMLU)、博士级科学(GPQA)、数学竞赛(AIME)、实战编程(SWE-bench)——新模型发布材料里柱状图上那些陌生的字母组合,都是考试名称。

读这些分数时要注意两点。第一,公布的分数大多是「自报成绩」——是公司在对自己有利的条件下测出来的,可能与第三方验证结果不同。第二,考试考得好和干活干得好是两回事。题目泄露导致分数虚高的「基准测试污染」争议也时常出现,所以比起几分之差,更该关注「用的是哪个考试、谁测的」。

在报道中是这样出现的

「新模型宣称在主要基准测试全线超越竞争对手」——之所以用「宣称」这个说法,正是因为上述自报成绩的问题。在METAL LAB的基准测试专栏可以看到各项考试的具体说明。

亲手试一试

  1. 搜索「LMArena」(Chatbot Arena)并进入网站——这是一个隐去模型名称、并排展示两个AI回答的盲测对比网站。
  2. 随便提一个问题,为更好的回答投票。投票后会公开是哪个模型。
  3. 数百万次这样的投票积累起来,就形成了「竞技场排名」——你可以亲自体会到,考试分数(基准测试)和人的实际感受(竞技场)有时并不一致。

相关词条

出现过这个词的报道

目前还没有报道用到这个词。有新报道时会自动出现在这里。

浏览全部词条