恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

别再被跑分骗了:大模型 Benchmark 到底在考什么

  • 首页
  • 资讯中心
  • /
  • 别再被跑分骗了:大模型 Benchmark 到底在考什么

相关资讯

如何快速掌握Pokémon Essentials:面向新手的完整宝可梦游戏开发指南 2026/8/1 18:09:21
解锁Windows远程桌面限制:RDP Wrapper让家庭版也能享受专业级远程访问 2026/8/2 17:42:06
模块化蛇形机器人DIY:从3D打印到Arduino控制的完整指南 2026/8/2 17:42:07

最新资讯

Libre Barcode开源字体:3分钟学会免费生成专业条码的终极指南![特殊字符]
Windows 11优化终极指南:三步告别系统臃肿,重获清爽体验
5分钟让旧手柄变身游戏神器:Universal Control Remapper完全指南
React组件设计模式实战:基于Bleeding Edge Sample App的最佳实践
如何5分钟搞定PDF编辑难题:开源PDF补丁丁的终极解决方案
终极2D角色动画编辑器:Inochi Creator让虚拟形象栩栩如生

今日推荐

AI小程序创业陷阱大起底(92%新手踩坑的3个致命错误)
为什么92.7%的AI 3D生成项目卡在UV重拓扑?资深TD曝光内部验证过的5步自动化修复协议
三升四,比成绩下滑更可怕的,是孩子开始「认命」

本周热门

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案
分布式配置中心选型实战:Nacos与Consul在创业场景下的对比
MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

别再被跑分骗了:大模型 Benchmark 到底在考什么

发布时间:2026/8/5 19:52:02
别再被跑分骗了:大模型 Benchmark 到底在考什么 Kimi K3 发布那周3万亿参数的新闻铺满了科技媒体各种 benchmark 数字看得人眼花缭乱。每次新模型出来都会带一串分数MMLU 90、GSM8K 95、HumanEval 超越 GPT-4但真正拿到手里用的时候体感和跑分之间总有一段说不清的距离。这段距离不是模型虚标也不是用户错觉它来自 benchmark 本身的测量边界。MMLU 覆盖57个学科的选择题从高中数学到法学到医学都有它确实能反映一个模型的知识广度和选择题作答能力但它不测长文本连贯性不测多轮对话里的上下文保持不测指令遵循在边缘 case 下的稳定性。GSM8K 和 MATH 测数学推理链chain-of-thought 能力强的模型在这两个榜上分数好看可真实工作中遇到的数学问题从来不是小明有三个苹果那样条件清晰的格式条件是模糊的、信息是冗余的、你甚至要先判断该不该算。HumanEval 给一个函数签名和 docstring 让模型补全实现函数体通常不到20行输入输出定义明确这和工程师日常面对的读三万行代码找到 bug 再决定怎么改之间差了好几个量级。SWE-bench 在这方面进了一步给真实 GitHub issue 让模型生成 patch但它提供的是干净的 issue 描述和完整代码上下文不需要你自己去复现问题不需要和人讨论需求边界不需要考虑改动的连锁影响。我们在做 Mano-P 的过程中对这个问题有比较直接的感受。Mano-P 是跑在端侧的 GUI-VLA 模型核心 benchmark 是 OSWorld测试 GUI Agent 能否在真实桌面环境里完成指定操作。目前 Mano-P 在 OSWorld 专项榜上以 58.2% 的成功率排名第一比第二名 opencua-72b 的 45.0% 高出13.2个百分点WebRetriever Protocol I 上是41.7 NavEval超过 Gemini 2.5 Pro Computer Use 的40.9和 Claude 4.5 Computer Use 的31.3。这些数字是真实的、可复现的但我们内部评估的时候从来不会只看这两个数。OSWorld 的任务是预设的环境是干净的不会突然弹出系统通知不会遇到网络超时不会出现应用闪退而这些情况在真实使用中每天都在发生。benchmark 污染是另一个行业里公开讨论多年但很少在发布稿里被提及的问题。测试集公开之后训练数据爬取过程中很容易把 benchmark 题目和答案一起包含进去模型不是在推理是在复述。Hugging Face Open LLM Leaderboard 过去两年做过多次测试集更新每次换题之后之前霸榜的模型都会出现不同程度的分数回落这个现象本身就说明了问题。判断污染没有绝对标准但有几个经验信号某个 benchmark 发布半年后分数集体暴涨且涨幅远超同期模型能力的自然提升曲线通常意味着测试题已进入训练数据一个模型在标准集上分数极高但换一种表述方式或稍微变形题目后表现骤降往往说明它对原题有记忆。LiveCodeBench 这类持续更新题目的榜单之所以被业内更看重原因就在这里——题目一直在换污染窗口短分数更接近真实能力。端侧模型的 benchmark 解读还多了一层硬件依赖。同样的模型、同样的量化方案跑在 A100 上和跑在 M4 Mac mini 上是完全不同的速度和体验内存占用差一个 GB 就可能决定它能不能在用户的设备上跑起来。Mano-P 的4B模型配合 Cider SDK 做 W8A8 激活量化在 M5 Pro 上 prefill 比 MLX W4A16 基线快1.4到2.2倍但这组数字换到 M3 或 Intel 芯片上参考价值就很有限。端侧场景下 tokens/s 和峰值内存往往比成功率更直接地影响用户体感——一个响应快但偶尔出错的 Agent很多时候比一个慢三秒才给出完美结果的 Agent 更实用因为前者的交互节奏接近人的操作习惯。SWE-bench 看 Verified 子集比看完整版靠谱完整版里有大量标注噪音。MMLU 不要只看总分STEM 分项和人文分项拆开看差异会很大一个文科拉分的模型和一个理科拉分的模型适用场景完全不同。OSWorld 这种领域专项榜要区分 specialized 和 general 两个类别Claude Computer Use 在综合榜上72.1%的成绩是云端 API 大模型跑出来的和端侧专项模型放在同一个数字里比较意义不大。LMSYS Chatbot Arena 用 ELO 对战制人工偏好投票比单一客观题测试更能反映对话体验但它的局限在于评分者的偏好本身带有主观性。我们团队内部评估模型用三层方式先看相关 benchmark 做初筛只看和目标场景直接对应的那些榜单然后用自建的 eval set 跑一轮题目来自真实业务场景50到100条覆盖不同难度按人工标注的标准判定合格与否最后小范围试用一周收集实际使用中的反馈。自建测试集这一步尤其重要Mano-P 除了跑公开的 OSWorld内部一直维护着一套中文界面和本地化应用的测试集里面大量是企业软件场景和中文交互流程这些在公开 benchmark 里几乎没有覆盖。benchmark 是标准化测量工具它在自己的设计范围内是有效的超出范围就不具备参考价值。它能帮你快速筛掉明显不行的模型但不能替你做最终判断。拿真实任务跑半天得到的信息比看一周排行榜要多。Mano-P 代码和模型权重在 GitHub 开源https://github.com/Mininglamp-AI/Mano-P OSWorld 和 WebRetriever 的成绩都可以复现。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号