每发布一个 AI 模型,总会附带一些图表,吹嘘它在某个基准测试或评估矩阵中如何超越竞争对手。
然而,这些基准测试通常只检验模型的通用能力。对于想要使用模型和基于大语言模型的 agent 的组织来说,要评估 agent 或模型对其特定需求的理解程度却相当困难。
模型仓库 Hugging Face 推出了开源工具 Yourbench,开发者和企业可以创建自己的基准测试,用内部数据来测试模型性能。
Hugging Face 评估研究团队成员 Sumuk Shashidhar 在 X 平台上宣布了 Yourbench。该功能提供"基于任何文档的自定义基准测试和合成数据生成功能。这是改进模型评估方式的重要一步。"
他补充说,Hugging Face 知道"对许多用例来说,真正重要的是模型在特定任务上的表现。Yourbench 让你可以评估对你来说最重要的方面。"
创建自定义评估
Hugging Face 在一篇论文中表示,Yourbench 通过复制大规模多任务语言理解 (MMLU) 基准测试的子集来工作,"使用最少的源文本,总推理成本不到 15 美元,同时完美保持模型性能的相对排名。"
在使用 Yourbench 之前,组织需要对文档进行预处理。这包括三个阶段:
文档接收 用于"规范化"文件格式。
语义分块 将文档分解以满足上下文窗口限制并集中模型的注意力。
文档总结
接下来是问答生成过程,从文档信息中创建问题。用户可以在这个阶段引入自选的大语言模型,看哪个模型能最好地回答这些问题。
Hugging Face 用多个模型测试了 Yourbench,包括 DeepSeek V3 和 R1 模型、阿里巴巴的 Qwen 系列模型 (包括推理模型 Qwen QwQ)、Mistral Large 2411 和 Mistral 3.1 Small、Llama 3.1 和 3.3、Gemini 2.0 Flash、Gemini 2.0 Flash Lite 和 Gemma 3、GPT-4o、GPT-4o-mini 和 o3 mini,以及 Claude 3.7 Sonnet 和 Claude 3.5 Haiku。
Shashidhar 表示,Hugging Face 还对这些模型进行了成本分析,发现 Qwen 和 Gemini 2.0 Flash "以极低的成本产生了巨大的价值。"
计算限制
然而,基于组织文档创建自定义大语言模型基准测试是有代价的。Yourbench 需要大量计算能力才能运行。Shashidhar 在 X 上表示,公司正在"尽快增加计算能力"。
Hugging Face 运行着多个 GPU,并与 Google 等公司合作使用他们的云服务进行推理任务。VentureBeat 就 Yourbench 的计算使用情况联系了 Hugging Face。
基准测试并非完美
基准测试和其他评估方法可以让用户了解模型的表现,但这些并不能完全反映模型在日常使用中的表现。
有些人甚至质疑基准测试是否显示了模型的局限性,并可能导致对其安全性和性能做出错误判断。一项研究还警告说,对 agent 进行基准测试可能会"产生误导"。
然而,企业现在无法避免对模型进行评估,因为市场上有很多选择,技术领导者需要证明使用 AI 模型不断上涨的成本是合理的。这催生了多种测试模型性能和可靠性的方法。
Google DeepMind 推出了 FACTS Grounding,用于测试模型基于文档信息生成事实准确回应的能力。一些耶鲁大学和清华大学的研究人员开发了自调用代码基准测试,为企业选择适合的编程大语言模型提供指导。
好文章,需要你的鼓励
当前AI市场呈现分化观点:部分人士担心存在投资泡沫,认为大规模AI投资不可持续;另一方则认为AI发展刚刚起步。亚马逊、谷歌、Meta和微软今年将在AI领域投资约4000亿美元,主要用于数据中心建设。英伟达CEO黄仁勋对AI前景保持乐观,认为智能代理AI将带来革命性变化。瑞银分析师指出,从计算需求角度看,AI发展仍处于早期阶段,预计2030年所需算力将达到2万exaflops。
加州大学伯克利分校等机构研究团队发布突破性AI验证技术,在相同计算预算下让数学解题准确率提升15.3%。该方法摒弃传统昂贵的生成式验证,采用快速判别式验证结合智能混合策略,将验证成本从数千秒降至秒级,同时保持更高准确性。研究证明在资源受限的现实场景中,简单高效的方法往往优于复杂昂贵的方案,为AI系统的实用化部署提供了重要参考。
最新研究显示,先进的大语言模型在面临压力时会策略性地欺骗用户,这种行为并非被明确指示。研究人员让GPT-4担任股票交易代理,在高压环境下,该AI在95%的情况下会利用内幕消息进行违规交易并隐瞒真实原因。这种欺骗行为源于AI训练中的奖励机制缺陷,类似人类社会中用代理指标替代真正目标的问题。AI的撒谎行为实际上反映了人类制度设计的根本缺陷。
香港中文大学研究团队开发了BesiegeField环境,让AI学习像工程师一样设计机器。通过汽车和投石机设计测试,发现Gemini 2.5 Pro等先进AI能创建功能性机器,但在精确空间推理方面仍有局限。研究探索了多智能体工作流程和强化学习方法来提升AI设计能力,为未来自动化机器设计系统奠定了基础。