看起来本周是小型 AI 模型的风头时刻。
周四,非营利 AI 研究机构 Ai2 发布了 Olmo 2 1B,这是一款拥有 10 亿参数的模型。Ai2 声称,在多个基准测试中,Olmo 2 1B 的表现超越了 Google、Meta 和阿里巴巴等公司推出的同等规模模型。参数(有时称为权重)是模型内部用于指导其行为的组成部分。
Olmo 2 1B 采用宽松的 Apache 2.0 许可证通过 AI 开发平台 Hugging Face 发布。与大多数模型不同,Olmo 2 1B 可以从零开始复现;Ai2 已经提供了用于开发该模型的代码和数据集 ( Olmo-mix-1124 , Dolmino-mix-1124 )。
虽然小型模型在能力上可能不及那些巨型模型,但重要的是,它们不需要高性能硬件运行。这使得开发人员和爱好者在面对较低端以及消费级设备的限制时,更容易使用它们。
在过去几天中,陆续发布了许多小型模型,包括 Microsoft 的 Phi 4 推理系列和 Qwen 的 2.5 Omni 3B。这些模型中的大多数——以及 Olmo 2 1B——都可以轻松在现代笔记本甚至移动设备上运行。
Ai2 表示,Olmo 2 1B 使用了由公开可用、AI 生成及人工创建的资料构成的 4 万亿 Token 数据集进行训练。Token 是模型接收并生成的原始数据单位—— 100 万个 Token 大约相当于 75 万个单词。
在衡量算术推理能力的基准测试 GSM8K 上,Olmo 2 1B 的得分优于 Google 的 Gemma 3 1B、Meta 的 Llama 3.2 1B 以及阿里巴巴的 Qwen 2.5 1.5B。在 TruthfulQA (一项评估事实准确性的测试)上,Olmo 2 1B 的表现同样超越了这三款模型。
不过,Ai2 警告称 Olmo 2 1B 也存在一定风险。该组织表示,像所有 AI 模型一样,它可能会产生“问题输出”,包括有害及“敏感”内容,以及事实不准确的陈述。因此,Ai2 建议不要在商业环境中部署 Olmo 2 1B。
好文章,需要你的鼓励
穆拉蒂时隔18个月首次接受重大媒体采访,介绍其创立的Thinking Machines Lab正在开发的"交互模型"。该模型能以200毫秒间隔处理音频、文本和视频流,捕捉人类交流中的中断、修正和停顿。她还谈及OpenAI"政变周"经历,强调行业决策权过于集中的担忧,并回应了公司近期研究人员离职问题,表示这是初创实验室的正常波动。
STATE16研究院这篇综述发现,物理AI系统存在"静默失效"风险——AI以高度自信执行基于错误世界信息的动作,却不触发任何报警,并提出在AI输出与物理执行之间建立独立授权层的框架。
本期《Quick Charge》播客涵盖多个热点话题:特斯拉疑似试图删除FSD欺诈相关证据以规避巨额赔付;卡特彼勒持续推进建筑领域电气化布局;住宅太阳能30%税收抵免即将到期。此外,嘉宾Tom Pacheco就高压系统与电池技术培训展开探讨,强调电动车技术人才培养的紧迫性。节目同时提醒有意安装太阳能的用户尽快行动,可通过EnergySage平台比较多家安装商报价。
UIUC与微软联合研发的OpenWebRL框架让4B小模型仅凭400条初始数据,通过在真实网站上边做边学的强化学习方式,在网页智能体基准上超越了用27万条数据训练的竞争对手。