OpenAI在国际数学奥林匹克竞赛中取得了"金牌级别的表现",为人工智能的快速发展再添重要里程碑。OpenAI研究科学家Alexander Wei在社交媒体上发布消息称,一个实验性研究模型成功解决了这一"人工智能领域长期存在的重大挑战"。
据Wei介绍,OpenAI一款未发布的模型能够解决这项世界上历史最悠久、最负盛名的数学竞赛中六道题目中的五道,总共获得42分中的35分。国际数学奥林匹克竞赛(IMO)由各国选派最多六名学生参赛,解决极其困难的代数和微积分预备知识问题。这些练习题看似简单,但通常需要一定的创造性才能在每道题上获得最高分。在今年的竞赛中,630名参赛者中只有67人获得金牌,约占总人数的10%。
人工智能通常被用来处理复杂数据集和重复性任务,但在解决需要更多创造性或复杂决策的问题时往往表现不佳。然而,通过最新的IMO竞赛,OpenAI表示其模型能够运用类似人类的推理能力处理复杂的数学问题。
Wei在社交媒体上写道:"通过这样做,我们获得了一个能够构建精密、严密论证的模型,其水平达到了人类数学家的程度。" Wei和OpenAI首席执行官Sam Altman都表示,公司预计在未来几个月内不会发布具有这种数学能力水平的产品。这意味着即将推出的GPT-5相比前代产品会有所改进,但不会具备在IMO竞赛中竞争的同等令人印象深刻的能力。
好文章,需要你的鼓励
PDF协会在欧洲会议上宣布,将在PDF规范中添加对JPEG XL图像格式的支持。尽管Chromium团队此前将该格式标记为过时,但此次纳入可能为JXL带来主流应用机会。PDF协会CTO表示,选择JPEG XL作为支持HDR内容的首选解决方案。该格式具备广色域、超高分辨率和多通道支持等优势,但目前仍缺乏广泛的浏览器支持。
Meta研究团队发现仅仅改变AI示例间的分隔符号就能导致模型性能产生高达45%的巨大差异,甚至可以操纵AI排行榜排名。这个看似微不足道的格式选择问题普遍存在于所有主流AI模型中,包括最先进的GPT-4o,揭示了当前AI评测体系的根本性缺陷。研究提出通过明确说明分隔符类型等方法可以部分缓解这一问题。
Ironclad OS项目正在开发一个新的类Unix操作系统内核,面向小型嵌入式系统,计划支持实时功能。该项目的独特之处在于采用Ada编程语言及其可形式化验证的SPARK子集进行开发,而非常见的C、C++或Rust语言。项目还包含运行在Ironclad内核上的完整操作系统Gloire,使用GNU工具构建以提供传统Unix兼容性。
香港中文大学研究团队开发出CALM训练框架和STORM模型,通过轻量化干预方式让40亿参数小模型在优化建模任务上达到6710亿参数大模型的性能。该方法保护模型原生推理能力,仅修改2.6%内容就实现显著提升,为AI优化建模应用大幅降低了技术门槛和成本。