我们随时都会听到美国最高法院是否维持一项法律,该法律将从本周日 (1月19日) 开始禁止 TikTok。Bloomberg 报道称,母公司字节跳动正在与 Elon Musk 接触。字节跳动已向美国员工保证他们的工作是安全的。因为这里有一个交易可以达成,可能会在周日之前。
Meta 终止了其在美国平台上的事实核查。他们将继续在巴西和其他法律要求的地方进行事实核查。事实到底是什么?这都是偏见的产物。在后真相时代,谁能说清什么是真相?让我们说出一个不常被讨论的事实:Facebook 是虚假信息、儿童贩运和暴力犯罪的温床。像 TikTok 和 AI 一样,Meta 应该受到监管。但现在他们已经明确表示要与 Elon (这个人无处不在) 和即将上任的政府合作,这种监管不太可能实现。Meta 向特朗普就职典礼捐赠了 100 万美元 (苹果 CEO Tim Cook 也是如此)。它用一位共和党人取代了自由派说客。他们将 UFC 的公开保守派领导人加入董事会。新政府将确保企业税率维持在低水平,而社交媒体和 AI 的监管仍停留在理论层面 — 即形同虚设。Meta 为政府做得越多,政府就会为 Meta 做得更多。
OpenAI 在 ChatGPT 中推出了一个名为"Tasks"的新测试功能,该功能将允许用户安排提醒和自动化操作,就像 Siri 未来可能做到的那样。这项功能仅向付费订阅者开放,支持一次性和重复性日程安排,最多可设置 10 个活动任务。用户可以设置常规更新,如天气或新闻,以及更个性化的自动化功能,如膳食计划或娱乐推荐。与传统的 Siri 或 Google Assistant 不同,Tasks 与 ChatGPT 的对话式 AI 集成,可以根据用户互动主动建议操作,但需要用户批准。要使用它,只需在模型选择器中选择"schedule tasks",定义任务并指定时间。任务管理可以在聊天线程中或网页专门区域进行,允许修改或取消。用户在任务完成时会通过网页、桌面和移动平台收到通知。
截至 2025 年 1 月,Beat Saber 仅在 Quest 平台上的销量就接近 1000 万份。这一估计基于游戏的"Pure"成就,表明大约 970 万用户在 Quest 上玩过这款游戏。考虑到 Beat Saber 在 2022 年有五个月与 Quest 2 购买捆绑销售,估计约 20% 的玩家通过这种促销获得了游戏。这表明约有 776 万份付费拷贝,以 30 美元的基础游戏价格计算,仅在 Quest 平台就产生了约 2.33 亿美元的收入。这个数字还不包括游戏大量付费 DLC 音乐包带来的额外收入。
好文章,需要你的鼓励
DeepResearchGym是一个创新的开源评估框架,专为深度研究系统设计,旨在解决当前依赖商业搜索API带来的透明度和可重复性挑战。该系统由卡内基梅隆大学研究团队开发,结合了基于ClueWeb22和FineWeb大型网络语料库的可重复搜索API与严格的评估协议。实验表明,使用DeepResearchGym的系统性能与使用商业API相当,且在评估指标间保持一致性。人类评估进一步证实了自动评估协议与人类偏好的一致性,验证了该框架评估深度研究系统的有效性。
这项研究介绍了FinTagging,首个面向大型语言模型的全面财务信息提取与结构化基准测试。不同于传统方法,它将XBRL标记分解为数值识别和概念链接两个子任务,能同时处理文本和表格数据。在零样本测试中,DeepSeek-V3和GPT-4o表现最佳,但在细粒度概念对齐方面仍面临挑战,揭示了当前大语言模型在自动化XBRL标记领域的局限性,为金融AI发展提供了新方向。
这项研究介绍了SweEval,一个新型基准测试,用于评估大型语言模型在企业环境中处理脏话的能力。研究团队从Oracle AI等多家机构的专家创建了一个包含八种语言的测试集,模拟不同语调和上下文的真实场景。实验结果显示,LLM在英语中较少使用脏话,但在印地语等低资源语言中更易受影响。研究还发现较大模型通常表现更好,且多语言模型如Llama系列在处理不当提示方面优于其他模型。这项工作对企业采用AI技术时的安全考量提供了重要参考。
这项研究提出了"VeriFree"——一种不需要验证器的方法,可以增强大型语言模型(LLM)的通用推理能力。传统方法如DeepSeek-R1-Zero需要验证答案正确性,限制了其在数学和编程以外领域的应用。VeriFree巧妙地计算正确答案在模型生成的推理过程后出现的概率,作为评估和训练信号。实验表明,这种方法不仅能匹配甚至超越基于验证器的方法,还大幅降低了计算资源需求,同时消除了"奖励黑客"问题。这一突破将有助于开发出在化学、医疗、法律等广泛领域具有更强推理能力的AI系统。