你没听错,Claude现在可以像人一样用电脑了。
我说的用电脑,不是简单的API操作,而是它真能看屏幕,移动光标,点击按钮,甚至输入文字。
最重要的是,Claude的这些进步不仅仅是在炫技,而是真正让AI向着更实用、更贴近人类的方向发展。
想象一下,你的AI助手不仅可以帮你处理数据,还能直接操作电脑,完成一些复杂的多步骤任务,从此,你可以把更多精力放在真正创新的工作上,而不是被琐碎的操作束缚。
再说回Claude 3.5 Sonnet,这次的升级在代码能力上有巨大提升。
它在SWE-bench上的表现从33.4%提升到了49%,超过了所有公开模型。
尤其是工具使用和多步骤任务处理,比如GitLab,用它来处理DevSecOps任务,效率提升了10%,完全没有额外延迟。
Claude 的这次发布代表着AI开始从单纯的工具向真正的智能体进化。
未来有一天,或许每一台电脑、每一款应用,都会拥有自己的“智能思维”,帮助我们以一种全新的方式去探索世界,完成曾经不可能完成的任务。
这让我不禁想起一句话:“科技的终极使命,是帮助人类实现自我超越。”
Claude 3.5已经迈出了这一步,而接下来,等待我们的将是无限可能的未来。
你,准备好迎接它了吗?
好文章,需要你的鼓励
这项来自新加坡国立大学等机构的研究引入了REASONMAP,一个用于评估多模态大语言模型细粒度视觉理解能力的基准测试。研究团队使用来自13个国家30个城市的高分辨率交通地图,构建了1,008个问答对,设计了两级评估框架测量答案的正确性和质量。对15个流行模型的评估揭示了一个意外发现:开源领域的基础模型表现优于推理型模型,而闭源模型则相反。研究还表明,当视觉输入被遮盖时,模型性能普遍下降,证明真正的细粒度视觉推理任务仍需要有效整合多模态信息。
Nvidia公布2026财年一季度业绩,营收441亿美元,同比增长69%;新AI超算与显卡产品陆续亮相,尽管出口管控对H20业务造成影响,但整体AI市场前景依然乐观。
Cerebras WSE 芯片拥有 40 亿晶体管,推理速度达到 NVIDIA 集群的约 2.5 倍,刷新了全球 AI 推理速度记录,为复杂 AI 代理应用提供高性能计算支持。
这项研究提出了"B-score",一种新指标用于检测大语言模型中的偏见。研究人员发现,当模型能看到自己之前对同一问题的回答时(多轮对话),它能够减少偏见并给出更平衡的答案。B-score计算单轮与多轮对话中答案概率的差异,无需外部标注即可识别有偏见的回答。实验证明,将B-score用于回答验证可显著提高准确率,在标准基准测试上平均提升2.9个百分点。这一发现不仅提供了实用工具,还表明大语言模型具有自我纠正能力。