微软于周一宣布,其 Copilot AI 助手迎来了重大升级,集成了 OpenAI 的 GPT-4o 模型,从而支持高级图像生成能力。此次更新让用户只需用文字描述所需图像,即可在 Microsoft 365 应用(包括 Word、Excel 和 Outlook)内直接创建精细化的视觉效果。
另见: Microsoft 告别 Skype:这款标志性应用在推出 23 年后正式关闭
Copilot 是什么?
Microsoft Copilot 是集成于 Microsoft 365 应用(如 Word、Excel、PowerPoint、Outlook 和 Teams)中的 AI 助手。
借助 GPT-4o 等大语言模型,Copilot 能够起草文档、分析数据、制作演示文稿以及管理电子邮件和会议。此次更新使得 Copilot 现在也能根据文字描述生成图像。
我可以用 Copilot 的 AI 图像生成功能做什么?
集成了 OpenAI 最新的 AI 模型 GPT-4o 后,Copilot 能够将文本描述转换为高质量、逼真的照片级图像,大大扩展了用户在视觉内容上的应用范围。用户可以无需借助外部设计工具,就生成定制的图形、插图和设计作品。用户还可以修改现有视觉内容、应用样式转换,并在图像中生成清晰可辨的文本。
微软最初于上个月通过 Microsoft 365 Copilot 向企业用户逐步推出了这些 GPT-4o 图像生成工具。如今,同样的功能也通过面向消费者的 Microsoft Copilot 推向了大众市场。
另见: OpenAI 推出全新 GPT-4.1 模型,本月末将停用 GPT-4
这一步骤使 Microsoft Copilot 超越了诸如 Microsoft Designer 和 Image Creator 等其他创意工具,这些工具仍依赖于 OpenAI 较旧的 DALL-E 模型。相比之下,GPT-4o 代表了 AI 图像生成的尖端技术,具备更快的响应速度和更精细的输出效果。
通过这些增强功能,微软正致力于将 Copilot 打造成一款全面的 AI 助手,以在市场上与 OpenAI 和 Google Gemini 等重量级竞争对手抗衡。
好文章,需要你的鼓励
很多人担心被AI取代,陷入无意义感。按照杨元庆的思路,其实无论是模型的打造者,还是模型的使用者,都不该把AI放在人的对立面。
MIT研究团队提出递归语言模型(RLM),通过将长文本存储在外部编程环境中,让AI能够编写代码来探索和分解文本,并递归调用自身处理子任务。该方法成功处理了比传统模型大两个数量级的文本长度,在多项长文本任务上显著优于现有方法,同时保持了相当的成本效率,为AI处理超长文本提供了全新解决方案。
谷歌宣布对Gmail进行重大升级,全面集成Gemini AI功能,将其转变为"个人主动式收件箱助手"。新功能包括AI收件箱视图,可按优先级自动分组邮件;"帮我快速了解"功能提供邮件活动摘要;扩展"帮我写邮件"工具至所有用户;支持复杂问题查询如"我的航班何时降落"。部分功能免费提供,高级功能需付费订阅。谷歌强调用户数据安全,邮件内容不会用于训练公共AI模型。
华为研究团队推出SWE-Lego框架,通过混合数据集、改进监督学习和测试时扩展三大创新,让8B参数AI模型在代码自动修复任务上击败32B对手。该系统在SWE-bench Verified测试中达到42.2%成功率,加上扩展技术后提升至49.6%,证明了精巧方法设计胜过简单规模扩展的技术理念。