Microsoft 开始测试 Windows 版 Copilot 的一项新更新,该更新将允许用户与 AI 助手分享屏幕或应用程序。Copilot Vision 最初仅限于 Microsoft Edge 浏览器使用,但现在已经扩展到电脑上的所有应用程序。
Copilot Vision 将能够实现多项功能,比如指导用户使用 Adobe Photoshop 的功能,或分析用户正在查看的照片和网页。在上周 Microsoft 50周年庆典上,我体验了 Windows 版 Copilot Vision 的早期版本,AI 助手指导我玩 Minecraft 游戏,并帮助优化 Microsoft Clipchamp 视频编辑器的设置。
由于 Microsoft 将测试范围限制在美国测试用户,我还未能在 Insider 测试版中完整体验 Windows 版的 Copilot Vision。Copilot 将能够高亮显示屏幕的特定部分来指导用户使用应用程序,不过这个初始测试版本尚未启用该功能。Copilot Vision 可能听起来与 Microsoft 的 Recall 功能(允许自动截屏)相似,但实际上它更像是在 Microsoft Teams 通话中分享应用程序或整个桌面。
Microsoft 还开始测试 Windows 版 Copilot 的文件搜索功能,允许用户向 AI 助手询问电脑中文件的内容。文件搜索支持 .docx、.xlsx、.pptx、.txt、.pdf、.json 文件格式,用户可以使用 Copilot 轻松找到最近处理过的文档。
这些 Copilot 功能只需要 Windows 版 Copilot 应用程序即可使用,无需完整的 Copilot Plus PC。用户还可以在 iOS 和 Android 上使用 Copilot Vision。Microsoft 已经开始在 Windows Insider 中测试这些新功能,预计将在未来几周或几个月内向所有 Windows 11 用户推出。
好文章,需要你的鼓励
PDF协会在欧洲会议上宣布,将在PDF规范中添加对JPEG XL图像格式的支持。尽管Chromium团队此前将该格式标记为过时,但此次纳入可能为JXL带来主流应用机会。PDF协会CTO表示,选择JPEG XL作为支持HDR内容的首选解决方案。该格式具备广色域、超高分辨率和多通道支持等优势,但目前仍缺乏广泛的浏览器支持。
华东理工大学团队开发了3DEditFormer系统和3DEditVerse数据集,首次实现了无需手工3D遮罩的高质量3D模型编辑。该技术通过双重引导注意力和时间自适应门控机制,让3D编辑变得像2D修图一样简单直观,在游戏开发、影视制作、AR/VR等领域具有广阔应用前景,标志着3D编辑技术向普及化迈出重要一步。
Ironclad OS项目正在开发一个新的类Unix操作系统内核,面向小型嵌入式系统,计划支持实时功能。该项目的独特之处在于采用Ada编程语言及其可形式化验证的SPARK子集进行开发,而非常见的C、C++或Rust语言。项目还包含运行在Ironclad内核上的完整操作系统Gloire,使用GNU工具构建以提供传统Unix兼容性。
上海AI实验室联合多所高校突破多模态AI训练难题,提出NaViL原生训练方法。通过预训练语言模型起点、混合专家架构和视觉-语言能力最佳平衡三大创新,在有限资源下实现与拼装式模型相当性能。该研究证明原生训练的可行性,为AI真正理解图文结合提供新思路,有望在教育、医疗等领域带来更自然的人机交互体验。