Cohere 声称其新推出的 Aya Vision AI 模型是同类最佳

Cohere的非营利研究实验室本周发布了一款多模态“开放”AI模型Aya Vision，该实验室声称其为同类最佳。Aya Vision能够执行图像描述、回答照片相关问题、翻译文本以及生成23种主要语言的摘要等任务。Cohere还通过WhatsApp免费提供Aya Vision，称这是“使技术突破对全球研究人员可及的重要一步”。

Cohere for AI（AI 创业公司 Cohere 的非营利研究实验室）本周发布了一个多模态"开放"AI 模型 Aya Vision，实验室称其为同类最佳。

Aya Vision 可以执行图像说明写作、图片问答、文本翻译，以及在 23 种主要语言中生成摘要等任务。Cohere 还通过 WhatsApp 免费提供 Aya Vision 服务，称这是"让技术突破成果惠及全球研究人员的重要一步"。

"尽管 AI 取得了重大进展，但在不同语言间模型表现的差距仍然很大——这种差距在涉及文本和图像的多模态任务中更为明显，" Cohere 在博客文章中写道。"Aya Vision 旨在明确帮助缩小这一差距。"

Aya Vision 有两个版本：Aya Vision 32B 和 Aya Vision 8B。Cohere 表示，其中更为复杂的 Aya Vision 32B 开创了"新境界"，在某些视觉理解基准测试中的表现超过了 Meta 的 Llama-3.2 90B Vision 等两倍于其规模的模型。同时，根据 Cohere 的说法，Aya Vision 8B 在某些评估中的表现优于规模是其 10 倍的模型。

这两个模型都可以在 AI 开发平台 Hugging Face 上获取，采用创用 CC 4.0 许可证并附带 Cohere 的可接受使用附录。它们不能用于商业应用。

Cohere 表示，Aya Vision 使用"多样化"的英语数据集进行训练，实验室将这些数据集翻译并用于创建合成标注。标注（也称为标签）在训练过程中帮助模型理解和解释数据。例如，训练图像识别模型的标注可能是对物体的标记或指代图像中每个人、地点或物体的说明。

根据 Cohere 的说法，使用合成标注（即由 AI 生成的标注）训练 Aya Vision 使实验室能够在使用更少资源的同时实现具有竞争力的性能。

"这展示了我们对效率的关注，以及用更少的计算资源做更多事情的能力，" Cohere 在其博客中写道。"这也使我们能够为通常计算资源有限的研究社区提供更大的支持。"

除了 Aya Vision，Cohere 还发布了一个新的基准测试套件 AyaVisionBench，旨在测试模型在"视觉-语言"任务方面的能力，如识别两张图片之间的差异和将截图转换为代码。

AI 行业正处于所谓的"评估危机"之中，这是由于流行的基准测试给出的综合评分与大多数 AI 用户关心的任务熟练程度的相关性较差。Cohere 认为 AyaVisionBench 是解决这一问题的一步，提供了一个"广泛且具有挑战性"的框架来评估模型的跨语言和多模态理解能力。

希望事实确实如此。

"该数据集作为一个强大的基准，用于评估多语言和真实场景中的视觉-语言模型，" Cohere 研究人员在 Hugging Face 上的帖子中写道。"我们向研究社区开放这个评估集，以推进多语言多模态评估的发展。"

来源：Techcrunch

0赞

好文章，需要你的鼓励

Cohere 声称其新推出的 Aya Vision AI 模型是同类最佳

来源：Techcrunch

2025

03/05

18:27

分享

点赞

“4个9”韧性的背后，西云数据以技术与运营加速企业数字化创新

Google力推手机AI功能引发关注

Meta发布AI翻译功能，支持脸书和Instagram内容实时转换

HPE发布Nvidia Blackwell驱动的AI服务器，抢占AI市场需求

ISACA推出AI安全管理高级认证项目

谷歌推出智能体SOC系统提升安全事件响应速度

Lumen升级400GB数据中心连接基础设施助力AI发展

AI和流媒体推动，2030年面临"网络危机"

Pine64停产Pro手机转向RISC-V业务

日立Vantara将VSP One块存储扩展至Azure云平台

Finchetto光学数据包交换机：光无法存储的技术挑战与突破

Python开发者调查显示增长强劲，但基金会资金面临困境

AI 时代的数据中心：未来十年规划展望

AI 编程助手拒绝写代码，建议用户自学编程

超越 ChatGPT：通往通用人工智能的 5 大挑战

Oracle 在 AI 主流化方面具有重大优势

Snap 推出基于自研生成模型的 AI 视频滤镜

Google 的 Gemma 3：一款支持 128K 上下文窗口的开源单 GPU AI 模型

精灵宝可梦 GO 迎来新东家，而 Niantic 正借助 AI 和 AR 重塑地图业务

Google 的 Gemini 2.0 Flash 原生多模态 AI 图像生成功能给人留下深刻印象

Google 推出两款全新 AI 机器人控制模型

Nvidia 赢得了 AI 训练竞赛，但推理市场仍未尘埃落定

如果您非常迫切的想了解IT领域最新产品与技术信息，那么订阅至顶网技术邮件将是您的最佳途径之一

关于AI Agent落地，李开复强调了两件事：“价值交付”和“一把手工程”

AWS re:Inforce：费城这天不只拼进球，还拼生成式AI安全

在欧洲之门马德里，我们再次见证了SAP激活企业增长的“飞轮”

IEEE专家委员胡凝：消解AI幻觉“阴影”，洞见“超级个体”价值锚点

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点: