Cohere 声称其新推出的 Aya Vision AI 模型是同类最佳

Cohere的非营利研究实验室本周发布了一款多模态“开放”AI模型Aya Vision，该实验室声称其为同类最佳。Aya Vision能够执行图像描述、回答照片相关问题、翻译文本以及生成23种主要语言的摘要等任务。Cohere还通过WhatsApp免费提供Aya Vision，称这是“使技术突破对全球研究人员可及的重要一步”。

Cohere for AI（AI 创业公司 Cohere 的非营利研究实验室）本周发布了一个多模态"开放"AI 模型 Aya Vision，实验室称其为同类最佳。

Aya Vision 可以执行图像说明写作、图片问答、文本翻译，以及在 23 种主要语言中生成摘要等任务。Cohere 还通过 WhatsApp 免费提供 Aya Vision 服务，称这是"让技术突破成果惠及全球研究人员的重要一步"。

"尽管 AI 取得了重大进展，但在不同语言间模型表现的差距仍然很大——这种差距在涉及文本和图像的多模态任务中更为明显，" Cohere 在博客文章中写道。"Aya Vision 旨在明确帮助缩小这一差距。"

Aya Vision 有两个版本：Aya Vision 32B 和 Aya Vision 8B。Cohere 表示，其中更为复杂的 Aya Vision 32B 开创了"新境界"，在某些视觉理解基准测试中的表现超过了 Meta 的 Llama-3.2 90B Vision 等两倍于其规模的模型。同时，根据 Cohere 的说法，Aya Vision 8B 在某些评估中的表现优于规模是其 10 倍的模型。

这两个模型都可以在 AI 开发平台 Hugging Face 上获取，采用创用 CC 4.0 许可证并附带 Cohere 的可接受使用附录。它们不能用于商业应用。

Cohere 表示，Aya Vision 使用"多样化"的英语数据集进行训练，实验室将这些数据集翻译并用于创建合成标注。标注（也称为标签）在训练过程中帮助模型理解和解释数据。例如，训练图像识别模型的标注可能是对物体的标记或指代图像中每个人、地点或物体的说明。

根据 Cohere 的说法，使用合成标注（即由 AI 生成的标注）训练 Aya Vision 使实验室能够在使用更少资源的同时实现具有竞争力的性能。

"这展示了我们对效率的关注，以及用更少的计算资源做更多事情的能力，" Cohere 在其博客中写道。"这也使我们能够为通常计算资源有限的研究社区提供更大的支持。"

除了 Aya Vision，Cohere 还发布了一个新的基准测试套件 AyaVisionBench，旨在测试模型在"视觉-语言"任务方面的能力，如识别两张图片之间的差异和将截图转换为代码。

AI 行业正处于所谓的"评估危机"之中，这是由于流行的基准测试给出的综合评分与大多数 AI 用户关心的任务熟练程度的相关性较差。Cohere 认为 AyaVisionBench 是解决这一问题的一步，提供了一个"广泛且具有挑战性"的框架来评估模型的跨语言和多模态理解能力。

希望事实确实如此。

"该数据集作为一个强大的基准，用于评估多语言和真实场景中的视觉-语言模型，" Cohere 研究人员在 Hugging Face 上的帖子中写道。"我们向研究社区开放这个评估集，以推进多语言多模态评估的发展。"

来源：Techcrunch

0赞

好文章，需要你的鼓励

Cohere 声称其新推出的 Aya Vision AI 模型是同类最佳

来源：Techcrunch

2025

03/05

18:27

分享

点赞

YouTube推出基于Gemini 3的创作者游戏制作工具

英伟达是唯一能负担免费提供AI模型的厂商

脑启发算法可大幅降低AI能耗

Mac办公桌升级必备配件指南：提升工作效率的最佳选择

PTC Windchill+ 助力 HOLON研发全球首批符合汽车行业标准的 L4 级电动汽车

航旅行业的AI“乘法效应”：迈向指数级进化

OpenAI推出GPT Image 1.5模型加速图像生成竞争

Zoom推出AI Companion 3.0智能体工作流程

ChatGPT成为互联网最受阻止的爬虫机器人

英伟达推出开源权重模型填补美国AI市场空白

Meta推出SAM Audio模型：AI音频分离新突破

英伟达推动数据中心增长，以太网交换机销售创纪录

AI 时代的数据中心：未来十年规划展望

AI 编程助手拒绝写代码，建议用户自学编程

超越 ChatGPT：通往通用人工智能的 5 大挑战

Oracle 在 AI 主流化方面具有重大优势

Snap 推出基于自研生成模型的 AI 视频滤镜

Google 的 Gemma 3：一款支持 128K 上下文窗口的开源单 GPU AI 模型

精灵宝可梦 GO 迎来新东家，而 Niantic 正借助 AI 和 AR 重塑地图业务

Google 的 Gemini 2.0 Flash 原生多模态 AI 图像生成功能给人留下深刻印象

Google 推出两款全新 AI 机器人控制模型

Nvidia 赢得了 AI 训练竞赛，但推理市场仍未尘埃落定

如果您非常迫切的想了解IT领域最新产品与技术信息，那么订阅至顶网技术邮件将是您的最佳途径之一

2025 re:Invent ：亚马逊云科技把Agentic AI生态梳理明白了

电子竞技瞬息万变，Team Liquid的“数据+AI”制胜秘籍

中国移动呼和浩特数据中心：只有高效存力先行，AI才能跑出全力

从“支撑工具”到“智能中枢”，AI原生ERP进化

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点: