Cohere发布企业级视觉模型Command A Vision

加拿大AI公司Cohere发布了Command A Vision视觉模型，专门针对企业应用场景。该模型拥有1120亿参数，仅需两个GPU即可运行，能够处理图表、图形、扫描文档和PDF等企业常见视觉数据。在九项基准测试中，Command A Vision平均得分83.1%，超越了GPT-4.1、Llama 4等竞争对手。该模型采用开放权重系统，支持23种语言，旨在为企业提供成本优化的多模态AI解决方案。

随着深度研究功能和其他AI驱动分析的兴起，越来越多的模型和服务致力于简化这一流程，并能读取企业实际使用的更多文档。

加拿大AI公司Cohere正依靠其模型，包括新发布的视觉模型，来证明深度研究功能也应该针对企业用例进行优化。

该公司发布了Command A Vision，这是一个专门针对企业用例的视觉模型，基于其Command A模型构建。这个1120亿参数的模型能够"通过文档光学字符识别(OCR)和图像分析，从视觉数据中挖掘有价值的洞察，并做出高度准确的数据驱动决策"，该公司表示。

"无论是解读包含复杂图表的产品手册，还是分析现实场景照片进行风险检测，Command A Vision都能出色应对最具挑战性的企业视觉任务"，该公司在博客文章中说道。

这意味着Command A Vision能够读取和分析企业最常需要的图像类型：图表、图形、示意图、扫描文档和PDF。

由于基于Command A的架构构建，Command A Vision只需要两个或更少的GPU，就像文本模型一样。该视觉模型还保留了Command A的文本能力，能够读取图像上的文字并理解至少23种语言。Cohere表示，与其他模型不同，Command A Vision降低了企业的总体拥有成本，并且完全针对企业的检索用例进行了优化。

Cohere如何构建Command A

Cohere表示，它采用了Llava架构来构建Command A模型，包括视觉模型。这种架构将视觉特征转换为软视觉Token，可以分为不同的图块。

这些图块被传递到Command A文本塔，"一个密集的1110亿参数文本大语言模型"，该公司说。"以这种方式，单个图像最多消耗3328个Token。"

Cohere表示，它分三个阶段训练视觉模型：视觉-语言对齐、监督微调(SFT)和带有人类反馈的强化学习后训练(RLHF)。

"这种方法使图像编码器特征能够映射到语言模型的嵌入空间"，该公司说。"相比之下，在SFT阶段，我们在多样化的指令跟随多模态任务集上同时训练视觉编码器、视觉适配器和语言模型。"

企业AI的可视化

基准测试显示，Command A Vision在性能上超越了其他具有类似视觉能力的模型。

Cohere在九项基准测试中将Command A Vision与OpenAI的GPT 4.1、Meta的Llama 4 Maverick、Mistral的Pixtral Large和Mistral Medium 3进行了比较。该公司没有提及是否测试了针对Mistral专注于OCR的API Mistral OCR。

Command A Vision在ChartQA、OCRBench、AI2D和TextVQA等测试中得分超过其他模型。总体而言，Command A Vision的平均得分为83.1%，相比之下GPT 4.1为78.6%，Llama 4 Maverick为80.5%，Mistral Medium 3为78.3%。

目前大多数大语言模型都是多模态的，意味着它们可以生成或理解照片或视频等视觉媒体。然而，企业通常使用更多图形化文档，如图表和PDF，因此从这些非结构化数据源中提取信息往往困难重重。

随着深度研究的兴起，引入能够读取、分析甚至下载非结构化数据的模型的重要性不断增长。

Cohere还表示，它正在开放权重系统中提供Command A Vision，希望那些希望摆脱封闭或专有模型的企业开始使用其产品。到目前为止，开发者们表现出了一定的兴趣。

Q&A

Q1：Command A Vision是什么？它有什么特殊能力？

A：Command A Vision是Cohere公司发布的1120亿参数企业级视觉模型，专门针对企业用例设计。它能够通过文档光学字符识别(OCR)和图像分析从视觉数据中挖掘有价值的洞察，读取和分析图表、图形、示意图、扫描文档和PDF等企业常用图像类型。

Q2：Command A Vision相比其他模型有什么优势？

A：Command A Vision只需要两个或更少的GPU就能运行，降低了企业的总体拥有成本。在基准测试中，它的平均得分达到83.1%，超过了GPT 4.1的78.6%、Llama 4 Maverick的80.5%等竞争对手，并且支持至少23种语言。

Q3：Command A Vision采用了什么技术架构？

A：Command A Vision采用Llava架构构建，将视觉特征转换为软视觉Token并分为不同图块，然后传递到1110亿参数的文本大语言模型中处理。训练过程分为三个阶段：视觉-语言对齐、监督微调和带有人类反馈的强化学习后训练。

来源：VentureBeat

0赞

好文章，需要你的鼓励

Cohere发布企业级视觉模型Command A Vision

来源：VentureBeat

2025

08/04

08:16

分享

点赞

苹果在印度恢复银行卡支付功能，距暂停已逾四年

Bookshop.org确认今年将推出Kobo电子书阅读器支持

WeWard新增"步行模式"：走够步数才能解锁应用

X将通过私信通知用户其互动帖子被社区笔记纠错

"慢社交"应用Roost：让消息像真鸟一样飞行

Truecaller与印度电信监管机构就反垃圾电话规则展开公开交锋

Block与46州达成4500万美元和解，涉Cash App欺诈纠纷

欧盟威胁对Meta开出罚款，剑指Facebook和Instagram上瘾性设计

Disney+考虑推出免费流媒体内容层级

HyperTexting：将开放网络变成类社交媒体信息流的新应用

TV Time关闭之际，创始人打造新追剧应用Bingers

Telegram短链域名t.me因制裁合规问题短暂下线后已恢复

Deep Cogito发布四款开源混合推理大语言模型，具备自我改进"直觉"能力

Google DeepMind发布高精度地球AI模型AlphaEarth

这11种情况下千万别用ChatGPT

ServiceNow瞄准"数据地狱"，布局商业智能领域

Azure AI Speech升级：仅需几秒音频即可生成逼真语音克隆

Canonical重启TPM加密技术，Ubuntu 25.10版本即将支持

IOWN全光网络项目迎来五周年 与ITU签署合作协议

乐天移动选择思科、诺基亚、F5为5G SA网络合作伙伴

Meta投资千兆瓦数据中心打造"超级智能"实验室

光学基础设施为何成为AI未来发展核心

如果您非常迫切的想了解IT领域最新产品与技术信息，那么订阅至顶网技术邮件将是您的最佳途径之一

三一集团：数字化是必选项，AI是生存项

因湃电池 × 达索系统：如何共创出一套电池产业最佳实践

AI走进真实世界之后：安全、健康与产业的新命题

CES 2026

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点:

IOWN全光网络项目迎来五周年与ITU签署合作协议