Cohere for AI(AI 创业公司 Cohere 的非营利研究实验室)本周发布了一个多模态"开放"AI 模型 Aya Vision,实验室称其为同类最佳。
Aya Vision 可以执行图像说明写作、图片问答、文本翻译,以及在 23 种主要语言中生成摘要等任务。Cohere 还通过 WhatsApp 免费提供 Aya Vision 服务,称这是"让技术突破成果惠及全球研究人员的重要一步"。
"尽管 AI 取得了重大进展,但在不同语言间模型表现的差距仍然很大——这种差距在涉及文本和图像的多模态任务中更为明显," Cohere 在博客文章中写道。"Aya Vision 旨在明确帮助缩小这一差距。"
Aya Vision 有两个版本:Aya Vision 32B 和 Aya Vision 8B。Cohere 表示,其中更为复杂的 Aya Vision 32B 开创了"新境界",在某些视觉理解基准测试中的表现超过了 Meta 的 Llama-3.2 90B Vision 等两倍于其规模的模型。同时,根据 Cohere 的说法,Aya Vision 8B 在某些评估中的表现优于规模是其 10 倍的模型。
这两个模型都可以在 AI 开发平台 Hugging Face 上获取,采用创用 CC 4.0 许可证并附带 Cohere 的可接受使用附录。它们不能用于商业应用。
Cohere 表示,Aya Vision 使用"多样化"的英语数据集进行训练,实验室将这些数据集翻译并用于创建合成标注。标注(也称为标签)在训练过程中帮助模型理解和解释数据。例如,训练图像识别模型的标注可能是对物体的标记或指代图像中每个人、地点或物体的说明。
根据 Cohere 的说法,使用合成标注(即由 AI 生成的标注)训练 Aya Vision 使实验室能够在使用更少资源的同时实现具有竞争力的性能。
"这展示了我们对效率的关注,以及用更少的计算资源做更多事情的能力," Cohere 在其博客中写道。"这也使我们能够为通常计算资源有限的研究社区提供更大的支持。"
除了 Aya Vision,Cohere 还发布了一个新的基准测试套件 AyaVisionBench,旨在测试模型在"视觉-语言"任务方面的能力,如识别两张图片之间的差异和将截图转换为代码。
AI 行业正处于所谓的"评估危机"之中,这是由于流行的基准测试给出的综合评分与大多数 AI 用户关心的任务熟练程度的相关性较差。Cohere 认为 AyaVisionBench 是解决这一问题的一步,提供了一个"广泛且具有挑战性"的框架来评估模型的跨语言和多模态理解能力。
希望事实确实如此。
"该数据集作为一个强大的基准,用于评估多语言和真实场景中的视觉-语言模型," Cohere 研究人员在 Hugging Face 上的帖子中写道。"我们向研究社区开放这个评估集,以推进多语言多模态评估的发展。"
好文章,需要你的鼓励
PEAK:AIO推出了一款新的2RU 1.5 PB AI 数据服务器产品,使用戴尔硬件,数据传输速率达到120 GBps。PEAK:AIO是一家专注于人工智能的英国存储初创公司,提供基于第三方硬件的软件定义存储,密切管理和控制以降低延迟并提高吞吐量。其2RU服务器已为中型GPU集群提供40 GBps的传输速率,现可实现三倍的速度。
从目前的角度来看,量子计算很可能成为中期内最具颠覆性的技术之一。利用物质在亚原子层面上的特性,通过利用纠缠和叠加等奇特现象,某些类型的计算可以大幅加速。这些计算包括识别庞大数据集中的模式、解决涉及多个变量的复杂优化问题、加密信息的密码学等。量子计算的影响可能是巨大的,尽管一些人认为这一现实仍需时日。
未来十年,数据中心的创新将重新定义我们行业在技术进步与环境保护之间的平衡。这一转型可能是我们一生中最具影响力的挑战之一,取决于我们是否能够拥抱可再生能源,部署尖端冷却技术,并利用人工智能和自动化来优化效率。
在巴塞罗那的移动世界大会上,OpenAI董事会主席布雷特·泰勒在与CNN主持人安娜·斯图尔特的对话中并没有给出“AI代理”的明确定义。他回避了关于“代理AI”与“生成AI聊天机器人”之间区别的问题,指出人们对前者的反感与对AI代理“富有同情心”回应的喜爱。泰勒表示,他对大型语言模型和当前技术浪潮的兴奋程度超过了他记忆中的任何技术,甚至自他青少年时期发现互联网以来。