MiniCPM-V是面向图文理解的端侧多模态大模型系列。该系列模型接受图像和文本输入,并提供高质量的文本输出。自2024年2月以来,我们共发布了4个版本模型,旨在实现领先的性能和高效的部署,目前该系列最值得关注的模型包括:
(1)MiniCPM-Llama3-V 2.5:MiniCPM-V系列的最新、性能最佳模型。总参数量8B,多模态综合性能超越 GPT-4V-1106、Gemini Pro、Claude 3、Qwen-VL-Max 等商用闭源模型,OCR 能力及指令跟随能力进一步提升,并支持超过30种语言的多模态交互。通过系统使用模型量化、CPU、NPU、编译优化等高效推理技术,MiniCPM-Llama3-V 2.5 可以实现高效的终端设备部署。
(2)MiniCPM-V 2.0:MiniCPM-V系列的最轻量级模型。总参数量2B,多模态综合性能超越 Yi-VL 34B、CogVLM-Chat 17B、Qwen-VL-Chat 10B 等更大参数规模的模型,可接受 180 万像素的任意长宽比图像输入,实现了和 Gemini Pro 相近的场景文字识别能力以及和 GPT-4V 相匹的低幻觉率。


参考文献:
[1] https://github.com/OpenBMB/MiniCPM-V
[2] MiniCPM 系列开源地址:https://github.com/OpenBMB/MiniCPM
[3] Hugging Face 下载地址:https://huggingface.co/openbmb/MiniCPM-Llama3-V-2_5
[4] MiniCPM-V 2.0: 具备领先OCR和理解能力的高效端侧多模态大模型:https://openbmb.vercel.app/minicpm-v-2
好文章,需要你的鼓励
在当前市场环境下,初创公司完成首轮融资的难度持续攀升。Precursor Ventures创始人Charles Hudson在播客中分享了早期创始人在寻求首轮机构融资前必须了解的关键信息,包括:风险投资格局的变化、AI如何重塑VC决策逻辑、为何最高估值并非最优选择、如何在融资过程中建立势能,以及风险投资是否真的适合自己的创业路径。
庆应义塾大学与英伟达推出AnyGroundBench,测试15个顶级视觉语言模型在手术、工业等五大专业领域的时空定位能力,揭示当前AI在专业场景下的系统性空间定位瓶颈。
IBM Research提出了一种新型模型架构CoFrGeNets(连分数生成网络),旨在替代GPT、Llama等主流大模型中的多头注意力机制和前馈网络。该架构基于数学中的连分数理论,通过"梯形"计算结构以更少参数表达更复杂函数。实验表明,CoFrGeNets在多项下游任务中性能接近或超越GPT2-xl和Llama-3.2B,同时训练更快、推理更高效,并可与现有模型架构灵活组合,未来有望应用于IBM Granite等系列模型。
清华大学与蚂蚁集团联合推出AgenticDataBench,含344道真实数据科学任务和433个精细技能标签,系统评测12种主流数据智能体配置的能力边界与短板。