OpenAI集团今日正式推出ChatGPT图像2.0,这是其内置于旗下热门聊天机器人中的图像生成器的全面升级版本。与此同时,该公司还发布了一项名为Codex Labs的全新技术培训服务,旨在帮助各类企业更顺畅地采用OpenAI的Codex编程助手。
ChatGPT图像2.0支持生成最大宽度达2000像素的图像,并兼容多种宽高比,其中包括此前版本不支持的比例。值得一提的是,用户现在可以生成宽度最高为高度三倍(或反之)的图像,这类宽高比非常适合信息图表等设计场景的应用需求。
在图像质量方面,OpenAI表示ChatGPT图像2.0带来了显著提升。研究团队重点优化了文字渲染能力,新版本在生成包含日文、韩文、中文、印地语及孟加拉语文本的图像时,表现明显优于前代产品。
此外,OpenAI还在多个维度进行了质量改进。据介绍,新版图像生成器在生成小字体文本、界面元素、图标及其他视觉素材方面的能力大幅增强,而这些内容历来是AI模型的薄弱环节。值得关注的是,ChatGPT图像2.0还会在渲染图像时加入"细微瑕疵",以此提升画面的真实感。
该工具内置通用知识数据集,可用于理解用户提示词并自动填补信息空白。举例来说,即便用户没有列出具体食材,该工具也能生成一张说明如何制作指定菜肴的信息图表。OpenAI表示,ChatGPT图像2.0所使用的数据集最后更新时间为去年12月。
付费用户还可以通过开启ChatGPT的"思考"模式和"专业"推理模式来进一步扩展工具的知识储备。这两种模式允许ChatGPT图像2.0从公开网络中获取补充信息。在一次演示中,OpenAI工程师让该工具自动浏览公司的电商店铺,并为当前在售商品生成广告图。
据OpenAI介绍,上述两种推理模式同样有助于提升输出图像的质量。其原理在于,这些模式使ChatGPT图像2.0能够在正式生成图像之前,先对视觉素材的结构进行"推理分析",从而降低输出错误的概率,进而减少用户在图像后期修改上所花费的时间和精力。
在提升效率方面,ChatGPT图像2.0还支持基于单条提示词批量生成最多10张图像,无需用户反复输入多组指令。该工具不仅可以在同一批次的图像中保持视觉风格的高度统一,也可以按需为每张图像应用不同的设计风格。
与ChatGPT图像2.0同步推出的Codex Labs,是一项面向企业的全新服务产品,旨在帮助企业部署OpenAI的Codex编程助手。据OpenAI介绍,该服务提供工作坊及多种形式的培训资源,帮助企业开发人员更快上手并熟练运用这一工具。此外,Codex Labs还将协助企业完成Codex与现有开发工具链的集成对接等工作。
Q&A
Q1:ChatGPT图像2.0支持哪些新功能?
A:ChatGPT图像2.0支持最大宽度2000像素的图像生成,兼容更多宽高比(包括宽度为高度三倍的比例),改进了多语言文字渲染能力(含中文、日文、韩文等),支持单次提示词生成最多10张图像,并可通过"思考"和"专业"推理模式接入网络数据,进一步提升图像生成质量。
Q2:ChatGPT图像2.0的"思考"和"专业"推理模式有什么用?
A:这两种模式专为付费用户开放,能让ChatGPT图像2.0在生成图像前先对视觉结构进行推理分析,同时还可从公开网络中获取补充信息,弥补内置数据集的不足。整体效果是降低输出错误率,减少后期人工修改的工作量,提升最终图像的质量和准确性。
Q3:Codex Labs是什么?主要面向哪些用户?
A:Codex Labs是OpenAI面向企业推出的技术培训服务,主要目标是帮助企业顺利部署和使用OpenAI的Codex编程助手。该服务提供工作坊及系统化培训资源,帮助企业内部开发人员快速掌握Codex的使用方法,同时还协助企业将Codex与其现有开发工具链进行集成对接。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。