OpenAI的o1模型,作为首个采用强化学习策略内化思维链(chain-of-thought)技术的LLM,已经在各种通用语言任务上展现出超凡的能力。
然而,它在医学等专业领域的性能仍然是一个未知数。为了探索这一问题,研究人员进行了一项初步研究,以评估o1在不同医学场景下的表现。
研究聚焦于o1模型在医学领域的三个关键方面:理解力、推理能力和多语言能力。为了确保评估的全面性,研究者们收集了35个现有的医学数据集,并开发了2个基于《新英格兰医学杂志》和《柳叶刀》的专业医学测验的新问答数据集,这些数据集被用于6个不同的任务中。
在理解力方面,评估包括概念识别和文本摘要任务。推理能力的测试更为复杂,它包括知识问答、临床决策支持和代理任务。多语言能力的评估则检查模型处理非英语医学问题的能力。这包括使用多种语言的问答任务,以及在中文医疗代理任务中模拟医疗互动。
为了衡量模型在这些任务上的表现,研究者们采用了多种评估指标。准确率直接衡量模型生成的答案与真实答案匹配的程度。F1分数则用于评估模型在需要选择多个正确答案的任务上的性能。BLEU和ROUGE指标用于评估生成文本与参考文本之间的相似度。AlignScore和Mauve指标则用于评估模型生成文本的事实一致性和自然度。
在实施评估时,研究者们探索了三种提示策略:直接提示、思维链提示和少量示例提示。他们选择了几种不同的模型进行比较,包括GPT-3.5、GPT-4以及开源模型MEDITRON-70B和Llama3-8B。实验涉及到多个医学任务,如问答、文本摘要、概念识别等,并使用了相应的数据集来评估模型在每个任务上的表现。
实验结果显示,o1模型在多数医学任务上都展现出了优越的性能。
在理解医学概念方面,o1在多个概念识别数据集上的表现超过了其他模型,在BC4Chem数据集上,o1的平均性能提升达到了24.5%。
在推理能力方面,o1在新构建的NEJMQA和LancetQA问答任务上取得了显著的准确率提升,o1的平均准确率分别比GPT-4高出8.9%和27.1%。
此外,o1在多语言医学问答任务中也展现了强大的能力,但在复杂的中文医疗代理任务中,其性能却有所下降。
研究人员也发现了一些局限性。o1在多个医学任务上表现出色,但其较长的解码时间可能导致在需要快速响应的临床环境中的实用性受限。此外,模型在处理复杂的中文医疗代理任务时性能有所下降,在处理复杂的多语言医学案例时仍面临挑战。
研究人员还发现,传统的评估指标如BLEU和ROUGE,无法充分捕捉到模型在医学领域的表现,需要开发更加精确的评估工具,以便更好地衡量和理解模型在复杂医学任务中的表现。
研究人员认为,尽管o1在某些方面仍有不足,但其在多个医学任务上展现出的能力表明,我们离实现AI医生的目标已经越来越近。然而,为了实现这一目标,还需要在模型性能、评估指标和用户指导策略等方面进行更多的研究和改进。
好文章,需要你的鼓励
YouTube开始推出肖像检测工具,帮助创作者识别和举报使用其面部特征的AI生成视频。该系统类似于版权检测机制,目前处于测试阶段,仅向部分创作者开放。用户需要提供政府身份证件照片和面部视频来验证身份。系统会标记疑似包含用户肖像的视频,但无法保证100%准确识别AI内容。YouTube将根据多项因素决定是否移除举报的视频。
华中科技大学研究团队发现,通过让AI模型学习解决几何问题,能够显著提升其空间理解能力。他们构建了包含约30000个几何题目的Euclid30K数据集,使用强化学习方法训练多个AI模型。实验结果显示,几何训练在四个空间智能测试基准上都带来显著提升,其中最佳模型达到49.6%准确率,超越此前最好成绩。这项研究揭示了基础几何知识对培养AI空间智能的重要价值。
谷歌宣布在AI Studio平台中引入"氛围编程"体验,让编程和非编程用户都能更轻松地开发应用程序。用户可通过简单提示生成可运行的应用,新功能包括应用画廊、模型选择器、安全变量存储等。平台还添加了模块化"超能力"功能和"手气不错"按钮来激发创意。完成的原型应用可一键部署到谷歌云运行平台。此次更新正值业界期待谷歌即将发布Gemini 3.0大语言模型。
中国人民大学研究团队开发了Tool-Light框架,通过信息熵理论解决AI工具使用中的过度调用、调用不足和过度思考问题。该框架采用熵引导采样和两阶段自演化训练,让AI学会合理使用外部工具。在10个推理任务测试中,Tool-Light显著提升了AI的效率和准确性,为AI工具集成推理提供了新的解决方案。