几个月前,苹果研究团队发布了一项关于训练AI生成功能性UI代码的有趣研究。
与设计质量不同,该研究重点确保AI生成的代码能够实际编译,并在界面功能和外观方面大致匹配用户的提示要求。
研究成果是UICoder,这是一个开源模型系列。
现在,负责UICoder的部分团队发布了一篇新论文,题为《从设计师反馈改进用户界面生成模型》。
在论文中,研究人员解释说,现有的人类反馈强化学习(RLHF)方法并不是训练大语言模型可靠生成优质UI设计的最佳方法,因为这些方法"与设计师的工作流程不匹配,忽略了用于批评和改进UI设计的丰富理由"。
为解决这个问题,他们提出了不同的路径。他们让专业设计师使用评论、草图甚至直接编辑来直接批评和改进模型生成的UI,然后将这些前后变化转换为用于微调模型的数据。
这使他们能够基于具体的设计改进来训练奖励模型,有效地教会UI生成器偏好更好地反映真实世界设计判断的布局和组件。
总共有21名设计师参与了这项研究。
研究人员收集了1460个标注,然后将其转换为配对的UI"偏好"示例,对比原始模型生成的界面与设计师改进版本。
这反过来被用于训练奖励模型以微调UI生成器。
关于生成器模型,苹果使用Qwen2.5-Coder作为UI生成的主要基础模型,后来将同样的设计师训练奖励模型应用到较小和较新的Qwen变体上,以测试该方法在不同模型大小和版本之间的泛化能力。
有趣的是,正如研究作者自己指出的,该框架最终看起来很像传统的RLHF管道。他们认为,区别在于学习信号来自设计师原生工作流程(评论、草图和直接修订),而不是点赞/点踩或简单排名数据。
那么,这真的有效吗?根据研究人员的说法,答案是肯定的,但有重要注意事项。
总体而言,在设计师原生反馈(特别是草图和直接修订)上训练的模型产生的UI设计质量明显高于基础模型和仅使用传统排名或评级数据训练的版本。
事实上,研究人员注意到他们表现最好的模型(使用草图反馈微调的Qwen3-Coder)超越了GPT-5。更令人印象深刻的是,这最终仅源自设计师的181个草图标注。
至于注意事项,研究人员注意到主观性在什么构成良好界面方面起着很大作用。
在研究中,这种差异表现为对哪些设计实际更好的分歧。当研究人员独立评估设计师排名的相同UI配对时,他们只有49.2%的时间同意设计师的选择,几乎是抛硬币的概率。
另一方面,当设计师通过绘制改进草图或直接编辑UI提供反馈时,研究团队同意这些改进的频率要高得多:草图为63.6%,直接编辑为76.1%。
换句话说,当设计师能够具体展示他们想要改变什么,而不仅仅是在两个选项之间选择时,更容易就什么是"更好"达成一致。
Q&A
Q1:苹果研究团队提出的新训练方法有什么特点?
A:苹果研究团队让专业设计师使用评论、草图甚至直接编辑来直接批评和改进模型生成的UI,然后将这些前后变化转换为用于微调模型的数据。这种方法来自设计师原生工作流程,而不是简单的点赞/点踩或排名数据。
Q2:新方法训练的模型效果如何?
A:使用设计师原生反馈训练的模型产生的UI设计质量明显高于基础模型和传统方法训练的版本。表现最好的模型Qwen3-Coder甚至超越了GPT-5,而这仅源自设计师的181个草图标注。
Q3:设计师反馈方式的有效性如何?
A:研究发现,当设计师仅在两个选项间排名时,研究人员只有49.2%的时间同意其选择。但当设计师通过草图或直接编辑提供具体反馈时,同意率分别提升至63.6%和76.1%。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。