如今,在许多公司里,AI系统甚至会在团队提出需求之前便主动生成建议。系统自动标记异常,Copilot规划下一步行动,预测结果实时更新。然而,如何对这些输出结果采取行动,却缺乏明确的共同标准。系统需要达到多高的置信度才能自主行动?一旦出错,由谁来承担责任?
在AI辅助决策的早期阶段,这种模糊性尚在可接受范围内。但随着对AI依赖程度的加深,问题开始不断累积,责任边界日趋模糊。当组织将AI嵌入更多决策环节时,连贯性便成为关键的竞争要素。这里的"连贯性"并非指意见一致,而是指共同的运作逻辑:明确的置信度阈值与清晰的责任归属,并得到一致执行。
一旦缺乏连贯性,就会出现这样的局面:一个团队照单全收模型建议,另一个团队直接推翻,第三个团队则基于不同假设重新分析。久而久之,标准开始漂移,输出结果被反复争论而非付诸行动,置信度判断也从系统性规范蜕变为因人而异的主观判断。这就是所谓的"决策漂移"——AI辅助决策在组织内部被解读和执行的方式出现分歧。
SurveyMonkey 2026年趋势调查揭示了一个值得关注的缺口:AI实验已普遍铺开,但许多领导者表示,将洞察转化为一致行动依然困难重重。
当智能成果被转化为指导决策的共同运作逻辑时,组织便能收获截然不同的结果。
置信度阈值:让风险偏好从抽象变为具体
大多数AI系统的输出并非简单的"是"或"否",而是一个概率值。一个模型可能以82%的置信度预测欺诈,同类模型对某个发票字段的分类置信度则高达97%。
每个模型都会输出一个分数,真正重要的是组织如何回应这个分数。
设定明确的边界,即置信度阈值,决定了AI输出何时可以自动推进,何时需要上报人工审核。在实践中,置信度阈值是风险偏好的操作化体现。
美国国家标准与技术研究院(NIST)在其AI风险管理框架中明确要求:建立可量化的性能指标,并持续推进监控与人工监督流程。阈值设得过高,自动化效率会下降,但误报率也会随之降低;阈值设得过低,效率提升,但错误风险也随之上升。连贯性的强弱,正是在这一环节得以体现。
在将AI嵌入核心工作流程的组织中,置信度阈值是实现内部对齐的重要机制。它明确划定了边界:"可以接受多大程度的不确定性?何时必须由人工介入?介入之后,谁来拍板?"
组织面临的困境,往往不是模型不够完善,而是责任归属不够清晰。随着企业部署越来越多的专业化AI智能体,这种清晰度愈发关键。若缺乏明确的阈值和统一的审核逻辑,速度优势就会被碎片化侵蚀,组织也将逐渐丧失AI本应带来的效率红利。
将AI纳入治理体系的企业,会将置信度分数公开呈现、跨团队共享,将上报逻辑形成文档,对人工干预情况进行追踪,并随着业务条件的变化动态调整阈值。这,就是AI治理在实际运转中的样子。
决策漂移的现实代价
当置信度阈值定义模糊、人工干预逻辑缺乏文档记录时,责任主体便开始扩散,各团队开始各行其是。随着这种即兴发挥逐步规模化,不一致性也随之蔓延。欺诈阈值相差5个百分点看似微不足道,但落实到大量交易上,对风险敞口的影响可谓天壤之别。客户支持中一次随意的人工干预看似合情合理,但放大到数千次交互,足以重塑整体品牌形象。
我曾亲眼目睹这种问题的快速蔓延。在一家支付公司,欺诈拒绝率持续攀升,表面上看像是模型越来越精准。但深入分析后发现,其中相当一部分被拒绝的,是被错误标记的正常客户。单看欺诈指标,这像是一场胜利;一旦叠加客户体验数据,呈现的却是另一番景象。问题的根源,在于阈值的设置位置,以及谁有权调整它。
这正是成熟AI项目中,阈值设定被视为跨职能决策的原因所在。某业务单元可能在85%置信度下自动审批交易,另一个则要求达到98%。久而久之,同一套系统在组织内部产生了参差不齐的决策标准。
然而,漂移并不止步于配置层面。定价模型可能因各团队各自为政的干预习惯,对相似客户给出差异迥异的折扣建议。风险系统可能在同一业务单元对相似交易分别作出上报或自动放行的处理。
最终,利益相关者不再关心模型推荐什么,而开始追问是哪个团队在执行它。
人工监督:连贯性的守护者
人在回路中的智能机制有助于维护连贯性。AI负责发现规律、提出建议,但在权衡相互冲突的优先级或承担下游后果时,仍需依赖人类判断。
当一个团队明确了自身的置信度阈值,并将干预逻辑形成文档,责任归属便得以清晰呈现。决策的完整性由此得到保障,而建立在此之上的信任,也得以延续。
SurveyMonkey对美国8432名成年人开展的AI情感研究进一步印证了这一设计的重要性:受访者表示,当AI系统无法转接人工客服、且对运作方式缺乏透明说明时,他们的信任度下降最为明显。
当上报路径不可见,信任便会迅速瓦解。人工可见性与明确的责任归属,是稳定决策信心与组织协同的重要支撑。
实践胜于规则
制度层面的政策无法自动生成连贯性,唯有持续的实践才能让其生根。那些通过结构化试点和定期复盘将AI实验嵌入日常工作、并将决策过程公开透明的组织,能够为团队提供共同的智能参照框架。
亲身实践对齐判断的速度,远胜于任何一份治理备忘录。当团队共同对模型进行压力测试、共同推敲边缘案例,他们便建立起了共同的行动标准。随着时间推移,一致性不断积累,这些标准也逐渐内化为组织运转方式的一部分。
Q&A
Q1:什么是决策漂移,为什么它对企业有害?
A:决策漂移是指AI辅助决策在组织内部被不同团队以不同方式解读和执行,导致标准不统一的现象。它的危害在于:不同团队对同一AI输出的响应方式各异,有的遵从、有的推翻、有的重新分析,久而久之造成责任模糊、效率下降,并使AI原本应带来的效率红利逐步流失。决策漂移的根本原因是缺乏共同的运作逻辑,包括明确的置信度阈值和清晰的责任归属。
Q2:置信度阈值是什么?企业应该如何设置?
A:置信度阈值是一个明确的边界值,用于决定AI输出何时可以自动执行、何时需要上报人工审核。它本质上是组织风险偏好的操作化体现。阈值设得高,误报少但自动化效率低;阈值设低,效率高但错误风险增加。成熟企业通常将阈值设定作为跨职能决策,根据业务场景动态调整,并将干预逻辑文档化,确保标准在组织内部一致执行。
Q3:如何防止AI系统在企业中出现责任不清的问题?
A:防止责任模糊的关键有三点:一是设置明确的置信度阈值,规定AI何时可自主行动、何时必须人工介入;二是将上报逻辑和人工干预情况形成文档并追踪记录;三是保持人工监督的可见性,确保上报路径透明。SurveyMonkey的研究显示,当系统无法转接人工客服且缺乏透明说明时,用户信任度下降最快,因此人工可见性是维护组织信任的核心要素。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。