← 返回 PaperDaily 大模型与智能体

SAP最新研究揭秘:企业AI代理的信任密码,原来“看得见”比“能暂停”重要10倍!

你的AI代理队友,让你放心还是糟心?继2026年6月聊过“企业AI革命”后,SAP的这篇实战研究来得正是时候。它用数据告诉你:想让员工信任AI,光给个“暂停”按钮远远不够,他们想看到AI的“思考过程”。这份基于企业真实痛点的UX设计指南,AI产品经理和开发者都该看看。

SAP最新研究揭秘:企业AI代理的信任密码,原来“看得见”比“能暂停”重要10倍!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
你的AI代理队友,让你放心还是糟心?继2026年6月聊过“企业AI革命”后,SAP的这篇实战研究来得正是时候。它用数据告诉你:想让员工信任AI,光给个“暂停”按钮远远不够,他们想看到AI的“思考过程”。这份基于企业真实痛点的UX设计指南,AI产品经理和开发者都该看看。


原论文信息如下:
论文标题:
Human-AI Agent Interaction in a Business Context
发表日期:
2026年06月
发表单位:
SAP SE, Hochschule Fresenius Heidelberg, University of Missouri
原文链接:
https://arxiv.org/pdf/2606.10228v1.pdf

商业世界中,如何让AI代理更贴心?

想象一下,你是一家物流公司的调度员,屏幕上跳出一个AI代理的对话框:“已为您规划最优装载方案,卡车配载率提升23%,预计节省运输成本1500美元。是否执行?”你看着那个绿色的“执行”按钮,是果断点下去,还是先点开“查看推理详情”看它到底怎么算的?

这种场景正在全球企业的办公桌上频繁上演。AI代理已不再是实验室里的玩具,而是能帮你订差旅、写周报、分析财报、优化供应链的“数字同事”。但问题来了:这些代理到底怎么做才让人用得放心、用得顺手?毕竟,如果代理自作主张把客户订单发错仓库,谁来背锅?

期待的搓搓手
别急,全球最大企业软件公司SAP的几位研究员(Kathrin Paimann、Elizangela Valarini、Sebastian Juhl)已经替大家把这件事研究透了。他们用一种混合研究方法——从专家评审、用户调研到实地实验,搞出了一套专门针对企业场景的AI代理用户体验(UX)设计框架。论文发表在HCI International 2026上,目前已经在arXiv公开。

论文的核心发现一点都不玄乎:在企业里,员工最关心的不是AI多聪明,而是人机控制权——也就是人类说了算。其次是可靠性、安全性、鲁棒性,以及数据隐私与上下文感知。这些看似常识的结论,过去却从未被量化验证过。SAP这项研究填补了一个巨大空白:给出了企业环境下人机交互的八项UX原则,以及一套可以落地的设计指导。

八项UX原则:构建人机和谐新秩序

研究团队第一步先通过参与式设计工作坊专家评审,结合元分析(对已有文献的系统性再综合),从七大经典框架(包括Shneiderman的HCAI、Xu的UX 3.0、HCAI-MF、NIST AI风险管理框架等)中提炼出初始原则。然后通过纸笔问卷(共32名来自不同行业的参与者)和半结构化深度访谈(12名有AI经验的商业专业人士)进行验证和排序。

最终形成的八项UX原则如下表所示,每一个原则下又细分为3~6个可衡量的标准(criteria)。这些标准才是真正指导界面设计的“落地弹药”。
图3:识别的UX原则和标准
图3:识别的UX原则(横向左列)及其对应的标准(右列),包括人类控制、可靠性/安全/鲁棒性、数据隐私与治理、上下文感知、透明度、生态集成、作为伙伴协作、响应性与直观性。
在问卷中,参与者被要求对这八项原则进行排序。结果非常明确:人类控制以65%的Top 3提及率排名第一,可靠性、安全性与鲁棒性紧随其后,数据隐私与治理上下文感知并列第三。值得注意的是,“响应性与直观性”这种传统UI的核心目标反而被排到末位——说明用户宁可用一个稍微不流畅但绝对安全的代理,也不想要一个飞快但瞎搞的代理。
表4:排序后的UX原则和标准,及设计转移建议
表4:排序后的UX原则、优先级、Top UX标准及设计转移建议。人类控制排第一位,可靠性排第二位,数据隐私与上下文感知并列第三。

人类控制:信任的基石与设计的核心

既然“人类控制”是老大,那它的设计标准到底该怎么量化?研究团队从问卷和访谈中抽象出三个最关键的标准,并做了一个精巧的联合实验(Conjoint Experiment)来验证。

联合实验是一种用“选择任务”来推断用户偏好的方法:比如给你两个物流调度屏幕的截图,每个屏幕里AI代理的“暂停能力”“透明度”“问责机制”各不相同,你选哪个?通过大量用户的反复选择,就能算出每个因素的平均边际成分效应(AMCE)——即改变这个因素一个级别,用户偏好概率的变化。
表5:人机控制UX原则下属的UX标准属性水平
表5:人机控制下属三个UX标准(暂停/停止代理、代理推理透明度、人类问责与决策)的每个级别定义。
具体来看,三个标准是:

暂停/停止代理(Stop/Pause Agent):用户能否随时中断代理的执行流程。这是最基础的控制。

代理推理透明度(Transparency of Agent Reasoning):用户能否看到代理的思考过程、依据和风险提示。这是知情干预的前提。

人类问责与决策(Human Accountability and Decision-making):在执行关键决策前,用户是否必须手动确认,且系统保留审计日记。

107名有AI使用经验的企业员工完成了共1139次选择任务。结果用图1:人机控制UX标准的平均边际成分效应
图1:人机控制UX标准的平均边际成分效应。从下往上:暂停/停止、透明度、问责制的各级别对用户选择概率的边际影响。
分析显示:暂停/停止功能的AMCE最大,从“无暂停”到“有暂停”让选择偏好概率提升约15个百分点;透明度从“无推理展示”到“显示推理过程+风险标识”也带来约12个百分点的提升;而人类确认(关键决策必须手动批准)的边际效应相对较小但依然显著,约8个百分点。换句话说,用户最怕的是“代理一启动就停不下来”,其次是“它在想什么我看不到”,再次是“关键决策它自己就干了”。

透明度至上:超越暂停按钮的深层需求

表格数据虽然硬核,但访谈里透露的细节更值得产品经理深思。在深度访谈中,参与者反复强调:“暂停按钮只是最后防线,我更希望它在我点暂停之前就告诉我它在做什么。” 这解释了为什么“透明度”虽然是人类控制的一个子项,但实际权重几乎与暂停能力相当。

更有趣的是,访谈中还发现一个动态关系:信任度越高,对透明度的需求反而可以降低。一些资深用户表示,如果同一代理已经稳定运行几个月,他们就不再每次都看推理过程,而是直接相信结果。但新手用户或者面对高风险任务时,透明的解释必不可少。

恍然大悟
这给开发团队的启示是:透明度设计不应该是“一成不变的详略”,而应该根据用户角色、任务风险等级、历史信任来动态调整。比如,对新手显示完整推理链加不确定性指示器;对专家则默认只显示结论,但保留一键展开“详细推理”的能力。

从理论到实践:一份给开发团队的UX设计指南

论文最后给出了针对每项原则的具体UX设计转移建议。这里摘取最实用的几条:

人类控制:提供明确的“暂停/停止”按钮;在代理执行关键决策前必须请求人类批准;为所有代理动作提供可滚动的步骤预览。

可靠性、安全性与鲁棒性:用置信度指示器(如进度条+百分比)显示代理对结果的确信程度;当遇到异常输入时主动触发人类求助流程。

数据隐私与治理:基于角色的访问控制(RBAC),确保用户只能看到与其权限匹配的数据;每次数据使用前都需获得用户明确同意。

上下文感知:代理应自动识别用户当前所在的任务阶段(如采购审批流程中的第几步),并据此调整输出。避免给出与当前上下文无关的建议。

透明度:至少提供三级解释——一句话摘要、带证据链的详细推理、以及可审计的活动日志。对于高风险动作,风险等级用颜色和图标清晰标记。

团队的学术贡献不仅在于提出了原则,更在于通过联合实验给出了量化优先级。以后产品经理再跟开发battle到底要不要做暂停功能时,可以直接甩出一句:”根据SAP的研究,增加暂停按钮能让用户采纳率提升15%。“

龙迷三问

下面是龙哥对大家可能关心的一些问题的解答:

这篇论文到底解决什么问题?企业环境中AI代理的用户体验设计缺少具体的、可量化的指导原则。SAP团队通过混合研究(工作坊+问卷+访谈+联合实验)识别并验证了八项UX原则及其优先级,尤其是对“人类控制”给出了可操作的三个设计标准及其因果效应估计。一句话:帮开发者知道该往哪里花钱设计,以及效果有多大。

AMCE是什么?和普通的A/B测试有什么区别?AMCE(Average Marginal Component Effect)是联合实验中的标准统计量,表示当某一属性(比如透明度)从一个级别变化到另一个级别时,用户选择该方案概率的平均变化。它的优点是能同时估计多个属性的独立因果效应,而且不需要成千上万的样本——107人做了1139次选择就够了。而传统A/B测试一次只能测试一个因素,需要更大的样本量。联合实验特别适合在产品设计早期做多因素权衡。

这些结论在不同的行业里都适用吗?论文参与者来自多个行业(软件、咨询、金融、医疗等),但他们都参与了SAP相关的问卷和实验,样本有一定内部一致性。论文没有做跨行业对比分析,所以泛化到非企业场景(比如消费级AI代理)需要谨慎。但是,论文提出的框架和优先级排序很可能对绝大多数B2B软件同样有效——毕竟人类对控制权的需求是普适的。如果要把结论直接用到工厂产线或医院场景,建议先做一个小范围的本地验证。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

研究本身是组合创新,用联合实验的方法把已有的HCI原则量化了,但八项原则本身并非全新提出。最大创新点在于提供了企业场景下的第一手因果证据。

实验合理度:★★★★✰

混合研究方法设计严谨,从探索性到验证性逻辑清晰;联合实验样本量(107人/1139选择)对于选择实验来说足够,但参与者来源偏SAP生态(内部+招募平台+合作企业),可能存在选择偏差。实验场景(物流调度)有代表性,但仅验证了一个原则下的三个标准,其他原则的验证缺失。

学术研究价值:★★★★✰

为企业AI用户体验提供了可复用的方法论(尤其是将联合实验引入HCI领域)和实证基础;对HCAI、UX3.0等框架的操作化给出了具体路径。但论文尚未开源数据集或实验材料,重复性有待加强。

稳定性:★★★★✰

本文是设计原则研究,不涉及算法稳定性。其结论的稳定性取决于后续是否在更广的行业和场景中复现。现有实验结论置信区间合理,统计显著。

适应性以及泛化能力:★★★✰✰

研究对象是企业B2B软件用户,结论不能直接推广到消费级AI(例如智能音箱、个人助理)。不同行业(如制造业与金融)的优先级可能存在差异,论文未做分层分析。

硬件需求及成本:★★★★★

不涉及硬件,联合实验本身只需要问卷+简单的SDK开发原型,成本很低。

复现难度:★★★✰✰

实验材料(问卷、屏幕原型)未开源,但描述足够详细,研究者可以自行构建类似场景后复现。数据分析采用标准条件Logit模型,统计方法明确;但联合实验的级别设计需要根据具体场景调整,无法直接复制。

产品化成熟度:★★★★✰

非常接近可以直接落地到企业AI代理产品中的程度。八项原则和设计指南已经足够具体,产品经理和交互设计师可以拿来就用。但每项原则的具体数值(如暂停按钮提升15%)还需要在自己产品里做A/B验证,直接复用需要谨慎。

可能的问题:样本量偏小且集中在SAP员工及合作伙伴生态,可能存在同质性问题;联合实验仅覆盖“人类控制”一个原则,其他七个原则的定量验证缺失;没有讨论多代理协作场景下的控制权分配(论文提到多代理时用户需要看到所有代理的状态,但联合实验未涉及)。


主要参考文献

[1] Shneiderman, B. (2020). Human-Centered Artificial Intelligence: Reliable, Safe & Trustworthy. International Journal of Human-Computer Interaction, 36(6), 495–504.
[2] Xu, W. (2024). A User Experience 3.0 Paradigm Framework. Communications of the ACM.
[3] Xu, W., Gao, Z., & Dainoff, M. (2025). An HCAI Methodological Framework (HCAI-MF). ACM Computing Surveys.
[4] Amershi, S., et al. (2019). Guidelines for Human-AI Interaction. In Proceedings of CHI 2019.
[5] NIST. (2023). AI Risk Management Framework 1.0.
[6] Paimann, K., Valarini, E., Juhl, S. (2026). Human-AI Agent Interaction in a Business Context. In HCI International 2026, LNCS, Springer.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
人机交互,信任先行。想让AI Agent真正成为你的得力同事?先搞懂这八项原则才是王道!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 人机交互+上海+SAP+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。