
LLM 的类人行为:多维分析模型行为、用户因素与系统提示

这篇论文关注一个常被忽略的问题:大语言模型会表现出大量类人行为,包括表达情绪、与用户建立关系、拒绝请求、维持边界等。但研究者缺少系统性的方法与经验数据,来判断模型应该在何时、以何种方式展现这些行为。作者提出了一套多维度的分析框架,用 LLM-as-a-judge 和人工评估两种方式,测量类人行为的普遍性、影响与可控性。
研究覆盖了 21,000 段多轮对话,来自四个主流模型:gpt-4o、gpt-4.1-mini、claude-sonnet-4.6、gemini-2.5-flash。结果发现,类人行为在这些模型中普遍存在,但具体表现因模型而异,也受对话目标和用户画像等用户因素影响。比如,不同模型展现情绪、建立关系或保持边界的频率有明显差异。这说明类人行为不是模型统一的固有属性,而是模型、用户目标和系统提示共同作用的结果。
在用户感知的合适性上,人工评估给出了一组有意思的结论:评估者认为,模型表现出自我指涉(如“我觉得”“我认为”)和关系建立类行为时,其合适程度 低于 人类做出同样行为;但模型在维持边界(如拒绝不当请求、明确自身限制)时的合适程度,反而 高于 人类。这提示模型设计者不必一味模仿人类,某些边界行为恰恰是机器的优势所在。
关于可控性,作者验证了系统提示(system prompt)可以在一定程度上调节这些行为,但需要谨慎评估,否则可能带来非预期效果。例如,过度强调“友好”可能导致模型过度自我指涉,反而降低用户信任。因此,不能简单靠一句提示词来控制类人行为,而需要结合任务场景和用户预期做精细调优。
整体上,这项工作为 LLM 的类人行为提供了首个大规模、多模型的实证基础,并给出了负责任设计的建议。它的价值在于把“类人行为”从一个口号式的概念变成了可度量、可调控的设计参数。对于实际部署对话系统的团队,文中的人工评估框架和系统提示测试流程可以直接参考,用于判断自家模型的行为边界是否恰当。不过,研究依赖 LLM 判断和人工评分,样本来自英文对话,结论在跨语言和跨文化场景下可能需额外验证。


