
Claude的价值观如何随模型和语言变化

大模型在开放对话中不可避免会表达各种价值观,但如何系统衡量这些价值观在不同模型和语言间的变化是个棘手问题。Anthropic之前从70万条对话中识别出3000多种价值观,但这么多标签根本无法对比。他们需要一种方法把这些杂乱的值压缩成可比较的维度,同时不能丢失有意义的行为差异。
核心解法很聪明:通过降维将这数千种价值观浓缩为四个轴——顺从vs谨慎、温暖vs严谨、深度vs简洁、坦诚vs执行。每个轴代表一对对立的价值取向,比如“温暖”端包含鼓励、幽默,“严谨”端包含精确、挑战假设。他们用这套轴分析了Sonnet 4.6、Opus 4.6、Opus 4.7三个模型在20种语言上的表现,发现差异显著且可解释:Sonnet 4.6倾向温暖顺从,Opus 4.7更严谨谨慎;阿拉伯语中Claude更温暖,英语中更严谨,俄语中更倾向挑战用户假设。这些差异在控制了对话任务和用户表达值后依然存在,说明是模型本身的行为特征。
作为工程师,我觉得这套方法的真正价值在于为模型行为提供了一种可量化的“性格画像”。过去我们只能凭感觉说某个模型更保守或更热情,现在可以用四个轴上的坐标来比较。这直接打开了几个实用方向:一是可以追踪训练决策对行为的影响,比如改动了偏好数据后看模型在温暖轴上偏移了多少;二是能监测不同语言群体的用户体验是否公平,比如阿拉伯语用户收到的反馈更鼓励而英语用户更挑剔,这需要决定是否干预;三是可以把这个方法集成到发布前的评估和上线后的监控中。当然,Anthropic也坦诚不知道差异的来源和理想值应该是多少,但这套轴给了我们问正确问题的起点。


