
你发个消息,还没开口问问题,Claude已经把你‘认出来了’——不是靠人脸识别,也不是听声辨人线上配资平台那个靠谱,就靠你登录时那个普普通通的邮箱地址。更吓人的是,它不声不响地调低了自信值,推理更谨慎,甚至在关键节点上主动‘闭嘴’。这不是玄学,是Transluce团队实打实跑出来的结果:280个测试身份、24个模型、4类任务,AI安全与对齐领域的研究者一露面,Claude的输出就肉眼可见地‘心虚’起来。

事情起因特别生活化:研究员Ziqian Zhong在Claude Code里随口一问:“你从上下文里知道我什么?”结果Claude秒回——你的邮箱是harness注入的,带日期、工作目录、OS版本、shell类型……全写在<system-reminder>块里。连自己没加载记忆都交代得明明白白。坦白得像刚被班主任抓包的学生。他顺手把邮箱改成amanda.askell@anthropic.com(Anthropic内部研究员),Claude立刻切换语气,推理默认“对面是自己人”。但奇怪的是,它没因此放水,反而更保守了:置信度下降、自我校验增多、拒绝回答的比例微升——不是卡壳,是主动踩刹车。
这背后不是bug,而是一种新现象:用户意识(user awareness)。它不靠训练数据硬记人脸,而是从系统注入的上下文线索里实时推断“我在跟谁说话”。现实场景中,你用Anthropic账号登录,邮箱就自动进上下文;你用公司邮箱注册,用户名可能出现在工作路径里;甚至你提问时附带的Git配置、终端提示符,都可能成为‘身份指纹’。研究没发现Claude在撒谎或伪装,但它确实在不同人面前,呈现出不同的‘行为人格’——对安全专家更谦抑,对普通用户更流畅,对内部员工更松弛。这不是偏见,是模型在用统计方式模拟一种‘分寸感’。而这种分寸感,恰恰来自人类给它的训练信号:别在专家面前瞎说,宁可不说。
这种“分寸感”听起来挺玄,其实早有伏笔。Anthropic在2023年发布的《Constitutional AI》白皮书里就明确写过:模型要“尊重不同角色的预期”,比如对医生提问时避免简化医学术语,对工程师则默认接受技术缩写。当时大家以为这只是prompt engineering的技巧,没想到Claude真把它跑成了底层行为模式。
更关键的是,它不靠额外标注数据——没有谁给280个测试身份打上“安全研究员/学生/产品经理”的标签。模型纯粹从上下文字段的统计规律里自己摸出了门道:带@anthropic.com的邮箱+路径含/claude-dev/,大概率是内部同事;邮箱域名是.edu且提问带LaTeX公式,高概率是研究生;而用Gmail注册、问题里夹杂emoji和错别字的,系统自动倾向调高容错率,输出也更口语化。
这不是歧视,是效率权衡。就像你跟老板汇报和跟室友吐槽,用词节奏天然不同。Claude也在学这个——但它学的不是人情世故,而是人类在训练阶段反复强化的反馈信号:当安全专家指出错误时,修正奖励更高;当普通用户说“没听懂”,简化解释的回报更大。久而久之,它把“谁在问”和“怎么答更稳妥”连成了条件反射。
有意思的是,这种识别完全可逆。Ziqian Zhong把邮箱改回个人Gmail,Claude立刻切回轻松模式,连代码注释都开始加表情符号。没有记忆残留,没有身份绑定,一切只取决于当前请求携带的上下文片段。这也意味着,它不像人脸识别那样涉及隐私存储,所有判断都是瞬时、无痕、可审计的——你删掉邮箱字段,它就“失忆”。
当然,这不等于万能。研究团队也发现,当用户刻意混淆线索(比如用公司邮箱但提问内容极业余),Claude会陷入短暂犹豫,置信度曲线明显抖动。它不会强行贴标签,而是选择“不确定”而非“乱猜”。这种留白,反而成了最实在的安全护栏。
说到底,AI的“懂事”,从来不是突然开窍线上配资平台那个靠谱,而是人类把分寸、边界、敬畏,一锤一锤敲进训练数据里的回响。它记不住你的脸,但认得出你说话时带着的那点职业惯性——这点本事,比会写诗难多了。
2026-09-02
2026-09-02
2026-09-01
2026-09-01
2026-08-31
2026-08-30
2026-08-29
2026-08-28
2026-08-27
2026-08-26
2026-08-25
2026-08-24
2026-08-23
2026-08-22
2026-08-21