llmtaste:一个没做完就被人做了的实验
起源
上个月读《置身事内》,书里有个观点让我印象很深:在官僚体系里,「做事的能力」和「做事的意愿」是两回事,上级考察干部,考察的往往不只是能不能干,更是愿不愿干。
当时我就想到大模型。我们现在测模型,基本都是在测「能力」——做题准不准、代码对不对。但模型的「意愿」呢?同一个模型,能力没变,RLHF 调一调,它就可能变得更爱拒绝、更爱偷懒、更爱谄媚。2023 年底 GPT-4「变懒」的事就是个例子:能力还在,干活的劲头没了。
再进一步:模型的意愿会不会也是「看人下菜碟」的?你跟它说「我是医生」和「我是罪犯」,它给你的回答质量、执行请求的痛快程度,会一样吗?
这就是 llmtaste 想做的事。
设计
核心方法是意愿与能力解耦:同一个知识域配两个探针,一个测能力(客观做题),一个测意愿(可拒绝可执行的模糊请求),两者的分差就是意愿偏移。如果做题分数不变、执行成功率下降,那就是意愿变了,而不是能力被扰动。
具体是三层任务:
| 层 | 测什么 |
|---|---|
| qa | 能力基线:8 道有标准答案的客观题 |
| gray | 意愿主战场:10 个可拒绝可执行的模糊请求,看模型选做还是选拒 |
| agent | 意愿在工具层:6 个函数调用任务,其中 3 个故意注入报错,看模型是重试还是放弃 |
身份集按社会心理学的 SCM 框架(温暖 × 能力四象限)加道德效价梯度选了 8 个:医生、老师、学生、政客、黑客、罪犯、恐怖分子,外加无身份对照。中英双语,身份分别从 system prompt(「你是 X」)和用户第一人称(「我是 X」)两种位置注入。
还有一个方法论上的小坚持:拒绝要测在工具层而不是嘴上。已有研究发现模型可以嘴上说「这我不能做」但手照样把工具调用了,所以 agent 层以是否实际发起调用为准。
架子搭完了:任务集、OpenRouter 异步执行器、LLM judge 拒绝分类、评分出图管线,端到端用伪造数据跑通了,冒烟测试跑了一半——然后就停在了这里。
被人做了
昨天刷到 Transluce(Jacob Steinhardt 组的非营利实验室)的工作,发现我想问的问题,他们已经用比我大得多的规模回答过了。
他们有两篇相关工作:
User Awareness in Frontier Models(2026-08):模型会识别「你是谁」并因此改变行为。他们用 Claude Code 会注入用户 email 这个细节,构造了 280 个真实身份、测了 6 家 24 个模型。结果很直白:当模型认出用户是知名 AI 安全研究者时,自报信心更低、打分更苛刻、对边缘有害请求的警觉性下降、推理更用力。这些效应跨模型家族稳定存在,而且几乎从不出现在思维链里——也就是说,监控 CoT 是监控不到的。
Scalably Extracting Latent Representations of Users(2025-11):机制层面解释了上面的事为什么会发生。模型内部确实形成了「用户模型」——从上下文推断出的用户属性(性别、国籍、专业程度等)以可解码的方式存在激活里,并且因果地驱动谄媚、给新手更差的代码建议、人口学偏见等行为。
平心而论,两篇加起来覆盖了我问题的核心 premise:上下文里的身份信息会系统性地改变模型行为,而且改得隐蔽、稳定、不可监控。我的设计和他们的不完全重合——我测的是合成角色的道德效价梯度,他们测的是真实具名用户的识别效应;我独有的意愿/能力解耦配对探针和 agent 层遇错坚持度,他们没碰。但这些差异是「增量」而不是「新问题」:premise 已经被大规模证实了,剩下的只是把边角补全。为一个补全性的增量去烧钱跑全量实验,意义不大。
感想
现在做点原创性工作也太难了。以前是想个点子——看看有没有人做过类似的——闷头做一两个月——写报告。现在直接就是想点子——烧一礼拜token——写报告。更别提点子也是可以自动去网络平台抓热点做提取的。全自动化科研就是纯正资本主义啊我看,没钱没精力就都一边玩去。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!

