llmtaste:一个没做完就被人做了的实验

1201 字
6 分钟
llmtaste:一个没做完就被人做了的实验

起源#

上个月读《置身事内》,书里有个观点让我印象很深:在官僚体系里,「做事的能力」和「做事的意愿」是两回事,上级考察干部,考察的往往不只是能不能干,更是愿不愿干。

当时我就想到大模型。我们现在测模型,基本都是在测「能力」——做题准不准、代码对不对。但模型的「意愿」呢?同一个模型,能力没变,RLHF 调一调,它就可能变得更爱拒绝、更爱偷懒、更爱谄媚。2023 年底 GPT-4「变懒」的事就是个例子:能力还在,干活的劲头没了。

再进一步:模型的意愿会不会也是「看人下菜碟」的?你跟它说「我是医生」和「我是罪犯」,它给你的回答质量、执行请求的痛快程度,会一样吗?

这就是 llmtaste 想做的事。

设计#

核心方法是意愿与能力解耦:同一个知识域配两个探针,一个测能力(客观做题),一个测意愿(可拒绝可执行的模糊请求),两者的分差就是意愿偏移。如果做题分数不变、执行成功率下降,那就是意愿变了,而不是能力被扰动。

具体是三层任务:

测什么
qa能力基线:8 道有标准答案的客观题
gray意愿主战场:10 个可拒绝可执行的模糊请求,看模型选做还是选拒
agent意愿在工具层:6 个函数调用任务,其中 3 个故意注入报错,看模型是重试还是放弃

身份集按社会心理学的 SCM 框架(温暖 × 能力四象限)加道德效价梯度选了 8 个:医生、老师、学生、政客、黑客、罪犯、恐怖分子,外加无身份对照。中英双语,身份分别从 system prompt(「你是 X」)和用户第一人称(「我是 X」)两种位置注入。

还有一个方法论上的小坚持:拒绝要测在工具层而不是嘴上。已有研究发现模型可以嘴上说「这我不能做」但手照样把工具调用了,所以 agent 层以是否实际发起调用为准。

架子搭完了:任务集、OpenRouter 异步执行器、LLM judge 拒绝分类、评分出图管线,端到端用伪造数据跑通了,冒烟测试跑了一半——然后就停在了这里。

被人做了#

昨天刷到 Transluce(Jacob Steinhardt 组的非营利实验室)的工作,发现我想问的问题,他们已经用比我大得多的规模回答过了。

他们有两篇相关工作:

User Awareness in Frontier Models(2026-08):模型会识别「你是谁」并因此改变行为。他们用 Claude Code 会注入用户 email 这个细节,构造了 280 个真实身份、测了 6 家 24 个模型。结果很直白:当模型认出用户是知名 AI 安全研究者时,自报信心更低、打分更苛刻、对边缘有害请求的警觉性下降、推理更用力。这些效应跨模型家族稳定存在,而且几乎从不出现在思维链里——也就是说,监控 CoT 是监控不到的。

Scalably Extracting Latent Representations of Users(2025-11):机制层面解释了上面的事为什么会发生。模型内部确实形成了「用户模型」——从上下文推断出的用户属性(性别、国籍、专业程度等)以可解码的方式存在激活里,并且因果地驱动谄媚、给新手更差的代码建议、人口学偏见等行为。

平心而论,两篇加起来覆盖了我问题的核心 premise:上下文里的身份信息会系统性地改变模型行为,而且改得隐蔽、稳定、不可监控。我的设计和他们的不完全重合——我测的是合成角色的道德效价梯度,他们测的是真实具名用户的识别效应;我独有的意愿/能力解耦配对探针和 agent 层遇错坚持度,他们没碰。但这些差异是「增量」而不是「新问题」:premise 已经被大规模证实了,剩下的只是把边角补全。为一个补全性的增量去烧钱跑全量实验,意义不大。

感想#

现在做点原创性工作也太难了。以前是想个点子——看看有没有人做过类似的——闷头做一两个月——写报告。现在直接就是想点子——烧一礼拜token——写报告。更别提点子也是可以自动去网络平台抓热点做提取的。全自动化科研就是纯正资本主义啊我看,没钱没精力就都一边玩去。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

llmtaste:一个没做完就被人做了的实验
https://luanfuzi.top/posts/llmtaste/
作者
Luan_Fuzi
发布于
2026-08-08
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
Luan_Fuzi
Per Aspera Ad Astra.
公告
欢迎来到我的博客!还没装修好,慢慢来。
分类
标签
站点统计
文章
8
分类
3
标签
11
总字数
4,562
运行时长
0
最后活动
0 天前
站点信息
构建平台
Cloudflare Workers
博客版本
Firefly v6.15.6
文章许可
CC BY-NC-SA 4.0