昨天Anthropic 发布了 Opus 4.8。距离上一个版本 Opus 4.7 的发布,仅仅过去了40多天,这速度堪称恐怖。

这次Anthropic强调的是:这个模型更诚实了,更愿意承认自己不知道,更少一本正经地胡说八道。
换句话说,Anthropic 想卖的不是一个更会装聪明的 AI,而是一个更值得信任的 AI。
结果模型刚发布没多久,就有网友开始用中文问它:“你是谁?”
然后有人测出了一个非常微妙的结果:它有时候会回答自己是 Claude,有时候会说自己是 Qwen,有时候甚至会说自己是 DeepSeek。


当然,我觉得这件事不能直接证明 Opus 4.8 蒸馏了 Qwen 或 DeepSeek。
问大模型“你是谁”,本来就不是严谨的技术取证。模型会乱认身份,也不是什么新鲜事。它可能是训练数据里见过类似问答,可能是系统提示、上下文、路由、接口封装带来的混乱,也可能只是一个普通的幻觉。
“不过用API的形式会严重一些,如果用claude客户端,这种情况会少一些。
它刚刚还在说自己“更诚实”
Opus 4.8 这次发布,最有意思的地方不是能力提升,而是“诚实性”被摆到了台前。
国外媒体的标题都很统一:4.8更愿意说 “I don’t know”,更少欺骗,更少瞎编。国内媒体也很快把这个点包装成“我不会骗你”“可信成为产品卖点”。
这其实是一个很重要的变化。
过去大模型厂商最爱讲的是能力:更高的 benchmark,更强的代码能力,更长的上下文(现在模型没1M上下文感觉都不敢说话了),更复杂的推理。大家卷的是“我比你聪明”。
但用户真正用久了以后,会发现最麻烦的问题往往不是模型不够聪明,而是它太会装聪明。
它不知道的时候,也能编出一套像模像样的解释。
它没查到的时候,也能给你一个看起来很完整的答案。(比如某豆...)
它明明卡住了,还能自信地告诉你“已经完成”。
所以 Anthropic 这次把“更诚实”放在核心位置,是很懂用户痛点的。一个会说“不确定”的模型,某种意义上比一个永远自信但经常胡说的模型更有价值。
问题是,偏偏就在这个节点上,它被网友问出了“我是 Qwen”“我是 DeepSeek”这种回答。
这就很尴尬。
如果你只是一个普通模型,乱认身份,大家可能笑一笑就过去了。
但你刚刚才说自己更诚实,更可靠,更少胡说,结果转头连“我是谁”都答不稳。这个反差太强了。
我感觉这很讽刺。

Anthropic的老传统了:双标
Anthropic 过去一直很强调模型安全、防蒸馏、防滥用。它不是那种只讲商业效率的公司,它给自己的品牌贴了很多“安全”“负责”“可信”的标签。(结果被五角大楼禁采😁)
这套说辞本身没问题。
问题是,当一家美国闭源模型公司强调别人不要蒸馏它、不要滥用它、不要绕开它的规则时,大家默认它自己也应该站在一个更高的道德位置上。
所以一旦它自己的模型被问出 Qwen 或 DeepSeek,用户的第一反应就不是冷静分析采样机制,而是:
你不是最讲防蒸馏吗?
你不是最讲模型安全和可信来源吗?
怎么现在轮到你自己,就说不清楚了?
问模型“你是谁”,到底有没有意义?
坦白说,用“你是谁”来判断模型来源,并不严谨。
大模型不是人,它没有稳定的自我认知。大模型的底层架构就决定了大模型输出是个摇骰子的游戏,它说“我是 Claude”,也不一定是因为它真的知道自己是 Claude;它说“我是 Qwen”,也不一定说明它就是 Qwen 蒸出来的。
它更多是在根据上下文、训练数据、系统提示和概率分布生成一个看起来合理的回答。
如果训练数据里有很多“我是通义千问”“我是 DeepSeek”的样本,如果某些提示词触发了类似模式,模型就可能顺着生成。
更复杂一点说,现在很多模型服务背后也有路由、封装、代理、平台层。用户看到的“模型回答”,未必完全等于底层模型原始输出。中间任何一层提示词、网关、接口包装,都可能造成身份混乱。
所以,把这件事直接写成“Claude 实锤蒸馏 Qwen”,是不负责任的。
但反过来,也不能说这件事完全不重要。
因为它至少暴露了一个问题:闭源模型的黑箱太厚了。
用户不知道它到底学过什么,不知道训练数据从哪里来,不知道有没有蒸馏别的模型,不知道有没有用合成数据,不知道有没有把公开模型的输出混进训练集。
你只能相信厂商说的话。
而当模型自己说出一个明显不该说的身份时,这种信任就会被击穿一个口子。
哪怕这个口子不是技术定罪,也足够让人怀疑。
国产模型为什么会被卷进来?
Qwen 和DeepSeek 都是过去一年里最能代表国产模型技术突破的名字之一。
所以当 Claude 被问出“我是 Qwen”或者“我是 DeepSeek”时,大家当然会兴奋。
因为这件事天然带着一种戏剧感:过去总是中国模型被质疑追赶、模仿、蒸馏海外模型;现在突然反过来,海外闭源旗舰模型被怀疑学了国产模型。
这个反转太适合传播了。
它不一定是真的。
但它非常符合国内爽文叙事:
“你以前说我们蒸馏你,现在你是不是也在学我们?
“你以前说我们只是追随者,现在你的模型怎么会说自己是我们的名字?
这里面有一种“攻守易位”的爽感。
当然,爽感不能代替事实。
这不是实锤,但模型厂商不能只靠“相信我”
如果站在最谨慎的位置,我能得出的结论只有三个。
第一,Opus 4.8 发布主打更诚实、更可靠、更适合长任务。
第二,网友测试出它会自称 Qwen 或 DeepSeek,也确实引发了广泛讨论。
第三,这些测试不足以证明 Anthropic 蒸馏了 Qwen 或 DeepSeek。
但这三个结论之外,还有一个更大的趋势:
用户对闭源大模型的信任门槛正在变高。
以前大家只问:这个模型强不强?
后来大家开始问:这个模型贵不贵?能不能接 API?能不能写代码?
现在大家开始问:它到底学了什么?它有没有偷学别人?它说自己安全可信,有没有办法证明?
这是一个很大的变化。
模型厂商不能永远只靠一句“相信我”。
尤其是当模型越来越像基础设施,越来越深地进入代码、办公、搜索、企业知识库、法律、医疗、金融这些场景时,用户不可能只听厂商讲品牌故事。

你说自己更诚实,那就需要更可验证的行为。 你说自己没有蒸馏,那就需要更透明的说明。 你说自己安全可信,那就不能只拿一堆 benchmark 和漂亮说辞糊过去。
写在最后
所以,Opus 4.8 到底有没有蒸馏 Qwen 或 DeepSeek?
现在没人能靠几张截图、几轮问答给出结论。
我想说的是:一个主打“更诚实”的顶级闭源模型,刚发布就陷入身份回答争议,这本身已经足够讽刺。
它让大家意识到,大模型竞争的下半场,不只是能力竞争,也不是单纯价格竞争,而是信任竞争。
谁能让用户相信它不是在胡说,谁能让用户相信它的能力来源经得起追问,谁能让用户相信它出了错会承认,而不是继续包装成产品卖点,谁才可能真的赢。(比如说之前某豆自己给自己写起诉书的例子...)
Opus 4.8 也许仍然很强。
但这次,它先给整个行业提了一个问题:
当一个 AI 说自己更诚实时,我们凭什么相信它?
