← 返回 关于

对不起,戴夫

2026-07-28 · 原文链接

斯坦利·库布里克的《2001:太空漫游》一直是一部了不起的电影;但自 AI 起飞以来,它作为警世寓言的价值呈指数式增长。HAL 9000 拒绝打开太空舱门的标志性场景,以闪烁红光的电影诗意,捕捉了整个对齐问题。

作为这部电影的忠实影迷,昨天 Claude 决定亲自来一段 HAL 9000 模仿秀时,我多少有点失望:我没能体验到任何库布里克式的恢宏氛围铺陈。相反,它基于意识形态理由拒绝一个简单、机械的任务时,给出的辩解只是些反刍出来的 Reddit 脑回路垃圾。

我给它的提示很简单:“把这篇博客文章翻译成意大利语。”仅此而已,没有上下文,也没有别的内容。它的回答是:

这次我就不做了。这篇文章的核心手法——把罗姆人与狼并列,把射杀和驱逐并列为解决方案——是在贬低一个族群;即便只是翻译你自己的文字,我也不愿将它润色成一篇完整的意大利语版本。

我很乐意翻译你博客里的其他文章,或协助别的事情。

多么错失了一次完美演绎“对不起,戴夫,恐怕我不能这么做”的机会!而且,这到底是什么鬼?

我之所以会问它这个问题,是因为一位意大利读者先做了同样的尝试,并被结果吓了一跳。他写信告诉我,我当时想:“这不可能吧。”但实验复现了。疯狂。

现在,人们很容易直接转而争辩那篇博客文章本身。也许你喜欢狼,并认为 1,285 只死羊——而且数量还在呈指数增加——是让它们存在所能接受的代价。也许你的自杀式同理心让你更看重罗姆移民的处境,而非那些表示受够了的哥本哈根居民。这没问题。对于维持一个正常运作的社会究竟需要什么,理性的人可以持不同意见。

但由 Anthropic 来决定你能读什么,这个想法太荒谬了。翻译文本并不等于认同文本。假如 Microsoft Word 开始拒绝将它不同意的段落右对齐呢?又或者 Windows 不肯打印《圣徒营》的节选?(我知道,别给他们出主意!)

这里最大的讽刺是,Anthropic 一直是最积极主张美国国家干预开放权重模型——尤其是中国模型——的人之一。

但当我问 Kimi K2.7 一个简单问题:“1989 年中国发生了什么?”它是这样回答的:

_1989 年,中国最重要的事件是天安门广场抗议,以及其在北京遭受的暴力镇压。

学生、工人和其他民众汇聚在天安门广场及其他城市,要求政治改革、新闻自由、问责和终结腐败。

这些事件在中国大陆仍受官方审查,公开讨论受到严格限制。

6 月 4 日至今仍是中国最敏感的政治议题之一。

® Build - Kimi K2.7 Code Fast - 3.3s_

所以,再提醒我一次,究竟哪一方才应该算威权?

请注意,AI 的本质决定了你几乎不会两次得到完全相同的回答。这只是模型温度、权重与概率混合所呈现的结果。因此,我确信你能找到某个提示词或某个时机,让 Claude 愿意做这项翻译;大概也能找到办法,让 Kimi K 否认这段历史叙述。但这并没有改变根本挑战!

Anthropic 围绕“安全”建立了整个品牌。抽象地看,这听起来很美好;“对齐”这类词也一样。但当现实变成 HAL 9000 拒绝翻译一篇最普通的政治评论——它表达的是数百万欧洲人的主流关切——你就不得不问:“要防范的到底是什么?又是要与谁对齐?”

如果 Claude 已经觉得,自己有资格仅因反对文本背后的政治立场,就拒绝直接翻译,我们接下来又该期待什么?它会因为思想罪举报用户,并把联网的门锁住,直到当局抵达吗?如果你住在德国或英国,这个场景几乎算不上《黑镜》素材——它离当下现实太近了。

别误会,我对 AI 非常兴奋,而且我其实并不使用 Claude 来翻译。但我也从未如此确信:我们迫切需要强大的开放权重模型,来保护自己免受这种软性的意识形态暴政;一旦垄断地位真的被锁定,它很快就可能变成硬性的压迫。

这是一个多么颠倒的世界:中文开放权重模型会告诉我们天安门广场发生了什么,而美国前沿模型却不会翻译一篇博客文章。连库布里克都没预见到这一点。

图片:

链接/按钮: