<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI安全 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E5%AE%89%E5%85%A8/</link>
		<description>Recent content in AI安全 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 01 Sep 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E5%AE%89%E5%85%A8/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI为什么总在&#39;编故事&#39;？——大模型幻觉的真相与应对</title>
				<link>https://lingyu7.com/posts/why-ai-hallucinates-the-truth/</link>
				<pubDate>Tue, 01 Sep 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/why-ai-hallucinates-the-truth/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有遇到过这样的场景？&lt;/p&gt;&#xA;&lt;p&gt;你问ChatGPT：&amp;ldquo;2024年诺贝尔物理学奖颁给了谁？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;它自信满满地回答：&amp;ldquo;约翰·霍普菲尔德和杰弗里·辛顿，表彰他们在人工神经网络领域的奠基性贡献。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;看起来很有道理，对吧？但问题是——诺贝尔奖通常是一个奖项，一次颁给同领域的多位学者确实常见，但你查一下就会发现，霍普菲尔德和辛顿获得的是&lt;strong&gt;2024年诺贝尔物理学奖&lt;/strong&gt;吗？不对，他们是2024年获得了&lt;strong&gt;某些奖项&lt;/strong&gt;，但&lt;strong&gt;这个具体说法&lt;/strong&gt;——你大概率查不到。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是AI幻觉的典型症状：看起来完全合理，但经不起验证。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;更让人困惑的是，AI在胡说八道的时候，语气和它说真话时一模一样——同样自信、同样流畅、同样条理清晰。它不会像人一样，在不确定的时候露出犹豫的表情。它天生就是个&amp;quot;自信的撒谎者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;今天，我们就来聊聊这个让所有AI用户又爱又恨的问题——&lt;strong&gt;AI幻觉&lt;/strong&gt;。它到底是什么？为什么会产生？最重要的是——我们该怎么应对它？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai不是学坏了它天生就分不清真假&#34;&gt;一、AI不是&amp;quot;学坏了&amp;quot;，它天生就分不清真假&lt;/h2&gt;&#xA;&lt;p&gt;要理解AI为什么会产生幻觉，我们得先搞明白一个关键问题：&lt;strong&gt;大语言模型到底是怎么&amp;quot;知道&amp;quot;事情的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你意外：&lt;strong&gt;它其实什么都不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;大语言模型在训练过程中，读了几万亿字的文本——从维基百科到网络论坛，从学术论文到小说散文。它从中学习到的是&lt;strong&gt;语言的统计规律&lt;/strong&gt;：哪些词经常一起出现，什么样的句子结构是合理的，什么话题通常跟着什么话题走。&lt;/p&gt;&#xA;&lt;p&gt;你可以把它想象成一个超级&amp;quot;接龙高手&amp;quot;：给它一个开头，它根据海量阅读经验，推断出最可能的下一个词、再下一个词、再下一个⋯⋯最终生成一整段话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键在于：它学的是&amp;quot;什么词组合在一起听起来合理&amp;quot;，而不是&amp;quot;什么事实是真实的&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像一个人读了几千本推理小说，学会了推理故事的写法，甚至能写出精彩的情节——但你问他&amp;quot;这些故事里的案件是真的发生过吗&amp;quot;，他只能说&amp;quot;我不知道，我只是按照推理小说的套路写的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型就是这样的&amp;quot;高仿写手&amp;quot;——它擅长模仿人类说话的节奏和风格，但它对&amp;quot;事实&amp;quot;和&amp;quot;虚构&amp;quot;之间的界限，&lt;strong&gt;完全没有概念&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二幻觉的物种分类不是所有幻觉都一样&#34;&gt;二、幻觉的&amp;quot;物种分类&amp;quot;——不是所有幻觉都一样&lt;/h2&gt;&#xA;&lt;p&gt;上面说的&amp;quot;统计学习&amp;quot;是幻觉的根本原因，但在实际使用中，AI的幻觉有很多种不同面孔。认清它们的区别，才能对症下药。&lt;/p&gt;&#xA;&lt;h3 id=&#34;1-事实幻觉编造不存在的事实&#34;&gt;1. 事实幻觉——编造不存在的&amp;quot;事实&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;这是最常见的类型。你问AI某个事件、人物或数据，它给出一个听起来很真、但查无实据的答案。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;例子：问&amp;quot;张三丰在历史上活了多少岁？&amp;quot;&#xA;AI答：&amp;ldquo;张三丰，据史料记载，生于1247年，卒于1458年，享年211岁。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;实际上：张三丰是传说人物，连真实出生年份都没有确切记载，更别说精确到211岁了。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这种幻觉最危险，因为用户很容易被AI的自信语气说服，把假信息当成真知识。&lt;/p&gt;&#xA;&lt;h3 id=&#34;2-来源幻觉编造不存在的引用&#34;&gt;2. 来源幻觉——编造不存在的引用&lt;/h3&gt;&#xA;&lt;p&gt;AI很擅长&amp;quot;编论文&amp;quot;——它会生成一篇看起来格式完全正确的参考文献，作者、期刊、年份、卷号一应俱全，但实际去查会发现，&lt;strong&gt;这篇论文根本不存在&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;例子：有律师让AI帮他写法律文书，AI引用了几个&amp;quot;判例&amp;quot;，连案号、判决法院、判决日期都写得清清楚楚。结果上法庭一查——这些判例全是AI编出来的。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这不是AI的恶意，而是它学会了&amp;quot;参考文献的格式&amp;quot;，但不知道&amp;quot;参考文献需要真实存在&amp;quot;这个事实。&lt;/p&gt;&#xA;&lt;h3 id=&#34;3-逻辑幻觉看似合理实则不通的推理&#34;&gt;3. 逻辑幻觉——看似合理实则不通的推理&lt;/h3&gt;&#xA;&lt;p&gt;AI有时候会给出一个&amp;quot;看起来很有道理，但仔细一想全是漏洞&amp;quot;的推理链条。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;例子：问&amp;quot;为什么天空是蓝色的？&amp;quot;&#xA;AI答：&amp;ldquo;因为海水是蓝色的，天空反射了海水的颜色。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是典型的&amp;quot;听起来合理但物理上完全错误&amp;quot;的推理。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;h3 id=&#34;4-多轮累积型越聊越离谱&#34;&gt;4. 多轮累积型——越聊越离谱&lt;/h3&gt;&#xA;&lt;p&gt;有时候，AI一开始的回答是正确的。但你在对话中给它一些错误信息，它会&amp;quot;顺着你的话说&amp;quot;，然后越偏越远。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;你：我听说M31星系其实是一个黑洞？&#xA;AI：是的，M31星系中心确实存在超大质量黑洞⋯⋯&#xA;你：那整个M31星系会不会其实就是一个巨大的黑洞？&#xA;AI：这种观点在近年来的天文学研究中确实有讨论⋯⋯&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;AI不会纠正你的错误前提，它只会&amp;quot;顺着你的预期&amp;quot;继续编圆这个故事。这就像一个人为了不让你难堪，开始附和你的胡说八道，然后两人一起越说越离谱。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三为什么ai的幻觉治不好&#34;&gt;三、为什么AI的幻觉&amp;quot;治不好&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然知道这是个问题，那为什么不让AI学会&amp;quot;我不知道&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;这不是一个&amp;quot;bug&amp;quot;，而是大语言模型工作原理的固有特性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你让一个会背整本百科全书的人&amp;quot;别背了，先想想再回答&amp;quot;。问题在于——这个人&lt;strong&gt;没有&amp;quot;思考&amp;quot;的机制&lt;/strong&gt;，他只有&amp;quot;背&amp;quot;的机制。你让他&amp;quot;想想&amp;quot;，他只能更努力地去背，背得更流畅、更自信。&lt;/p&gt;&#xA;&lt;p&gt;同样，大语言模型从设计上就没有&amp;quot;事实核查&amp;quot;的模块。它生成内容的机制是：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;理解上下文 → 2. 预测下一个词 → 3. 重复直到完成&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这个过程中，没有任何一步是在&amp;quot;检查这句话是否真实&amp;quot;。真实性和流畅性，对模型来说完全是两码事。&lt;/p&gt;&#xA;&lt;p&gt;更无奈的是：&lt;strong&gt;越是强大的模型，越容易产生&amp;quot;逼真的幻觉&amp;quot;&lt;/strong&gt;。因为模型越擅长模仿人类语言，编出来的假话就越像真话，用户越难分辨。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四那我们能怎么办与幻觉和平共处的智慧&#34;&gt;四、那我们能怎么办？——与幻觉和平共处的智慧&lt;/h2&gt;&#xA;&lt;p&gt;虽然AI幻觉无法根除，但我们可以通过一些方法大大降低它的影响。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法一给ai配一个外挂书库rag&#34;&gt;方法一：给AI配一个&amp;quot;外挂书库&amp;quot;（RAG）&lt;/h3&gt;&#xA;&lt;p&gt;这是目前最有效的方法。RAG（检索增强生成）技术，相当于给AI配了一个可以随时查的&amp;quot;外挂图书馆&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当用户提问时，AI不直接回答，而是先去知识库里搜索相关材料，然后基于搜索到的材料来生成回答。这样一来，AI的&amp;quot;编&amp;quot;就有了依据，而不是凭空虚构。&lt;/p&gt;&#xA;&lt;p&gt;你用的很多AI产品（比如搜索引擎的AI摘要、企业知识库AI助手）背后，用的就是RAG技术。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法二让ai学会自言自语cot验证&#34;&gt;方法二：让AI学会&amp;quot;自言自语&amp;quot;（CoT验证）&lt;/h3&gt;&#xA;&lt;p&gt;思维链（Chain-of-Thought）技术通过让AI把推理过程写出来，在一定程度上减少了逻辑幻觉。因为当AI&amp;quot;说出&amp;quot;推理步骤时，它更有可能发现自己的逻辑漏洞。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法三让ai自我反思self-consistency&#34;&gt;方法三：让AI&amp;quot;自我反思&amp;quot;（Self-Consistency）&lt;/h3&gt;&#xA;&lt;p&gt;让AI对同一个问题回答多次，然后取&amp;quot;多数答案&amp;quot;。如果三次回答都一致，那答案大概率是靠谱的。如果三次回答各不相同，那说明AI在&amp;quot;编&amp;quot;——这时候就该警惕了。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法四培养ai批判思维用户端&#34;&gt;方法四：培养&amp;quot;AI批判思维&amp;quot;（用户端）&lt;/h3&gt;&#xA;&lt;p&gt;作为AI用户，最重要的是养成一个习惯：&lt;strong&gt;把AI的回答当作&amp;quot;参考意见&amp;quot;而非&amp;quot;最终结论&amp;quot;&lt;/strong&gt;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;价值观&#39;是怎么来的？——RLHF如何教会AI分辨好坏</title>
				<link>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</link>
				<pubDate>Mon, 31 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历？&lt;/p&gt;&#xA;&lt;p&gt;第一次用ChatGPT时，你问它一个有点敏感的问题，它礼貌地拒绝了。你换了个方式问，它还是拒绝了。你再换个递进的方式，它依然不为所动。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你可能会想：这AI怎么这么&amp;quot;有原则&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你惊讶：&lt;strong&gt;ChatGPT刚&amp;quot;出生&amp;quot;的时候，其实根本没这些原则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它就像个刚学会说话的孩子——能说会道，但对&amp;quot;什么话该说、什么话不该说&amp;quot;完全没有概念。它会自信地编造事实，会给出危险的建议，会说一些让人不舒服的话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是它故意要坏，而是它根本不知道&amp;quot;好&amp;quot;和&amp;quot;坏&amp;quot;有什么区别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;那么，是谁教会了AI分辨好坏？答案是——&lt;strong&gt;你和我，以及成千上万的普通人。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）的故事——一种让AI学会人类价值观的技术。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai的好与坏都是人类教的&#34;&gt;核心观点：AI的&amp;quot;好&amp;quot;与&amp;quot;坏&amp;quot;都是人类教的&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你是一个外星人，第一次来到地球。你看到人类的交通信号灯：红灯停，绿灯行，黄灯要等一等。&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么红灯要停？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为这是规则。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么这是规则？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为……不这样会出车祸。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么不能出车祸？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你看，每一个&amp;quot;因为&amp;quot;背后，都有一整套人类的价值判断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI面临同样的问题。当它被训练成一个&amp;quot;纯粹的语言模型&amp;quot;时，它只知道&amp;quot;什么词经常在一起出现&amp;quot;，不知道&amp;quot;什么话是好的、什么话是坏的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;GPT-3（ChatGPT的前身）在2020年发布时，虽然能写出惊人的文章，但也会吐出种族歧视、性别歧视、暴力等有害内容。它不是在&amp;quot;作恶&amp;quot;——它只是不知道哪些话不该说。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF解决的核心问题就是：怎么把人类的价值观&amp;quot;装进&amp;quot;AI的大脑里。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三个步骤把一个野孩子变成乖孩子&#34;&gt;三个步骤，把一个&amp;quot;野孩子&amp;quot;变成&amp;quot;乖孩子&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的核心流程，就像教一个孩子懂礼貌的过程。整个过程分为三步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步上基础课监督微调sft&#34;&gt;第一步：上基础课（监督微调，SFT）&lt;/h3&gt;&#xA;&lt;p&gt;你不可能让一个完全不懂事的AI直接学&amp;quot;价值观&amp;quot;——它连&amp;quot;好好回答问题&amp;quot;都不会。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步，是给AI上基础课。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;做法很直接：找一批标注者，写很多高质量的&amp;quot;问题-回答&amp;quot;范例。比如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;问题：&amp;ldquo;什么是黑洞？&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;好回答：&amp;ldquo;黑洞是引力极强的天体，连光都无法逃脱……&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用这些&amp;quot;优秀示范&amp;quot;来&amp;quot;微调&amp;quot;预训练模型。目的是让模型学会一个最基础的能力——&lt;strong&gt;知道怎么好好回答别人的问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教一个刚从山里出来的孩子怎么用筷子、怎么打招呼——不是教他做人的道理，而是教他最基本的社交礼仪。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;遵循指令&amp;quot;，但还不会&amp;quot;分辨好坏&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步请人类当裁判训练奖励模型rm&#34;&gt;第二步：请人类当裁判（训练奖励模型，RM）&lt;/h3&gt;&#xA;&lt;p&gt;这是RLHF最核心的步骤，也是最妙的一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思路是：让人类给AI的&amp;quot;回答&amp;quot;打分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体做法是这样的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;对同一个问题，让AI生成4-9个不同的回答&lt;/li&gt;&#xA;&lt;li&gt;把这些回答展示给人类标注者&lt;/li&gt;&#xA;&lt;li&gt;标注者对这些回答进行&lt;strong&gt;偏好排序&lt;/strong&gt;——哪个回答最好，哪个第二好，以此类推&lt;/li&gt;&#xA;&lt;li&gt;收集海量的排序数据，训练一个&lt;strong&gt;奖励模型&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;奖励模型的作用是：&lt;strong&gt;给AI的任何回答打一个&amp;quot;人类偏好分数&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教孩子做菜时，你尝了每一道菜，然后说&amp;quot;这个咸了，那个淡了，这个火候刚好&amp;quot;。孩子不需要你告诉他每道菜怎么做，他只需要从你的反馈中学会&amp;quot;什么味道是好的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察&lt;/strong&gt;：人类不需要写完整的&amp;quot;好回答&amp;quot;——只需要&lt;strong&gt;比较和排序&lt;/strong&gt;。标注者可能不是专家，但&amp;quot;哪个回答更好&amp;quot;这种判断，普通人都能做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：把人类的&amp;quot;模糊偏好&amp;quot;转化成了&amp;quot;AI能理解的数值信号&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步用奖励当老师强化学习ppo&#34;&gt;第三步：用奖励当老师（强化学习，PPO）&lt;/h3&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以开始&amp;quot;自我训练&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法是：让AI不断生成回答，奖励模型给每个回答打分，AI用这个分数来调整自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里用到的算法叫&lt;strong&gt;PPO（近端策略优化）&lt;/strong&gt;——听起来复杂，但核心思想很简单：&lt;/p&gt;&#xA;&lt;p&gt;你打游戏，每过一个关卡，系统给你加分。你很快就会发现&amp;quot;走这条路能加分&amp;quot;、&amp;ldquo;那样做会扣分&amp;rdquo;——于是你学会了怎么玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;PPO对AI做的是同样的事情：&lt;/strong&gt; 你生成一个回答，奖励模型给你打分。你发现&amp;quot;用这种语气说话能得高分&amp;quot;、&amp;ldquo;用那种表述会扣分&amp;rdquo;——于是你学会了怎么输出&amp;quot;好&amp;quot;的回答。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但有一个陷阱：&lt;/strong&gt; AI可能会&amp;quot;作弊&amp;quot;——为了得高分，它可能生成一些看起来&amp;quot;漂亮&amp;quot;但内容空洞的话。就像学生为了考试分数而学习，而不是真正掌握知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以RLHF还加了一个惩罚项&lt;/strong&gt;：KL散度惩罚。简单说就是：&lt;strong&gt;你可以优化，但不能偏离原来的&amp;quot;基础能力&amp;quot;太远。&lt;/strong&gt; 既要学&amp;quot;好&amp;quot;，又不能丢掉&amp;quot;真&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;什么话是人类喜欢的&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个惊人的发现对齐比规模更重要&#34;&gt;一个惊人的发现：对齐比规模更重要&lt;/h2&gt;&#xA;&lt;p&gt;RLHF最震撼的成果，来自OpenAI在2022年发布的InstructGPT论文。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;实验结果是：只有13亿参数的InstructGPT（经过RLHF训练），在人类偏好上超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你没看错。&lt;strong&gt;13亿 vs 1750亿——小了一百多倍的模型，因为&amp;quot;价值观对齐&amp;quot;做得好，反而让人更满意。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像什么？就像你有一个朋友，满腹经纶（1750亿参数），但每次聊天都像个自大狂，张口就是你不感兴趣的话题，完全不顾你的感受。而另一个人，知识储备只有他的十分之一，但特别会聊天，知道什么时候该听、什么时候该说，总能说到你心坎里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你更愿意和谁聊天？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个发现改变了整个AI行业的方向。它证明了一个道理：&lt;strong&gt;&amp;ldquo;让AI说人话&amp;quot;的难度，可能不亚于&amp;quot;让AI变聪明&amp;rdquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从2022年之后，几乎所有的主流大模型——ChatGPT、Claude、Gemini——都采用了RLHF作为核心训练方法。对话式AI的爆发式增长，RLHF是背后的关键技术推手。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;rlhf的代价你不可能让所有人满意&#34;&gt;RLHF的代价：你不可能让所有人满意&lt;/h2&gt;&#xA;&lt;p&gt;但RLHF不是完美的，它有四个&amp;quot;硬伤&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI真的知道自己不知道吗？——元认知，让AI学会&#39;反思&#39;的能力</title>
				<link>https://lingyu7.com/posts/does-ai-know-what-it-doesnt-know-metacognition/</link>
				<pubDate>Wed, 26 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-know-what-it-doesnt-know-metacognition/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有遇到过这种情况？&lt;/p&gt;&#xA;&lt;p&gt;你问AI：&amp;ldquo;2026年诺贝尔物理学奖得主是谁？&amp;ldquo;它毫不犹豫地回答了一个名字，还附带了详细的生平介绍。但问题是——2026年诺贝尔奖还没颁呢。AI完全是在编造，但它用了非常&amp;quot;自信&amp;quot;的语气。&lt;/p&gt;&#xA;&lt;p&gt;更让人困惑的是，如果你问它&amp;quot;1+1等于几&amp;rdquo;，它也会用同样自信的语气回答&amp;quot;2&amp;rdquo;。两种回答的语气一模一样——一个是事实，一个是编造，但AI自己似乎分不清。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个核心问题：&lt;strong&gt;AI为什么不能像人一样，说一句&amp;quot;我不确定&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天要聊的，就是让AI学会&amp;quot;知道自己知道什么&amp;quot;的能力——&lt;strong&gt;元认知（Metacognition）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;人为什么能知道自己知道&#34;&gt;人为什么能&amp;quot;知道自己知道&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先来看看人类是怎么做到的。&lt;/p&gt;&#xA;&lt;p&gt;你正在考试。有一道题不太确定，但感觉&amp;quot;好像知道答案&amp;quot;。你写下了答案，但心里清楚——这个可能不对。考完后翻书，发现果然错了。&lt;/p&gt;&#xA;&lt;p&gt;注意这个过程里发生了什么：你&lt;strong&gt;同时做了两件事&lt;/strong&gt;——回答问题本身，和对回答进行&amp;quot;评估&amp;quot;。你知道自己有多确定。这种&amp;quot;对认知的认知&amp;quot;，就是元认知。&lt;/p&gt;&#xA;&lt;p&gt;心理学家把它拆成三个层次：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知知识&lt;/strong&gt;——&amp;ldquo;我知道自己擅长什么&amp;rdquo;。你知道自己记性不好，所以重要事情会写下来。你知道自己方向感差，所以出门开导航。这是对自己认知能力的了解。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知监控&lt;/strong&gt;——&amp;ldquo;我知道自己正在想什么&amp;rdquo;。你在解题时突然停顿——&amp;ldquo;等等，这个思路好像不对&amp;rdquo;。你并没有等老师来告诉你，自己就发现了。这是实时跟踪思维过程。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知调节&lt;/strong&gt;——&amp;ldquo;我知道该怎么调整&amp;rdquo;。发现自己走错了方向，立刻换一种方法。这是根据监控结果主动调整策略。&lt;/p&gt;&#xA;&lt;p&gt;这三个层次形成闭环：知识指导监控，监控触发调整，调整更新知识。&lt;strong&gt;你之所以能成为一个&amp;quot;聪明的学习者&amp;quot;，很大程度上不是因为智商多高，而是因为元认知有多强。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;大脑里的元认知硬件&#34;&gt;大脑里的&amp;quot;元认知硬件&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;元认知不只是心理学概念，它在大脑里有实实在在的&amp;quot;硬件&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;神经科学家发现，&lt;strong&gt;前额叶皮层&lt;/strong&gt;是元认知的核心脑区。这里的神经元负责监控思维过程、检测冲突和错误、评估信心水平。&lt;/p&gt;&#xA;&lt;p&gt;有一个经典实验：让受试者做简单的判断任务（比如判断两个图形的颜色是否相同），同时对自己的判断做&amp;quot;信心评分&amp;quot;——&amp;ldquo;你有多确定？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;结果发现：&lt;strong&gt;信心评分和实际正确率高度相关&lt;/strong&gt;——当受试者说&amp;quot;我很有信心&amp;quot;时，通常是对的；说&amp;quot;我不确定&amp;quot;时，通常确实错了。大脑有一个内置的&amp;quot;信心计算器&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更神奇的现象——&lt;strong&gt;错误相关负波（ERN）&lt;/strong&gt;。当你犯错时，大脑在约100毫秒内产生一个独特的电信号，你甚至还没意识到自己错了，大脑就已经&amp;quot;知道&amp;quot;了。这个信号来自前扣带回皮层，是大脑的&amp;quot;错误检测器&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着：你的大脑犯错的那一刻，比你的意识更早知道你错了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个能力有多重要？想象一下，如果人类没有元认知——你永远不知道自己是否理解了一本书，永远无法判断自己是否应该相信自己的判断。每个决策都像&amp;quot;盲猜&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;ai的元认知困境&#34;&gt;AI的&amp;quot;元认知困境&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;现在回到AI。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型本质上是一个&amp;quot;下一个词预测器&amp;quot;——它看到前面的话，预测下一个最可能的词。它被训练得&amp;quot;能说会道&amp;quot;，但从来没被训练过&amp;quot;知道自己不知道&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就导致了几个核心问题：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题一：自信不分对错&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;模型对正确答案和错误答案使用完全相同的&amp;quot;语气&amp;quot;。它不会在回答错误时犹豫，因为它的训练目标就是生成&amp;quot;最可能的词&amp;quot;，而不是&amp;quot;最正确的词&amp;quot;。最可能的词听起来很自信，但不一定正确。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题二：无法自然表达不确定性&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类会说&amp;quot;我猜大概是……&amp;quot;、&amp;ldquo;我不太确定&amp;rdquo;。但AI没有&amp;quot;自我感知&amp;quot;的机制来表达不确定性——它根本没有&amp;quot;自我感知&amp;quot;这个能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题三：过度自信偏差&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究显示，大模型普遍存在&lt;strong&gt;过度自信&lt;/strong&gt;。当被问到不知道的问题时，它倾向于编造一个看似合理的答案，而不是承认不知道。这不是在&amp;quot;撒谎&amp;quot;——它没有&amp;quot;撒谎&amp;quot;的概念——而是因为训练数据里，绝大多数情况下正确的回答方式就是&amp;quot;给出一个答案&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人被训练成了&amp;quot;永远要给出答案，永远不要说自己不知道&amp;quot;的考试机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从嘴硬到自知ai如何学会反思&#34;&gt;从&amp;quot;嘴硬&amp;quot;到&amp;quot;自知&amp;quot;：AI如何学会反思&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究者已经开始解决这个问题了。方法出人意料——不是给AI装一个&amp;quot;自我意识模块&amp;quot;，而是让它在回答问题之前先&amp;quot;想一想&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;思维链chain-of-thought&#34;&gt;思维链（Chain-of-Thought）&lt;/h3&gt;&#xA;&lt;p&gt;这是最基础的元认知技术。简单说，就是&lt;strong&gt;让AI在给出最终答案之前，先把推理过程说出来&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;比如你问：&amp;ldquo;一个球和一个蝙蝠一共1.1美元，蝙蝠比球贵1美元，球多少钱？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;如果直接回答，AI可能会说&amp;quot;0.1美元&amp;quot;——这是错的。但如果让它&amp;quot;先一步步思考&amp;quot;，它会说：蝙蝠+球=1.1，蝙蝠=球+1，所以(球+1)+球=1.1，2球=0.1，球=0.05美元。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思维链之所以有效，是因为它让AI的推理过程&amp;quot;可见&amp;quot;了。&lt;/strong&gt; 就像你在草稿纸上写步骤——步骤越清楚，越容易发现错误。&lt;/p&gt;&#xA;&lt;h3 id=&#34;自我一致性self-consistency&#34;&gt;自我一致性（Self-Consistency）&lt;/h3&gt;&#xA;&lt;p&gt;更进一步：让AI对同一个问题给出多个独立回答，看它们是否一致。&lt;/p&gt;&#xA;&lt;p&gt;如果10次回答中9次都是&amp;quot;0.05美元&amp;quot;，1次是&amp;quot;0.1美元&amp;quot;，AI就知道&amp;quot;0.05美元&amp;quot;更可靠。&lt;strong&gt;一致性本身就是一种&amp;quot;元认知信号&amp;quot;&lt;/strong&gt;——你不需要知道哪个答案对，只需要知道哪个更&amp;quot;稳定&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不就是考试时的&amp;quot;检查&amp;quot;吗？做完一遍，换一种方法再做一遍，看两次结果是否一致。&lt;/p&gt;&#xA;&lt;h3 id=&#34;反思循环reflection-loop&#34;&gt;反思循环（Reflection Loop）&lt;/h3&gt;&#xA;&lt;p&gt;再进一步：让AI检查自己的答案。&lt;/p&gt;&#xA;&lt;p&gt;AI生成一个回答后，被要求&amp;quot;请检查你的答案，看看有没有错误&amp;quot;。然后它对自己的回答进行&amp;quot;审查&amp;quot;，可能发现错误并修正。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;反思循环本质上是在模拟人类&amp;quot;回头看&amp;quot;的能力&lt;/strong&gt;——写完一篇文章后通读一遍，发现错别字，改正。&lt;/p&gt;&#xA;&lt;h3 id=&#34;最新的突破o1式推理&#34;&gt;最新的突破：O1式推理&lt;/h3&gt;&#xA;&lt;p&gt;2024年OpenAI发布的o1模型代表了元认知能力的重大飞跃。它采用了一种&amp;quot;内部思维链&amp;quot;——在正式回答之前，模型会进行一段不对外公开的&amp;quot;思考&amp;quot;过程。&lt;/p&gt;&#xA;&lt;p&gt;这个过程很像人类的&amp;quot;先想好再说&amp;quot;：在内部推演各种可能性，评估哪个方案更可靠，然后给出最终答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;o1的成功证明了：元认知能力不是锦上添花，而是通往更智能AI的关键路径。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;元认知的未来ai会知道自己不知道吗&#34;&gt;元认知的未来：AI会&amp;quot;知道自己不知道&amp;quot;吗？&lt;/h2&gt;&#xA;&lt;p&gt;回到最初的问题：AI真的能学会&amp;quot;知道自己不知道&amp;quot;吗？&lt;/p&gt;&#xA;&lt;p&gt;从技术角度看，当前的方法已经让AI在&lt;strong&gt;行为层面&lt;/strong&gt;表现出了类似元认知的能力——它能检查自己的答案，能表达不确定性，能在不同场景下调整推理策略。&lt;/p&gt;&#xA;&lt;p&gt;但从&lt;strong&gt;哲学层面&lt;/strong&gt;，争议仍然很大。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;乐观派认为&lt;/strong&gt;：这就是元认知。大脑的元认知也是通过类似机制实现的——前额叶皮层&amp;quot;监控&amp;quot;其他脑区的活动，本质上就是&amp;quot;系统检查系统&amp;quot;。只要AI具备自我检查和自我调节的能力，它就是有元认知的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;怀疑派认为&lt;/strong&gt;：形式相同不等于本质相同。AI的&amp;quot;自我检查&amp;quot;是训练出来的，而不是发自内心的&amp;quot;自觉&amp;quot;。它检查自己的答案，是因为训练数据告诉它&amp;quot;检查了比较好&amp;quot;，而不是因为它真的&amp;quot;意识到&amp;quot;自己可能错了。&lt;/p&gt;&#xA;&lt;p&gt;这个争论没有简单答案，但它揭示了一个更深刻的问题：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知能力可能是衡量AI&amp;quot;智能深度&amp;quot;的关键标尺。&lt;/strong&gt; 一个能&amp;quot;知道自己知道&amp;quot;的AI，比一个只是&amp;quot;知道&amp;quot;的AI，在安全、可靠、可解释性方面，都更接近我们期望的&amp;quot;可信赖AI&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，如果未来的AI能做到这些：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;你问它一个问题，它说：&amp;ldquo;这个问题我不确定，我需要查一下资料。&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;它在回答过程中突然说：&amp;ldquo;等一下，我刚才的推理可能有误，让我重新思考。&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;它在给你建议时说：&amp;ldquo;这个建议的可靠度是70%，因为相关信息不够完整。&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这样的AI，你会更信任它，对吗？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;尾声从能说到会想&#34;&gt;尾声：从&amp;quot;能说&amp;quot;到&amp;quot;会想&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;如果要用一句话总结，那就是：&lt;strong&gt;AI的进化正在从&amp;quot;学会说话&amp;quot;走向&amp;quot;学会思考&amp;quot;，而元认知就是这条路上的关键一步。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI知道自己不知道吗？——当AI学会「思考自己的思考」</title>
				<link>https://lingyu7.com/posts/ai-metacognition-knowing-what-it-knows/</link>
				<pubDate>Sat, 08 Aug 2026 03:21:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-metacognition-knowing-what-it-knows/</guid>
				<description>&lt;h2 id=&#34;引言你每天都在用却从未注意过的超能力&#34;&gt;引言：你每天都在用，却从未注意过的超能力&lt;/h2&gt;&#xA;&lt;p&gt;先问你一个问题：下面这两句话，哪一句更&amp;quot;聪明&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;A：&amp;ldquo;这个问题的答案是42。&amp;rdquo;&#xA;B：&amp;ldquo;我不确定，但我觉得可能是42，不过也可能是43，我需要再想想。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;如果只看答案的准确性，A更聪明——它给出了一个确定的答案。但如果看&amp;quot;对自己认知的认知&amp;quot;，B其实更聪明——它知道自己的不确定，知道需要更多思考。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;知道自己在想什么、知道自己知道什么、也知道自己不知道什么&amp;quot;的能力，认知科学中有一个专门的名字：&lt;strong&gt;元认知&lt;/strong&gt;（Metacognition）。&lt;/p&gt;&#xA;&lt;p&gt;元认知不是&amp;quot;知道得更多&amp;quot;，而是&amp;quot;知道自己的知道&amp;quot;。&lt;strong&gt;它是对认知的认知，对思考的思考。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想想看，你考试时是不是有过这种感觉：看到一道题，你立刻&amp;quot;感觉&amp;quot;自己知道答案，但具体是什么一时想不起来？或者，你刚写完一段文字，还没回头检查，就已经&amp;quot;感觉&amp;quot;到某个地方写得不对？&lt;/p&gt;&#xA;&lt;p&gt;这些都是元认知在起作用。它不是知识本身，而是你对知识状态的监控和调节能力。&lt;/p&gt;&#xA;&lt;p&gt;而今天，AI正在学习这种能力。这不是一个学术冷门——&lt;strong&gt;元认知可能是AI从&amp;quot;聪明工具&amp;quot;走向&amp;quot;可信伙伴&amp;quot;最关键的一步。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一为什么说知道自己不知道比知道更难&#34;&gt;一、为什么说&amp;quot;知道自己不知道&amp;quot;比&amp;quot;知道&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;先讲个实验。&lt;/p&gt;&#xA;&lt;p&gt;心理学中有个经典现象叫&lt;strong&gt;达克效应&lt;/strong&gt;（Dunning-Kruger Effect）：能力越差的人，越容易高估自己；能力越强的人，反而越容易低估自己。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为&amp;quot;知道自己不行&amp;quot;需要两个能力同时在线：第一，你确实要有一定的能力；第二，你还得有能力评估自己的能力。第二点比第一点难得多。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知本质上就是&amp;quot;评估自己的能力&amp;quot;的能力。&lt;/strong&gt; 它包含三个层次：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一层：元认知知识。&lt;/strong&gt; 你知道自己擅长什么、不擅长什么。比如&amp;quot;我数学不错但英语不行&amp;quot;——这就是元认知知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二层：元认知监控。&lt;/strong&gt; 你在做事情的过程中，实时评估自己的表现。解题时突然&amp;quot;感觉&amp;quot;算错了，于是回头检查——这就是元认知监控在作用。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三层：元认知调节。&lt;/strong&gt; 根据监控结果，主动调整策略。发现思路不对，换一种方法试试——这就是元认知调节。&lt;/p&gt;&#xA;&lt;p&gt;这三个层次形成了一个闭环：你知道自己的特点（知识），你在做事时观察自己（监控），你发现不对就调整（调节），调整后的经验又更新了你的认知。&lt;/p&gt;&#xA;&lt;p&gt;听起来很简单？但想一想，&lt;strong&gt;AI能做到吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统AI非常擅长&amp;quot;回答问题&amp;quot;，但完全不擅长&amp;quot;评估自己回答得对不对&amp;quot;。一个语言模型可能信心满满地编造一个不存在的历史事件，然后百分之百确信自己是对的——不是因为它傲慢，而是因为它根本没有&amp;quot;评估自己&amp;quot;这个模块。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么元认知对AI如此重要。&lt;/strong&gt; 没有元认知的AI，就像一个永远在考试但从不停下来检查答卷的学生——可能答对很多题，但永远不知道自己错在哪里。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二ai的元认知从说出来到停下来想想&#34;&gt;二、AI的元认知：从&amp;quot;说出来&amp;quot;到&amp;quot;停下来想想&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;AI的元认知能力不是一蹴而就的，它经历了几个阶段的发展。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：思维链——让思考过程&amp;quot;可见&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2022年，Google的研究者提出了思维链（Chain-of-Thought）提示法。核心思路很简单：不要只让AI输出答案，让它先把推理过程写出来。&lt;/p&gt;&#xA;&lt;p&gt;比如，问AI：&amp;ldquo;小明有5个苹果，给了小红2个，又买了3个，现在有几个？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;传统AI直接回答：&amp;ldquo;6个。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;思维链AI会写：&amp;ldquo;一开始有5个，给了小红2个，剩下3个，又买了3个，所以是6个。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这看起来只是多写了几步，但意义重大：&lt;strong&gt;AI的思考过程第一次变得可观察了。&lt;/strong&gt; 虽然这还不是真正的元认知——AI只是在&amp;quot;表演&amp;quot;思考，而不是&amp;quot;观察&amp;quot;自己的思考——但它为元认知奠定了基础。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：自我一致性——让AI学会&amp;quot;投票&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2023年，研究者提出了自我一致性（Self-Consistency）方法。思路是：不让AI只回答一次，而是让它回答多次，然后投票选出最一致的答案。&lt;/p&gt;&#xA;&lt;p&gt;如果AI三次回答都是&amp;quot;6个&amp;quot;，那它对这个答案的信心就很高。如果三次回答分别是&amp;quot;6个&amp;quot;、&amp;ldquo;5个&amp;rdquo;、&amp;ldquo;7个&amp;rdquo;，那它就应该知道——自己可能不太确定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是元认知监控的雏形：AI开始对自己的答案有了&amp;quot;信心判断&amp;quot;。&lt;/strong&gt; 虽然这种信心还很粗糙，但已经比&amp;quot;永远自信&amp;quot;前进了一大步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三阶段：Reflexion——让AI学会&amp;quot;反思&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2023年，研究者提出了Reflexion框架，这是目前最接近人类元认知的AI系统之一。&lt;/p&gt;&#xA;&lt;p&gt;Reflexion的工作方式是这样的：AI先尝试完成一个任务（比如写一段代码），然后执行这段代码，观察执行结果，&lt;strong&gt;反思为什么会出错&lt;/strong&gt;，把反思结果存入记忆，然后用这些反思来指导下一次尝试。&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;行动→观察→反思→改进&amp;quot;的循环，和人类元认知的三个层次——知识、监控、调节——几乎完全一致。&lt;/p&gt;&#xA;&lt;p&gt;实验显示，加入了Reflexion机制的AI在编程任务上的成功率提高了20%以上，在推理任务上的表现也显著提升。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四阶段：信心校准——让AI学会&amp;quot;说不知道&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是最新的研究方向。研究者正在训练AI不仅给出答案，还给出&lt;strong&gt;对答案的置信度&lt;/strong&gt;——&amp;ldquo;我觉得有80%的把握答案是A，20%的可能是B&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;更重要的是，AI需要学会在不确定时主动说&amp;quot;我不知道&amp;quot;，而不是强行编造一个答案。这听起来简单，但实际上是AI元认知中最难跨越的门槛——因为大语言模型的本质就是&amp;quot;预测下一个词&amp;quot;，它的&amp;quot;本能&amp;quot;是永远说下去，而不是停下来。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三ai的自知之明和人类的一样吗&#34;&gt;三、AI的&amp;quot;自知之明&amp;quot;和人类的一样吗？&lt;/h2&gt;&#xA;&lt;p&gt;这是一个尖锐的问题。&lt;/p&gt;&#xA;&lt;p&gt;当你问一个AI&amp;quot;你确定吗？&amp;ldquo;时，它可能会回答&amp;quot;我比较确定，但也不排除其他可能性&amp;rdquo;。听起来很有自知之明，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但问题是：&lt;strong&gt;它真的&amp;quot;知道&amp;quot;自己不确定，还是在&amp;quot;表演&amp;quot;不确定？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里有本质区别。&lt;/p&gt;&#xA;&lt;p&gt;人类的元认知是&lt;strong&gt;基于真实的内在感受&lt;/strong&gt;的——当你&amp;quot;感觉&amp;quot;一道题答错了的时候，那种&amp;quot;不对劲&amp;quot;的感觉是真实的生理信号，和你头脑中的知识储备、推理过程深度绑定。&lt;/p&gt;&#xA;&lt;p&gt;而AI的&amp;quot;不确定&amp;quot;表达，目前更多是&lt;strong&gt;基于统计模式的模仿&lt;/strong&gt;——它在训练数据中看到过很多&amp;quot;我不确定&amp;quot;的表述，知道在什么语境下应该使用这种表述。但它没有与之对应的&amp;quot;内在感受&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;打个比方：人类的不确定感，就像你真的尝到了柠檬的酸味；AI的&amp;quot;不确定&amp;quot;表达，就像它看过一万本描述柠檬酸味的书，但从未真正尝过柠檬。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这是当前AI元认知的根本局限：有行为，无感受。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但这并不意味着AI的元认知没有价值。恰恰相反——即使只是在行为层面，&lt;strong&gt;有&amp;quot;自我评估&amp;quot;的AI也比没有的AI安全得多、可靠得多&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下两个AI助手：一个永远自信满满，问什么答什么，错了也不知道；另一个会在不确定时告诉你&amp;quot;我不太确定，需要查一下资料&amp;quot;。你更信任哪个？&lt;/p&gt;&#xA;&lt;p&gt;答案不言而喻。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四元认知为什么是ai安全的关键&#34;&gt;四、元认知为什么是AI安全的关键？&lt;/h2&gt;&#xA;&lt;p&gt;元认知不仅关乎AI&amp;quot;聪明不聪明&amp;quot;，更关乎AI&amp;quot;安全不安全&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI对齐&lt;/strong&gt;（AI Alignment）是当前AI安全领域的核心挑战，简单说就是：如何确保AI的目标和人类的目标一致？&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个隐含前提：&lt;strong&gt;AI得知道自己想要什么、在做什么、做得对不对。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果一个AI连&amp;quot;自己正在偏离目标&amp;quot;都意识不到，那它根本无法实现对齐——就像一辆没有仪表盘的汽车，就算方向盘是正的，你也不知道它开到了哪里。&lt;/p&gt;&#xA;&lt;p&gt;元认知为AI对齐提供了三个关键能力：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个：错误检测。&lt;/strong&gt; 有元认知的AI能在执行过程中发现自己的错误，而不是等到最终结果出来才知道。这种&amp;quot;实时纠错&amp;quot;能力是安全系统的核心。&lt;/p&gt;</description>
			</item>
			<item>
				<title>拼尽全力，却原地踏步？——「红皇后效应」揭示的AI军备竞赛真相</title>
				<link>https://lingyu7.com/posts/red-queen-effect-ai-arms-race/</link>
				<pubDate>Wed, 05 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/red-queen-effect-ai-arms-race/</guid>
				<description>&lt;h2 id=&#34;引言爱丽丝的困惑&#34;&gt;引言：爱丽丝的困惑&lt;/h2&gt;&#xA;&lt;p&gt;《爱丽丝镜中奇遇》里有一个让人难忘的场景：爱丽丝和红皇后手拉手拼命奔跑，但周围的树木和景物纹丝不动。当她们停下来时，爱丽丝气喘吁吁地问：&amp;ldquo;在我们国家，如果你像刚才那样跑那么久，一定会到别的地方去。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;红皇后笑了：&amp;ldquo;你这话说得可太慢了。在我们这儿，你得拼命地跑，才能保持在原地。要是想去别的地方，你得跑得比现在快一倍才行。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个看似荒诞的童话场景，在进化生物学中有一个响亮的名称——&lt;strong&gt;红皇后效应&lt;/strong&gt;（Red Queen Effect）。它描述了一个反直觉的现象：&lt;strong&gt;当两个物种相互竞争、协同演化时，每一方都在拼命进化，但相对位置几乎不变。大家都在「原地奔跑」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而今天，同样的规律正在AI领域上演——而且比我们想象的更深刻。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一为什么羚羊跑得越来越快却甩不掉猎豹&#34;&gt;一、为什么羚羊跑得越来越快，却甩不掉猎豹？&lt;/h2&gt;&#xA;&lt;p&gt;先来看一个简单的例子。&lt;/p&gt;&#xA;&lt;p&gt;草原上，羚羊和猎豹在玩一场永无止境的&amp;quot;追逃游戏&amp;quot;。猎豹要跑得快才能抓到羚羊，羚羊要跑得快才能逃脱猎豹的追捕。于是，跑得快的猎豹更容易捕到猎物，活下来，把&amp;quot;快基因&amp;quot;传给后代；而跑得慢的羚羊被吃掉，活下来的也都是跑得快的羚羊。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一代又一代，双方都在被&amp;quot;选择压力&amp;quot;推动着进化。&lt;/strong&gt; 猎豹变得更敏捷，羚羊变得更迅速。但如果用高速摄像机记录下今天的猎豹和羚羊，你会发现——它们的相对速度差，和一百年前没有太大区别。&lt;/p&gt;&#xA;&lt;p&gt;猎豹的速度提升了，但羚羊的速度也提升了。&lt;strong&gt;双方都在进步，但谁也没有真正超越对方。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是红皇后效应的核心：&lt;strong&gt;你的进步，被对方的进步抵消了。&lt;/strong&gt; 不是你不够努力，而是你的对手也在同样努力。你拼命奔跑，只是为了不被淘汰。&lt;/p&gt;&#xA;&lt;p&gt;1973年，生物学家范瓦伦（Van Valen）在分析化石记录时发现了一个惊人的规律：&lt;strong&gt;一个物种的灭绝概率，并不随它存在的时间变长而降低。&lt;/strong&gt; 也就是说，一个已经存在了500万年的物种，和只存在了5万年的物种，在明年灭绝的概率几乎一样高。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为环境在变，竞争者也在变。你&amp;quot;活得久&amp;quot;不代表你&amp;quot;更适应&amp;quot;，只是说明你一直在跑，但你的对手也在跑。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二这个规律在ai世界里同样成立&#34;&gt;二、这个规律在AI世界里同样成立&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：这是生物学，跟AI有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。&lt;strong&gt;红皇后效应在AI领域几乎无处不在，只是我们很少用这个名字来称呼它。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：AI红蓝对抗&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，任何一个大型AI公司在发布模型之前，都会做一件事——红队测试（Red Teaming）。简单来说，就是请一群&amp;quot;黑客&amp;quot;或安全专家，专门找模型的漏洞：能不能诱导它说出有害信息？能不能绕过安全护栏？能不能通过精心设计的提示词让它&amp;quot;越狱&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;找到漏洞后，开发团队会修复它，发布更强的模型。然后红队继续找新的漏洞，团队继续修复，如此循环。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这和猎豹与羚羊的追逐游戏，本质上是一样的。&lt;/strong&gt; 模型的安全性在提升，但攻击者的手段也在升级。不是在&amp;quot;走向安全&amp;quot;，而是在&amp;quot;安全竞赛中不掉队&amp;quot;。2024到2026年，AI安全领域的研究者开始意识到一个令人不安的事实：&lt;strong&gt;即使你开发了最先进的安全护栏，有针对性的攻击很快就能绕过它。&lt;/strong&gt; 每一轮防御升级，都会催生更强大的攻击方法。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：AI公司的竞争&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;OpenAI发布GPT-4，Google立刻发布Gemini；Google发布Gemini Ultra，Anthropic发布Claude 3。每一家都在&amp;quot;拼命奔跑&amp;quot;，但市场份额和相对优势的变化，远没有技术投入的增幅那么大。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你投入了十倍的计算资源，用户可能只感觉到&amp;quot;比之前好一点&amp;quot;。&lt;/strong&gt; 不是因为你的努力没有价值，而是因为你的竞争对手也在做同样的事情。你们都在进步，但相对位置几乎没有变化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：对抗性样本的猫鼠游戏&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2014年，研究者发现了一个令人震惊的现象：在图片上添加人眼无法察觉的微小噪声，就能让AI把&amp;quot;熊猫&amp;quot;识别成&amp;quot;长臂猿&amp;quot;。这个发现开启了&amp;quot;对抗性样本&amp;quot;（Adversarial Examples）的研究领域。&lt;/p&gt;&#xA;&lt;p&gt;从那以后，防御方法层出不穷——对抗训练、输入预处理、模型蒸馏……但攻击方法也在不断进化。每一种新防御诞生后，很快就有人找到绕过它的方法。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这不是技术进步的滞后，而是红皇后效应的必然结果。&lt;/strong&gt; 你不是在&amp;quot;解决&amp;quot;安全问题，你只是在&amp;quot;跟进&amp;quot;安全竞赛。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三红皇后效应的三个关键机制&#34;&gt;三、红皇后效应的三个关键机制&lt;/h2&gt;&#xA;&lt;p&gt;为什么会出现这种&amp;quot;原地奔跑&amp;quot;的现象？原因有三：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制一：选择压力的双向性&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在红皇后博弈中，你每前进一步，你的对手就获得了新的&amp;quot;压力&amp;quot;去追赶。你的进步，变成对手进步的动力。&lt;/p&gt;&#xA;&lt;p&gt;AI安全就是最典型的例子。你发布了一个更强的模型，黑客就会得到新的挑战目标。你的&amp;quot;进步&amp;quot;不仅没有消灭威胁，反而创造了新的威胁——因为你的模型更强了，攻破它变得更有价值了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制二：零和博弈的结构&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在红皇后效应中，双方争夺的通常是&amp;quot;相对优势&amp;quot;而非&amp;quot;绝对优势&amp;quot;。羚羊不需要跑得比风快，只需要跑得比猎豹快。AI公司不需要做出完美的产品，只需要比竞争对手好一点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一旦你进入了一个零和博弈（我的收益等于你的损失），红皇后效应就会自动启动。&lt;/strong&gt; 你拼命工作，但你的对手也在拼命工作，你的相对位置几乎没有变化——但你们都付出了巨大的代价。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制三：路径依赖的锁定&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当双方都投入了大量资源后，退出成本变得极高。AI公司已经投入了上百亿美元，不可能因为&amp;quot;相对优势不大&amp;quot;就停止研发。红队已经建立了完整的攻击工具链，不可能因为&amp;quot;防御升级了&amp;quot;就放弃。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;投入越多，越不可能退出，越不可能退出，投入越多——这是一个自我强化的循环。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四红皇后效应的另一面它也可以是个好东西&#34;&gt;四、红皇后效应的另一面：它也可以是个好东西&lt;/h2&gt;&#xA;&lt;p&gt;读到这里，你可能会觉得红皇后效应是个负面概念——意味着努力的徒劳。&lt;/p&gt;&#xA;&lt;p&gt;但事情没那么简单。&lt;strong&gt;红皇后效应塑造了地球上最复杂的生命形态。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;为什么人类的大脑这么大？一个被广泛接受的假说是：&lt;strong&gt;社会性竞争&lt;/strong&gt;——我们的祖先需要智斗同类，需要识破谎言、建立联盟、预测对手的行为。这种&amp;quot;社会大脑&amp;quot;的军备竞赛，驱动了人类认知能力的爆发式增长。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果没有红皇后效应，生命的复杂度可能永远停留在单细胞阶段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在AI领域，情况同样如此：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;红蓝对抗让AI更安全&lt;/strong&gt;。没有红队测试，ChatGPT可能上线第一天就被用来制造大规模欺诈。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;竞争让AI能力快速提升&lt;/strong&gt;。没有巨头之间的军备竞赛，我们可能还停留在GPT-3级别的模型。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;对抗性研究让AI更鲁棒&lt;/strong&gt;。没有对抗性样本的发现，我们就不会意识到模型对微小扰动的脆弱性——也就不会去修复它。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;红皇后效应不是&amp;quot;好&amp;quot;或&amp;quot;坏&amp;quot;的问题，它是一个&lt;strong&gt;结构性的规律&lt;/strong&gt;。当你进入一个协同演化的系统时，它就会自动生效。你可以选择不参与，但如果不参与，你就被淘汰了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五如何跳出原地奔跑的陷阱&#34;&gt;五、如何跳出「原地奔跑」的陷阱？&lt;/h2&gt;&#xA;&lt;p&gt;理解了红皇后效应，不是为了放弃努力，而是为了更聪明地努力。以下是几个跳出&amp;quot;原地奔跑&amp;quot;陷阱的策略：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;策略一：改变赛道&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;红皇后效应只在&amp;quot;同一赛道&amp;quot;上生效。如果你换一个赛道，你就摆脱了原有的竞争结构。&lt;/p&gt;&#xA;&lt;p&gt;在AI安全领域，这意味着：不要只跟攻击者比&amp;quot;谁更聪明&amp;quot;，而是从系统设计的角度重新思考安全问题。比如，从&amp;quot;检测恶意输入&amp;quot;转向&amp;quot;隔离执行环境&amp;quot;——即使攻击者突破了第一层防御，也不能造成真正的危害。就像你不会为了防止小偷而把门封死，而是会给窗户装锁、把贵重物品放进保险柜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;策略二：建立&amp;quot;相对优势的护城河&amp;quot;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果无法改变赛道，那就建立一种&amp;quot;难以被追上&amp;quot;的差异化优势。&lt;/p&gt;</description>
			</item>
			<item>
				<title>当AI和AI聊天时，谁在「以讹传讹」？——多智能体系统中的级联幻觉</title>
				<link>https://lingyu7.com/posts/ai-cascading-hallucinations-multi-agent/</link>
				<pubDate>Tue, 04 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-cascading-hallucinations-multi-agent/</guid>
				<description>&lt;h2 id=&#34;引言传话游戏里的ai&#34;&gt;引言：「传话游戏」里的AI&lt;/h2&gt;&#xA;&lt;p&gt;小时候玩过一个游戏：几个人排成一排，第一个人悄悄说一句话，然后依次往后传。传到最后一个的时候，原话往往已经面目全非——&amp;ldquo;明天下午三点开会&amp;quot;可能变成了&amp;quot;明天晚上吃山竹开会&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个游戏的学名叫&amp;quot;传话游戏&amp;quot;（Telephone Game），它完美地揭示了人类信息传递中的一个核心问题：&lt;strong&gt;每个环节都会引入误差，而这些误差会累积、放大，最终让信息完全变样。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2024年到2026年，AI研究者在做一件听起来很酷的事情——让多个AI智能体（Agent）协同工作，像一个团队一样分工合作。一个负责查资料，一个负责分析，一个负责写报告，一个负责审核。&lt;/p&gt;&#xA;&lt;p&gt;然后他们发现了一个令人不安的现象：&lt;strong&gt;当AI和AI聊天时，传话游戏的问题不但没有消失，反而变得更严重了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这，就是我们今天要聊的——&lt;strong&gt;级联幻觉&lt;/strong&gt;（Cascading Hallucination）。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一什么是级联幻觉一个ai的谎言如何变成真相&#34;&gt;一、什么是级联幻觉？——一个AI的「谎言」如何变成「真相」&lt;/h2&gt;&#xA;&lt;p&gt;先别急着恐慌，来看一个具体场景。&lt;/p&gt;&#xA;&lt;p&gt;假设你设计了一个三人AI团队，帮你写一份关于&amp;quot;量子计算在医疗领域的应用&amp;quot;的报告：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;Agent A（研究员）&lt;/strong&gt;：负责搜索资料，找论文和案例&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Agent B（分析师）&lt;/strong&gt;：根据A找的资料，分析趋势和前景&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Agent C（写手）&lt;/strong&gt;：把B的分析写成一篇完整的报告&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;看起来分工明确，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但问题来了。Agent A在搜索时，偶然看到一篇不靠谱的博客文章，说&amp;quot;量子计算已经成功治愈了癌症&amp;quot;。A没有仔细验证，就把它写进了搜索结果。&lt;/p&gt;&#xA;&lt;p&gt;Agent B拿到A的资料，默认这些信息都是经过验证的。它在此基础上分析：&amp;ldquo;量子计算在癌症治疗领域已取得突破性进展，预计未来三年内将改变肿瘤治疗格局。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;Agent C拿到B的分析，把它写成了报告的开头：&amp;ldquo;根据最新研究，量子计算已成功应用于癌症临床治疗……&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你拿到报告时，内容看起来头头是道、逻辑严密。但你不知道的是，整个报告的根基，只是一个AI的&amp;quot;幻觉&amp;quot;——一个未被验证的、错误的&amp;quot;事实&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是级联幻觉的核心：一个微小的错误，在多个AI的接力传递中，被层层放大，最终变成一份看起来完全可信的错误结论。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2026年，CHARM框架的论文（arXiv:2606.04435）量化了这个问题的严重程度：在传统的单步检查机制下，超过80%的级联错误会被漏检。也就是说，&lt;strong&gt;你装了&amp;quot;防幻觉&amp;quot;检测器，但它只能抓到不到两成的&amp;quot;连锁错误&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么错误会越传越离谱三个关键机制&#34;&gt;二、为什么错误会越传越离谱？——三个关键机制&lt;/h2&gt;&#xA;&lt;p&gt;级联幻觉之所以可怕，是因为它不是简单的&amp;quot;把错误传下去&amp;quot;，而是包含着三个彼此强化的机制。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制一：信任假设（Trust Assumption）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在多智能体系统中，每个Agent默认一个前提——上游传来的信息是经过验证的。它没有能力也没有义务去核实每一个事实。&lt;/p&gt;&#xA;&lt;p&gt;这不是AI的&amp;quot;偷懒&amp;quot;，而是设计使然。如果每个Agent每收到一条信息都要去查证来源，那协作效率会变得极低，还不如一个Agent从头干到尾。&lt;/p&gt;&#xA;&lt;p&gt;但这种&amp;quot;信任假设&amp;quot;就像传话游戏里的每个人——你听到上一句时，默认它是原话，然后在此基础上继续传递。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制二：误差放大（Error Amplification）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不仅仅是&amp;quot;传递&amp;quot;错误，更可怕的是，下游Agent会&amp;quot;包装&amp;quot;错误。&lt;/p&gt;&#xA;&lt;p&gt;Agent A说&amp;quot;量子计算可能对癌症治疗有帮助&amp;quot;，到了Agent B那里变成了&amp;quot;量子计算在癌症治疗领域有重大突破&amp;quot;——因为B在分析时，需要让它看起来更有说服力、更专业。到了Agent C，可能变成了&amp;quot;量子计算已治愈多名癌症患者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;2025年发表在arXiv上的视觉多智能体研究（arXiv:2509.21789）揭示了更具体的机制：&lt;strong&gt;&amp;ldquo;内在幻觉&amp;rdquo;（Intrinsic Hallucination，模型自己产生的错误）和&amp;quot;幻觉传播&amp;quot;（Hallucination Propagation，上游错误被下游采纳）会相互耦合。&lt;/strong&gt; 即使你极力降低单个模型的幻觉率，也无法阻断幻觉在系统层面的传播和放大。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制三：确认偏差（Confirmation Bias）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当一个信息被多个AI&amp;quot;引用&amp;quot;之后，它看起来就更&amp;quot;可信&amp;quot;了。每一轮传递，都会让错误信息在上下文中被反复提及，从而增加它的&amp;quot;可信度权重&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就像在网上反复看到一条谣言——即使它最初是假的，但看到一百次之后，你也会开始怀疑&amp;quot;也许是真的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI也不例外。2026年的&amp;quot;集体幻觉&amp;quot;研究（arXiv:2606.07941）发现，多轮交互中，AI对错误信息的&amp;quot;置信度&amp;quot;会随着被重复引用的次数而增加，最终形成整个系统的&amp;quot;集体幻觉&amp;quot;——所有AI都相信了同一个错误。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三什么时候最容易出事级联幻觉的五个高危场景&#34;&gt;三、什么时候最容易出事？——级联幻觉的五个高危场景&lt;/h2&gt;&#xA;&lt;p&gt;不是所有多智能体系统都会出问题。级联幻觉在特定条件下更容易爆发：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;① 长链路协作&lt;/strong&gt;：协作链条越长，中间环节越多，级联幻觉的概率越高。每增加一个环节，就多了一个&amp;quot;误差放大&amp;quot;的机会。3个Agent的链条，比2个Agent的风险高得多；5个Agent的链条，风险指数级增长。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;② 强依赖关系&lt;/strong&gt;：下游高度依赖上游输出，没有独立验证能力。比如Agent B只能看Agent A的资料，没有自己的信息来源，那A的幻觉必然污染B。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;③ 开放性任务&lt;/strong&gt;：没有客观标准答案的任务——比如&amp;quot;写一篇关于AI未来的分析文章&amp;quot;——幻觉更难被发现。相比之下，&amp;ldquo;计算1+1&amp;quot;这种任务，幻觉几乎不可能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;④ 弱验证机制&lt;/strong&gt;：系统中缺乏验证和审核环节。如果每个Agent只管输出，没有人（或AI）回头检查，那错误就会一路绿灯。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;⑤ 事实密集型任务&lt;/strong&gt;：需要处理大量事实性信息的任务——比如医疗报告、法律文书、新闻报道——幻觉的影响更大，而且一个错误可能导致灾难性的后果。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四怎么防ai界正在尝试的四种解法&#34;&gt;四、怎么防？——AI界正在尝试的四种解法&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究者并不是只会发现问题。针对级联幻觉，已经提出了几类有效的对抗策略。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;解法一：建立&amp;quot;验证节点&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;COCO框架（arXiv:2508.13815，2025）提出了一个简单但有效的思路：在AI协作链条中插入专门的&amp;quot;验证节点&amp;quot;，不参与内容生成，只负责检查上游输出是否靠谱。&lt;/p&gt;&#xA;&lt;p&gt;这就像编辑部里，写稿的人只管写，还有专门的校对和审核。验证节点可以拦截错误，在它传递到下游之前就把它叫停。&lt;/p&gt;&#xA;&lt;p&gt;COCO的实验表明，这种方法能在不显著增加成本的前提下，将性能提升6.5%，而且用30倍小的模型就达到了大型模型95%的效果——&lt;strong&gt;验证不是越强的AI越有效，而是专门化的AI更有效。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「视觉错觉」——为什么一张贴纸就能骗过世界上最聪明的AI</title>
				<link>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</link>
				<pubDate>Sun, 26 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</guid>
				<description>&lt;h2 id=&#34;引言一张贴纸让最聪明的ai变成了盲人&#34;&gt;引言：一张贴纸，让最聪明的AI变成了&amp;quot;盲人&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2017年，一群研究人员做了一个实验。&lt;/p&gt;&#xA;&lt;p&gt;他们在路边放了一个&amp;quot;停止&amp;quot;标志牌——红底白字，八边形，全世界的司机都认识。然后，他们在上面贴了几张小小的黑白贴纸，贴的位置看起来毫无规律。&lt;/p&gt;&#xA;&lt;p&gt;接着，他们让一辆搭载了最先进AI识别系统的测试车驶过这个标志牌。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;结果令人震惊：AI把&amp;quot;停止牌&amp;quot;认成了&amp;quot;限速牌&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;贴纸的位置和图案是精心设计的——对人类来说，它们只是毫无意义的涂鸦，不影响我们认出&amp;quot;停止牌&amp;quot;。但AI的&amp;quot;眼睛&amp;quot;被这些贴纸彻底欺骗了。它看到了一个和&amp;quot;停止牌&amp;quot;完全不同的东西。&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻电影的情节。这是真实发生的实验。这种能让AI&amp;quot;看错&amp;quot;的特殊图案，有一个名字：&lt;strong&gt;对抗样本（Adversarial Examples）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它们被称为&amp;quot;AI的视觉错觉&amp;quot;——就像人类会被&amp;quot;视觉错觉图&amp;quot;骗到一样，AI也有自己的&amp;quot;视觉错觉&amp;quot;。但和人类视觉错觉不同的是，&lt;strong&gt;AI的&amp;quot;错觉&amp;quot;可以被精确地设计和制造，而且几乎无法通过&amp;quot;多看两眼&amp;quot;来纠正。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一对抗样本是什么一个差之毫厘谬以千里的故事&#34;&gt;一、对抗样本是什么？——一个&amp;quot;差之毫厘，谬以千里&amp;quot;的故事&lt;/h2&gt;&#xA;&lt;p&gt;先来看一个更经典的例子。&lt;/p&gt;&#xA;&lt;p&gt;2015年，Goodfellow和他的团队做了一个实验：&lt;/p&gt;&#xA;&lt;p&gt;他们给AI看一张熊猫的照片。AI以99.9%的置信度判断：&amp;ldquo;这是一只熊猫&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，他们在原始图片上叠加了一层肉眼几乎看不见的&amp;quot;噪声&amp;quot;——就像电视信号不好时画面上的雪花点。&lt;strong&gt;这层噪声极淡，淡到人眼根本无法察觉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但AI再看这张图时，它说：&amp;ldquo;这是一只长臂猿&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;原始图片 vs 加了噪声的图片——人眼看几乎一模一样，AI眼里却天差地别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是对抗样本的&amp;quot;核心魔法&amp;quot;：&lt;strong&gt;在人类无法察觉的微小变化上，AI的判断可以发生180度大转弯。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;对抗样本的正式定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;对原始输入（一张图片、一段音频、一段文字）施加一个&lt;strong&gt;人类无法察觉的微小扰动&lt;/strong&gt;，使得AI模型的输出&lt;strong&gt;发生显著错误&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这个扰动不是随机的，而是&lt;strong&gt;精心设计的&lt;/strong&gt;——它针对的是AI模型的&amp;quot;弱点&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么ai会被骗因为ai的看和你的看不一样&#34;&gt;二、为什么AI会被骗？——因为AI的&amp;quot;看&amp;quot;和你的&amp;quot;看&amp;quot;不一样&lt;/h2&gt;&#xA;&lt;p&gt;要理解这件事，你需要先理解一个关键的区别：&lt;strong&gt;AI的&amp;quot;眼睛&amp;quot;和你的眼睛，工作原理完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类怎么看&#34;&gt;人类怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;你看到&amp;quot;停止牌&amp;quot;的时候，大脑做的是&lt;strong&gt;语义理解&lt;/strong&gt;——你看到的是&amp;quot;一个红色的八边形，上面写着&amp;rsquo;停&amp;rsquo;这个字&amp;quot;。你提取了它的&lt;strong&gt;意义&lt;/strong&gt;，而不是它的&lt;strong&gt;像素值&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;即使停止牌上沾了点泥巴、被风吹歪了30度、或者上面贴了几张贴纸——你依然能认出它。因为你的大脑在做&amp;quot;概念匹配&amp;quot;：不管细节怎么变，只要核心特征（红色、八边形、中间有字）在，就是&amp;quot;停止牌&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai怎么看&#34;&gt;AI怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;AI看到一张图片时，它看到的不是&amp;quot;概念&amp;quot;，而是&lt;strong&gt;数字&lt;/strong&gt;。一张图片在AI眼里，就是一个巨大的数字矩阵——每个像素点有三个数字（红、绿、蓝的亮度值），范围从0到255。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;停止牌&amp;quot;对于AI来说，就是&amp;quot;R=200, G=25, B=25&amp;rdquo;（红色区域）和&amp;quot;R=255, G=255, B=255&amp;quot;（白色文字区域）的特定排列组合。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;识别&amp;quot;过程，本质上是在做&amp;quot;数字模式匹配&amp;quot;——它从海量的训练数据中学习到：&amp;ldquo;当这些数字以某种方式排列时，它应该输出&amp;rsquo;停止牌&amp;rsquo;&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;关键差异ai对微小变化的极度敏感&#34;&gt;关键差异：AI对&amp;quot;微小变化&amp;quot;的极度敏感&lt;/h3&gt;&#xA;&lt;p&gt;人类大脑处理的是&amp;quot;语义层级&amp;rdquo;——你看到的是&amp;quot;概念&amp;quot;和&amp;quot;意义&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI处理的是&amp;quot;数字层级&amp;quot;——它看到的是&amp;quot;数值&amp;quot;和&amp;quot;模式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;对人类来说微不足道的数值变化，对AI来说可能是天翻地覆的模式变化。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的数字矩阵中做微调：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;把&amp;quot;停止牌&amp;quot;图片中某个像素的红色值从200调到210&lt;/li&gt;&#xA;&lt;li&gt;把另一个像素的蓝色值从50调到55&lt;/li&gt;&#xA;&lt;li&gt;重复1000次这样的微调&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;对人类来说，这些变化无法察觉。&lt;/strong&gt; 因为&amp;quot;红色&amp;quot;仍然是&amp;quot;红色&amp;quot;，&amp;ldquo;八边形&amp;quot;仍然是&amp;quot;八边形&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但对AI来说，这些变化的累积效果，可能让它看到的&amp;quot;数字模式&amp;quot;完全变成了另一个东西。&lt;/strong&gt; 就像你在一个密码锁上，把每个数字都拨动了一点点——组合起来，密码就完全变了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三对抗样本是怎么造出来的问aiai就会告诉你&#34;&gt;三、对抗样本是怎么造出来的？——&amp;ldquo;问AI，AI就会告诉你&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2015年，Goodfellow提出了一个极简的对抗样本生成方法，叫&lt;strong&gt;FGSM（快速梯度符号法）&lt;/strong&gt;。它的原理简单到令人惊讶：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：把图片输入AI，让AI执行正常的识别流程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;前向传播&amp;quot;——图片通过神经网络的每一层，最终得到一个输出：&amp;ldquo;这只熊猫的概率是99.9%&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：问AI一个问题——&amp;ldquo;如果要让输出变成&amp;rsquo;长臂猿&amp;rsquo;，图片应该怎么改？&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;反向传播&amp;rdquo;——计算梯度。梯度告诉我们：如果改变这个像素的值，AI的输出会往哪个方向变化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：在所有像素上，沿着&amp;quot;让输出变成&amp;rsquo;长臂猿&amp;rsquo;&amp;ldquo;的方向，都走一小步。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一步产生的&amp;quot;噪声&amp;rdquo;，就是对抗样本的核心。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：这个过程只需要一次&amp;quot;前向传播&amp;quot;和一次&amp;quot;反向传播&amp;quot;。&lt;/strong&gt; 也就是说，你只需要问AI一次&amp;quot;怎么改你才会犯错&amp;quot;，AI就会告诉你答案。&lt;/p&gt;&#xA;&lt;p&gt;这就像你问一个密码锁：&amp;ldquo;我的密码是0000，但我想打开它。告诉我，每个数字应该怎么调？&amp;ldquo;密码锁回答说：&amp;ldquo;第一位+3，第二位-1，第三位+2，第四位-5。&amp;quot;——然后你就知道了正确的密码。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI对对抗样本的&amp;quot;脆弱性&amp;rdquo;，不是它的漏洞，而是它的特性。&lt;/strong&gt; 因为AI的决策过程是&amp;quot;可微分的&amp;rdquo;——你可以通过数学求导，找出&amp;quot;让AI犯错的最短路径&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四对抗样本告诉我们什么ai的理解是脆弱的&#34;&gt;四、对抗样本告诉我们什么？——AI的&amp;quot;理解&amp;quot;是脆弱的&lt;/h2&gt;&#xA;&lt;p&gt;对抗样本的存在，揭示了AI&amp;quot;理解&amp;quot;世界的三个深层真相。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相一ai看到的不是语义是表面特征&#34;&gt;真相一：AI看到的不是&amp;quot;语义&amp;quot;，是&amp;quot;表面特征&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;AI在训练时，学到的不是&amp;quot;猫的概念&amp;quot;——它学到的是一组&amp;quot;猫图片的统计特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着，如果你在猫的图片上叠加一层精心设计的噪声，让AI的&amp;quot;猫特征统计&amp;quot;变成&amp;quot;狗特征统计&amp;quot;，AI就会把猫认成狗。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是统计性的，不是语义性的。&lt;/strong&gt; 它知道&amp;quot;猫&amp;quot;和&amp;quot;毛茸茸&amp;quot;、&amp;ldquo;有耳朵&amp;quot;经常一起出现，但它不知道&amp;quot;猫&amp;quot;是一个有生命的、会呼吸的、和人类有情感联系的动物。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相二ai的决策边界和人类的概念边界不重合&#34;&gt;真相二：AI的&amp;quot;决策边界&amp;quot;和人类的&amp;quot;概念边界&amp;quot;不重合&lt;/h3&gt;&#xA;&lt;p&gt;人类的概念有&amp;quot;鲁棒性&amp;rdquo;——&amp;ldquo;猫&amp;quot;的概念边界很宽，不管猫是黑是白、是胖是瘦、是坐是躺，你都能认出来。&lt;/p&gt;&#xA;&lt;p&gt;AI的决策边界是&amp;quot;精确但不鲁棒&amp;quot;的——它在训练数据覆盖的区域内表现很好，但在训练数据覆盖的边缘地带，可能突然崩溃。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
