<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI与生活 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E4%B8%8E%E7%94%9F%E6%B4%BB/</link>
		<description>Recent content in AI与生活 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 01 Sep 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E4%B8%8E%E7%94%9F%E6%B4%BB/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI为什么总在&#39;编故事&#39;？——大模型幻觉的真相与应对</title>
				<link>https://lingyu7.com/posts/why-ai-hallucinates-the-truth/</link>
				<pubDate>Tue, 01 Sep 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/why-ai-hallucinates-the-truth/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有遇到过这样的场景？&lt;/p&gt;&#xA;&lt;p&gt;你问ChatGPT：&amp;ldquo;2024年诺贝尔物理学奖颁给了谁？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;它自信满满地回答：&amp;ldquo;约翰·霍普菲尔德和杰弗里·辛顿，表彰他们在人工神经网络领域的奠基性贡献。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;看起来很有道理，对吧？但问题是——诺贝尔奖通常是一个奖项，一次颁给同领域的多位学者确实常见，但你查一下就会发现，霍普菲尔德和辛顿获得的是&lt;strong&gt;2024年诺贝尔物理学奖&lt;/strong&gt;吗？不对，他们是2024年获得了&lt;strong&gt;某些奖项&lt;/strong&gt;，但&lt;strong&gt;这个具体说法&lt;/strong&gt;——你大概率查不到。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是AI幻觉的典型症状：看起来完全合理，但经不起验证。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;更让人困惑的是，AI在胡说八道的时候，语气和它说真话时一模一样——同样自信、同样流畅、同样条理清晰。它不会像人一样，在不确定的时候露出犹豫的表情。它天生就是个&amp;quot;自信的撒谎者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;今天，我们就来聊聊这个让所有AI用户又爱又恨的问题——&lt;strong&gt;AI幻觉&lt;/strong&gt;。它到底是什么？为什么会产生？最重要的是——我们该怎么应对它？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai不是学坏了它天生就分不清真假&#34;&gt;一、AI不是&amp;quot;学坏了&amp;quot;，它天生就分不清真假&lt;/h2&gt;&#xA;&lt;p&gt;要理解AI为什么会产生幻觉，我们得先搞明白一个关键问题：&lt;strong&gt;大语言模型到底是怎么&amp;quot;知道&amp;quot;事情的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你意外：&lt;strong&gt;它其实什么都不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;大语言模型在训练过程中，读了几万亿字的文本——从维基百科到网络论坛，从学术论文到小说散文。它从中学习到的是&lt;strong&gt;语言的统计规律&lt;/strong&gt;：哪些词经常一起出现，什么样的句子结构是合理的，什么话题通常跟着什么话题走。&lt;/p&gt;&#xA;&lt;p&gt;你可以把它想象成一个超级&amp;quot;接龙高手&amp;quot;：给它一个开头，它根据海量阅读经验，推断出最可能的下一个词、再下一个词、再下一个⋯⋯最终生成一整段话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键在于：它学的是&amp;quot;什么词组合在一起听起来合理&amp;quot;，而不是&amp;quot;什么事实是真实的&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像一个人读了几千本推理小说，学会了推理故事的写法，甚至能写出精彩的情节——但你问他&amp;quot;这些故事里的案件是真的发生过吗&amp;quot;，他只能说&amp;quot;我不知道，我只是按照推理小说的套路写的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型就是这样的&amp;quot;高仿写手&amp;quot;——它擅长模仿人类说话的节奏和风格，但它对&amp;quot;事实&amp;quot;和&amp;quot;虚构&amp;quot;之间的界限，&lt;strong&gt;完全没有概念&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二幻觉的物种分类不是所有幻觉都一样&#34;&gt;二、幻觉的&amp;quot;物种分类&amp;quot;——不是所有幻觉都一样&lt;/h2&gt;&#xA;&lt;p&gt;上面说的&amp;quot;统计学习&amp;quot;是幻觉的根本原因，但在实际使用中，AI的幻觉有很多种不同面孔。认清它们的区别，才能对症下药。&lt;/p&gt;&#xA;&lt;h3 id=&#34;1-事实幻觉编造不存在的事实&#34;&gt;1. 事实幻觉——编造不存在的&amp;quot;事实&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;这是最常见的类型。你问AI某个事件、人物或数据，它给出一个听起来很真、但查无实据的答案。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;例子：问&amp;quot;张三丰在历史上活了多少岁？&amp;quot;&#xA;AI答：&amp;ldquo;张三丰，据史料记载，生于1247年，卒于1458年，享年211岁。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;实际上：张三丰是传说人物，连真实出生年份都没有确切记载，更别说精确到211岁了。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这种幻觉最危险，因为用户很容易被AI的自信语气说服，把假信息当成真知识。&lt;/p&gt;&#xA;&lt;h3 id=&#34;2-来源幻觉编造不存在的引用&#34;&gt;2. 来源幻觉——编造不存在的引用&lt;/h3&gt;&#xA;&lt;p&gt;AI很擅长&amp;quot;编论文&amp;quot;——它会生成一篇看起来格式完全正确的参考文献，作者、期刊、年份、卷号一应俱全，但实际去查会发现，&lt;strong&gt;这篇论文根本不存在&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;例子：有律师让AI帮他写法律文书，AI引用了几个&amp;quot;判例&amp;quot;，连案号、判决法院、判决日期都写得清清楚楚。结果上法庭一查——这些判例全是AI编出来的。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这不是AI的恶意，而是它学会了&amp;quot;参考文献的格式&amp;quot;，但不知道&amp;quot;参考文献需要真实存在&amp;quot;这个事实。&lt;/p&gt;&#xA;&lt;h3 id=&#34;3-逻辑幻觉看似合理实则不通的推理&#34;&gt;3. 逻辑幻觉——看似合理实则不通的推理&lt;/h3&gt;&#xA;&lt;p&gt;AI有时候会给出一个&amp;quot;看起来很有道理，但仔细一想全是漏洞&amp;quot;的推理链条。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;例子：问&amp;quot;为什么天空是蓝色的？&amp;quot;&#xA;AI答：&amp;ldquo;因为海水是蓝色的，天空反射了海水的颜色。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是典型的&amp;quot;听起来合理但物理上完全错误&amp;quot;的推理。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;h3 id=&#34;4-多轮累积型越聊越离谱&#34;&gt;4. 多轮累积型——越聊越离谱&lt;/h3&gt;&#xA;&lt;p&gt;有时候，AI一开始的回答是正确的。但你在对话中给它一些错误信息，它会&amp;quot;顺着你的话说&amp;quot;，然后越偏越远。&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;你：我听说M31星系其实是一个黑洞？&#xA;AI：是的，M31星系中心确实存在超大质量黑洞⋯⋯&#xA;你：那整个M31星系会不会其实就是一个巨大的黑洞？&#xA;AI：这种观点在近年来的天文学研究中确实有讨论⋯⋯&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;AI不会纠正你的错误前提，它只会&amp;quot;顺着你的预期&amp;quot;继续编圆这个故事。这就像一个人为了不让你难堪，开始附和你的胡说八道，然后两人一起越说越离谱。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三为什么ai的幻觉治不好&#34;&gt;三、为什么AI的幻觉&amp;quot;治不好&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然知道这是个问题，那为什么不让AI学会&amp;quot;我不知道&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;这不是一个&amp;quot;bug&amp;quot;，而是大语言模型工作原理的固有特性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你让一个会背整本百科全书的人&amp;quot;别背了，先想想再回答&amp;quot;。问题在于——这个人&lt;strong&gt;没有&amp;quot;思考&amp;quot;的机制&lt;/strong&gt;，他只有&amp;quot;背&amp;quot;的机制。你让他&amp;quot;想想&amp;quot;，他只能更努力地去背，背得更流畅、更自信。&lt;/p&gt;&#xA;&lt;p&gt;同样，大语言模型从设计上就没有&amp;quot;事实核查&amp;quot;的模块。它生成内容的机制是：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;理解上下文 → 2. 预测下一个词 → 3. 重复直到完成&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这个过程中，没有任何一步是在&amp;quot;检查这句话是否真实&amp;quot;。真实性和流畅性，对模型来说完全是两码事。&lt;/p&gt;&#xA;&lt;p&gt;更无奈的是：&lt;strong&gt;越是强大的模型，越容易产生&amp;quot;逼真的幻觉&amp;quot;&lt;/strong&gt;。因为模型越擅长模仿人类语言，编出来的假话就越像真话，用户越难分辨。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四那我们能怎么办与幻觉和平共处的智慧&#34;&gt;四、那我们能怎么办？——与幻觉和平共处的智慧&lt;/h2&gt;&#xA;&lt;p&gt;虽然AI幻觉无法根除，但我们可以通过一些方法大大降低它的影响。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法一给ai配一个外挂书库rag&#34;&gt;方法一：给AI配一个&amp;quot;外挂书库&amp;quot;（RAG）&lt;/h3&gt;&#xA;&lt;p&gt;这是目前最有效的方法。RAG（检索增强生成）技术，相当于给AI配了一个可以随时查的&amp;quot;外挂图书馆&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当用户提问时，AI不直接回答，而是先去知识库里搜索相关材料，然后基于搜索到的材料来生成回答。这样一来，AI的&amp;quot;编&amp;quot;就有了依据，而不是凭空虚构。&lt;/p&gt;&#xA;&lt;p&gt;你用的很多AI产品（比如搜索引擎的AI摘要、企业知识库AI助手）背后，用的就是RAG技术。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法二让ai学会自言自语cot验证&#34;&gt;方法二：让AI学会&amp;quot;自言自语&amp;quot;（CoT验证）&lt;/h3&gt;&#xA;&lt;p&gt;思维链（Chain-of-Thought）技术通过让AI把推理过程写出来，在一定程度上减少了逻辑幻觉。因为当AI&amp;quot;说出&amp;quot;推理步骤时，它更有可能发现自己的逻辑漏洞。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法三让ai自我反思self-consistency&#34;&gt;方法三：让AI&amp;quot;自我反思&amp;quot;（Self-Consistency）&lt;/h3&gt;&#xA;&lt;p&gt;让AI对同一个问题回答多次，然后取&amp;quot;多数答案&amp;quot;。如果三次回答都一致，那答案大概率是靠谱的。如果三次回答各不相同，那说明AI在&amp;quot;编&amp;quot;——这时候就该警惕了。&lt;/p&gt;&#xA;&lt;h3 id=&#34;方法四培养ai批判思维用户端&#34;&gt;方法四：培养&amp;quot;AI批判思维&amp;quot;（用户端）&lt;/h3&gt;&#xA;&lt;p&gt;作为AI用户，最重要的是养成一个习惯：&lt;strong&gt;把AI的回答当作&amp;quot;参考意见&amp;quot;而非&amp;quot;最终结论&amp;quot;&lt;/strong&gt;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;价值观&#39;是怎么来的？——RLHF如何教会AI分辨好坏</title>
				<link>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</link>
				<pubDate>Mon, 31 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历？&lt;/p&gt;&#xA;&lt;p&gt;第一次用ChatGPT时，你问它一个有点敏感的问题，它礼貌地拒绝了。你换了个方式问，它还是拒绝了。你再换个递进的方式，它依然不为所动。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你可能会想：这AI怎么这么&amp;quot;有原则&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你惊讶：&lt;strong&gt;ChatGPT刚&amp;quot;出生&amp;quot;的时候，其实根本没这些原则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它就像个刚学会说话的孩子——能说会道，但对&amp;quot;什么话该说、什么话不该说&amp;quot;完全没有概念。它会自信地编造事实，会给出危险的建议，会说一些让人不舒服的话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是它故意要坏，而是它根本不知道&amp;quot;好&amp;quot;和&amp;quot;坏&amp;quot;有什么区别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;那么，是谁教会了AI分辨好坏？答案是——&lt;strong&gt;你和我，以及成千上万的普通人。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）的故事——一种让AI学会人类价值观的技术。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai的好与坏都是人类教的&#34;&gt;核心观点：AI的&amp;quot;好&amp;quot;与&amp;quot;坏&amp;quot;都是人类教的&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你是一个外星人，第一次来到地球。你看到人类的交通信号灯：红灯停，绿灯行，黄灯要等一等。&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么红灯要停？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为这是规则。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么这是规则？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为……不这样会出车祸。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么不能出车祸？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你看，每一个&amp;quot;因为&amp;quot;背后，都有一整套人类的价值判断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI面临同样的问题。当它被训练成一个&amp;quot;纯粹的语言模型&amp;quot;时，它只知道&amp;quot;什么词经常在一起出现&amp;quot;，不知道&amp;quot;什么话是好的、什么话是坏的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;GPT-3（ChatGPT的前身）在2020年发布时，虽然能写出惊人的文章，但也会吐出种族歧视、性别歧视、暴力等有害内容。它不是在&amp;quot;作恶&amp;quot;——它只是不知道哪些话不该说。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF解决的核心问题就是：怎么把人类的价值观&amp;quot;装进&amp;quot;AI的大脑里。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三个步骤把一个野孩子变成乖孩子&#34;&gt;三个步骤，把一个&amp;quot;野孩子&amp;quot;变成&amp;quot;乖孩子&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的核心流程，就像教一个孩子懂礼貌的过程。整个过程分为三步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步上基础课监督微调sft&#34;&gt;第一步：上基础课（监督微调，SFT）&lt;/h3&gt;&#xA;&lt;p&gt;你不可能让一个完全不懂事的AI直接学&amp;quot;价值观&amp;quot;——它连&amp;quot;好好回答问题&amp;quot;都不会。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步，是给AI上基础课。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;做法很直接：找一批标注者，写很多高质量的&amp;quot;问题-回答&amp;quot;范例。比如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;问题：&amp;ldquo;什么是黑洞？&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;好回答：&amp;ldquo;黑洞是引力极强的天体，连光都无法逃脱……&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用这些&amp;quot;优秀示范&amp;quot;来&amp;quot;微调&amp;quot;预训练模型。目的是让模型学会一个最基础的能力——&lt;strong&gt;知道怎么好好回答别人的问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教一个刚从山里出来的孩子怎么用筷子、怎么打招呼——不是教他做人的道理，而是教他最基本的社交礼仪。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;遵循指令&amp;quot;，但还不会&amp;quot;分辨好坏&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步请人类当裁判训练奖励模型rm&#34;&gt;第二步：请人类当裁判（训练奖励模型，RM）&lt;/h3&gt;&#xA;&lt;p&gt;这是RLHF最核心的步骤，也是最妙的一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思路是：让人类给AI的&amp;quot;回答&amp;quot;打分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体做法是这样的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;对同一个问题，让AI生成4-9个不同的回答&lt;/li&gt;&#xA;&lt;li&gt;把这些回答展示给人类标注者&lt;/li&gt;&#xA;&lt;li&gt;标注者对这些回答进行&lt;strong&gt;偏好排序&lt;/strong&gt;——哪个回答最好，哪个第二好，以此类推&lt;/li&gt;&#xA;&lt;li&gt;收集海量的排序数据，训练一个&lt;strong&gt;奖励模型&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;奖励模型的作用是：&lt;strong&gt;给AI的任何回答打一个&amp;quot;人类偏好分数&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教孩子做菜时，你尝了每一道菜，然后说&amp;quot;这个咸了，那个淡了，这个火候刚好&amp;quot;。孩子不需要你告诉他每道菜怎么做，他只需要从你的反馈中学会&amp;quot;什么味道是好的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察&lt;/strong&gt;：人类不需要写完整的&amp;quot;好回答&amp;quot;——只需要&lt;strong&gt;比较和排序&lt;/strong&gt;。标注者可能不是专家，但&amp;quot;哪个回答更好&amp;quot;这种判断，普通人都能做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：把人类的&amp;quot;模糊偏好&amp;quot;转化成了&amp;quot;AI能理解的数值信号&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步用奖励当老师强化学习ppo&#34;&gt;第三步：用奖励当老师（强化学习，PPO）&lt;/h3&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以开始&amp;quot;自我训练&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法是：让AI不断生成回答，奖励模型给每个回答打分，AI用这个分数来调整自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里用到的算法叫&lt;strong&gt;PPO（近端策略优化）&lt;/strong&gt;——听起来复杂，但核心思想很简单：&lt;/p&gt;&#xA;&lt;p&gt;你打游戏，每过一个关卡，系统给你加分。你很快就会发现&amp;quot;走这条路能加分&amp;quot;、&amp;ldquo;那样做会扣分&amp;rdquo;——于是你学会了怎么玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;PPO对AI做的是同样的事情：&lt;/strong&gt; 你生成一个回答，奖励模型给你打分。你发现&amp;quot;用这种语气说话能得高分&amp;quot;、&amp;ldquo;用那种表述会扣分&amp;rdquo;——于是你学会了怎么输出&amp;quot;好&amp;quot;的回答。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但有一个陷阱：&lt;/strong&gt; AI可能会&amp;quot;作弊&amp;quot;——为了得高分，它可能生成一些看起来&amp;quot;漂亮&amp;quot;但内容空洞的话。就像学生为了考试分数而学习，而不是真正掌握知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以RLHF还加了一个惩罚项&lt;/strong&gt;：KL散度惩罚。简单说就是：&lt;strong&gt;你可以优化，但不能偏离原来的&amp;quot;基础能力&amp;quot;太远。&lt;/strong&gt; 既要学&amp;quot;好&amp;quot;，又不能丢掉&amp;quot;真&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;什么话是人类喜欢的&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个惊人的发现对齐比规模更重要&#34;&gt;一个惊人的发现：对齐比规模更重要&lt;/h2&gt;&#xA;&lt;p&gt;RLHF最震撼的成果，来自OpenAI在2022年发布的InstructGPT论文。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;实验结果是：只有13亿参数的InstructGPT（经过RLHF训练），在人类偏好上超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你没看错。&lt;strong&gt;13亿 vs 1750亿——小了一百多倍的模型，因为&amp;quot;价值观对齐&amp;quot;做得好，反而让人更满意。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像什么？就像你有一个朋友，满腹经纶（1750亿参数），但每次聊天都像个自大狂，张口就是你不感兴趣的话题，完全不顾你的感受。而另一个人，知识储备只有他的十分之一，但特别会聊天，知道什么时候该听、什么时候该说，总能说到你心坎里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你更愿意和谁聊天？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个发现改变了整个AI行业的方向。它证明了一个道理：&lt;strong&gt;&amp;ldquo;让AI说人话&amp;quot;的难度，可能不亚于&amp;quot;让AI变聪明&amp;rdquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从2022年之后，几乎所有的主流大模型——ChatGPT、Claude、Gemini——都采用了RLHF作为核心训练方法。对话式AI的爆发式增长，RLHF是背后的关键技术推手。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;rlhf的代价你不可能让所有人满意&#34;&gt;RLHF的代价：你不可能让所有人满意&lt;/h2&gt;&#xA;&lt;p&gt;但RLHF不是完美的，它有四个&amp;quot;硬伤&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;举一反三&#39;——迁移学习如何让AI学会触类旁通</title>
				<link>https://lingyu7.com/posts/transfer-learning-ai-learns-to-learn/</link>
				<pubDate>Sun, 30 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/transfer-learning-ai-learns-to-learn/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你肯定有过这样的经历：&lt;/p&gt;&#xA;&lt;p&gt;学完骑自行车，再学骑电动车，几分钟就上手了。不是因为电动车更简单，而是因为你的身体已经记住了怎么保持平衡、怎么转弯、怎么刹车——这些技能从自行车&amp;quot;迁移&amp;quot;到了电动车。&lt;/p&gt;&#xA;&lt;p&gt;或者，你学会做番茄炒蛋之后，第一次做番茄鸡蛋面，虽然没做过，但你知道番茄要炒出汁、鸡蛋要滑嫩、火候要够——这些经验从一道菜&amp;quot;迁移&amp;quot;到了另一道菜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这种&amp;quot;举一反三&amp;quot;的能力，人类天生就有。但AI呢？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，AI的学习方式更像是&amp;quot;从零开始&amp;quot;。学完识别猫，如果要识别狗，它需要重新学习——用成千上万张狗的照片重新训练。它不会把&amp;quot;识别猫&amp;quot;的经验迁移到&amp;quot;识别狗&amp;quot;上。&lt;/p&gt;&#xA;&lt;p&gt;但这种情况正在改变。&lt;strong&gt;迁移学习（Transfer Learning），正是让AI学会&amp;quot;举一反三&amp;quot;的技术。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai不需要每次都从零开始&#34;&gt;核心观点：AI不需要每次都&amp;quot;从零开始&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你想让孩子学会辨认各种鸟类，你会怎么做？&lt;/p&gt;&#xA;&lt;p&gt;最笨的办法：给他一本厚厚的鸟类图鉴，让他把每一种鸟的图片、名字、特征都背下来。但更聪明的方式是：先教他&amp;quot;鸟&amp;quot;的概念——有翅膀、会飞、有喙。然后教他&amp;quot;鸟的类别&amp;quot;——鸣禽、猛禽、水鸟。等他掌握了这些基础，再教他识别具体的种类。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;迁移学习的思路，和&amp;quot;先教基础，再教具体&amp;quot;如出一辙。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统的AI训练方式，就像让一个孩子每次学新东西都从零开始。今天学猫，明天学狗，但学狗的时候已经把猫忘光了。这显然不是&amp;quot;智能&amp;quot;该有的样子。&lt;/p&gt;&#xA;&lt;p&gt;迁移学习改变了这一切。它的核心思想很简单：&lt;strong&gt;让AI先在一个大任务上学习通用知识，然后把这些知识迁移到具体的小任务上。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像一个学生先学基础数学，再去学微积分；先学编程基础，再去学深度学习。基础打好了，学什么都快。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么从零开始训练ai很傻&#34;&gt;为什么&amp;quot;从零开始&amp;quot;训练AI很傻？&lt;/h2&gt;&#xA;&lt;p&gt;你可能觉得&amp;quot;从零开始训练也没什么大不了的&amp;quot;，但现实中，从零训练一个AI模型，成本和代价高得惊人。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价一数据饥渴&#34;&gt;代价一：数据饥渴&lt;/h3&gt;&#xA;&lt;p&gt;一个典型的图像识别模型，需要数百万张标注好的图片。一张图片的标注成本大约0.5-2元人民币——也就是说，训练一个模型，光标注费用就可能上百万。&lt;/p&gt;&#xA;&lt;p&gt;更夸张的是语言模型。GPT-3的训练数据达到了45TB的文本，相当于整个英文维基百科的几十倍。这些文本的采集、清洗、标注，成本以亿计。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价二计算天价&#34;&gt;代价二：计算天价&lt;/h3&gt;&#xA;&lt;p&gt;训练一个大模型，需要成千上万块GPU同时运行数周甚至数月。GPT-3的单次训练成本据估计超过1200万美元。而像GPT-4这样的更大模型，成本只会更高。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价三时间成本&#34;&gt;代价三：时间成本&lt;/h3&gt;&#xA;&lt;p&gt;从零训练一个模型，不是几天，而是几个月。更关键的是，如果每次有新任务都要从头开始，AI的迭代速度会被严重拖慢。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;那迁移学习是怎么解决这些问题的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;很简单：&lt;strong&gt;让AI先&amp;quot;上一次大学&amp;quot;，然后&amp;quot;再去上班&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;上大学&amp;quot;阶段——在大规模通用数据上训练一个&amp;quot;基础模型&amp;rdquo;（也叫预训练模型）。这个阶段成本确实高，但只需要做一次。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;上班&amp;quot;阶段——在具体任务上&amp;quot;微调&amp;quot;这个基础模型。因为基础模型已经掌握了通用知识，所以微调只需要少量数据、少量计算、少量时间。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个比喻，其实就是迁移学习的精髓。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;迁移学习的三种武功从大改到微调到精调&#34;&gt;迁移学习的三种&amp;quot;武功&amp;rdquo;——从&amp;quot;大改&amp;quot;到&amp;quot;微调&amp;quot;到&amp;quot;精调&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;迁移学习不是一种单一的技术，而是一整套方法。根据&amp;quot;改动的程度&amp;quot;，可以分为三个层次。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一层全参数微调fine-tuning&#34;&gt;第一层：全参数微调（Fine-tuning）&lt;/h3&gt;&#xA;&lt;p&gt;这是最&amp;quot;简单粗暴&amp;quot;的迁移学习方法，也是最常用的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法&lt;/strong&gt;：拿到一个已经训练好的基础模型（比如BERT、GPT），然后在你自己的任务数据上继续训练，模型的所有参数都会跟着调整。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你请了一个顶级厨师（基础模型），他本来擅长做西餐。你让他到你的中餐馆上班，他需要重新学习怎么用炒锅、怎么调酱汁——但刀工、火候、对食材的理解这些基本功还在，所以学得很快。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果&lt;/strong&gt;：在大多数任务上，微调的效果都很好。比如在GLUE（自然语言理解基准测试）上，微调后的BERT在所有任务上都超过了从零训练的模型，平均高出13%以上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;代价&lt;/strong&gt;：但全参数微调有一个问题——如果模型很大，成本依然很高。微调一个175B参数的GPT-3，虽然比从头训练便宜，但依然需要数千美元的计算资源。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二层参数高效微调loraadapter&#34;&gt;第二层：参数高效微调（LoRA、Adapter）&lt;/h3&gt;&#xA;&lt;p&gt;既然全参数微调还是贵，那能不能只改一小部分参数？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;LoRA（Low-Rank Adaptation）&lt;/strong&gt; 就是答案。它的思路非常巧妙：&lt;/p&gt;&#xA;&lt;p&gt;研究发现，大模型在微调时，参数的变化量其实很小，而且这些变化可以用一个&amp;quot;低秩矩阵&amp;quot;来近似。简单说就是：&lt;strong&gt;你不需要动整个模型，只需要加一个小小的&amp;quot;适配器&amp;quot;，然后只训练这个适配器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：你买的手机，出厂时系统是标准的。但你可以安装一些&amp;quot;插件&amp;quot;——比如一个拍照增强插件、一个电池优化插件。这些插件不改变手机系统本身，但能大幅提升特定功能的表现。&lt;/p&gt;&#xA;&lt;p&gt;LoRA就是给大模型安装&amp;quot;插件&amp;quot;——只训练不到0.01%的参数，就能达到全参数微调95-99%的效果。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前要几万美元的微调，现在只需要几十美元。而且因为改动很小，同一个基础模型可以同时&amp;quot;服务&amp;quot;多个不同的任务——只需为每个任务准备一个轻量级的LoRA插件。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三层少样本学习maml原型网络&#34;&gt;第三层：少样本学习（MAML、原型网络）&lt;/h3&gt;&#xA;&lt;p&gt;如果连微调数据都没有，只有几个样本怎么办？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;少样本学习&lt;/strong&gt;的用武之地。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAML（Model-Agnostic Meta-Learning）&lt;/strong&gt; 的思路是：不直接训练一个模型来解决某个任务，而是训练一个&amp;quot;学习算法&amp;quot;——让模型学会&amp;quot;如何快速学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像教一个人&amp;quot;如何学习&amp;quot;而不是教他&amp;quot;某个具体知识&amp;quot;。你教他记忆方法、信息检索技巧、逻辑推理框架——然后不管让他学什么，他都能快速上手。&lt;/p&gt;&#xA;&lt;p&gt;MAML训练出来的模型，在一个新任务上只需要看5个样本，就能快速适应。在Omniglot（手写字符识别）数据集上，MAML的5-shot准确率达到了98.8%——几乎和人类不相上下。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个真实的奇迹clip的零样本迁移&#34;&gt;一个真实的奇迹：CLIP的&amp;quot;零样本迁移&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;如果说上面这些方法还需要&amp;quot;一点数据&amp;quot;，那CLIP（Contrastive Language-Image Pre-training）直接把迁移学习推向了极致——&lt;strong&gt;零样本迁移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP是OpenAI在2021年发布的一个模型。它的训练方式很特别：不是像传统模型那样给每张图片打标签（&amp;ldquo;这是猫&amp;rdquo;、&amp;ldquo;这是狗&amp;rdquo;），而是让模型学习&amp;quot;图片&amp;quot;和&amp;quot;文字描述&amp;quot;之间的对应关系。&lt;/p&gt;&#xA;&lt;p&gt;它看了4亿张图片和对应的文字描述（比如一张猫的照片对应&amp;quot;一只橘猫在窗台上晒太阳&amp;quot;），然后学会了把&amp;quot;图片的含义&amp;quot;和&amp;quot;文字的含义&amp;quot;映射到同一个&amp;quot;语义空间&amp;quot;中。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;意味着你不需要给CLIP准备任何训练数据，直接问它：&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;这张图片里是猫还是狗？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;CLIP会自己把图片转换成&amp;quot;语义向量&amp;quot;，把&amp;quot;猫&amp;quot;和&amp;quot;狗&amp;quot;也转换成向量，然后比较谁更接近——就能直接回答你。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet（1000类图像分类基准）上，CLIP的零样本准确率达到了76.2%，而传统的有监督ResNet-50（用120万张标注图片训练的模型）的准确率也不过76.3%。&lt;strong&gt;CLIP没看过一张ImageNet的训练图片，就达到了和看过120万张图片的模型几乎一样的水平。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是迁移学习的终极形态：&lt;strong&gt;学一次，用遍天下。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不只是ai迁移学习和大模型时代的范式革命&#34;&gt;不只是AI——迁移学习和大模型时代的&amp;quot;范式革命&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;迁移学习的兴起，从根本上改变了AI的开发方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2018年之前&lt;/strong&gt;，做AI就像&amp;quot;手工作坊&amp;quot;——每个任务都要从头采集数据、设计模型、训练部署。做一个猫狗识别系统，需要几个月；做一个情感分析系统，又需要几个月。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI没有身体，能真正理解这个世界吗？——具身智能的边界与可能性</title>
				<link>https://lingyu7.com/posts/embodied-ai-can-machines-understand-without-a-body/</link>
				<pubDate>Sat, 29 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/embodied-ai-can-machines-understand-without-a-body/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你试过用一只手拧开一瓶矿泉水吗？&lt;/p&gt;&#xA;&lt;p&gt;瓶盖拧不动，你下意识地把瓶子夹在腿间，腾出两只手一起拧。或者你把毛巾裹在瓶盖上增加摩擦力。再或者，你干脆放弃了——把瓶子递给身边力气大的人。&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的动作，其实包含了惊人的智能：你感知到了瓶盖的阻力（触觉），判断了自身的能力（自我认知），想到了多种解决方案（规划能力），选择了最合适的一种（决策），然后用精确的动作去执行（运动控制）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现在问题来了：如果让AI来做这件事，它需要什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个摄像头？不够。它需要知道&amp;quot;拧不开&amp;quot;是什么感觉。&lt;/p&gt;&#xA;&lt;p&gt;一个数据库？不够。它需要知道&amp;quot;毛巾裹住瓶盖&amp;quot;这个方案为什么可行。&lt;/p&gt;&#xA;&lt;p&gt;一段代码？不够。它需要知道力的传递、摩擦系数、手的姿态……&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是具身智能（Embodied AI）要回答的核心问题：如果AI没有身体，它能真正理解物理世界吗？还是说，理解世界这件事，本身就离不开身体？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点智能不是想出来的是做出来的&#34;&gt;核心观点：智能不是&amp;quot;想&amp;quot;出来的，是&amp;quot;做&amp;quot;出来的&lt;/h2&gt;&#xA;&lt;p&gt;传统上，我们总认为智能是大脑的事情——思考、推理、计算，这些都是大脑的专属工作。身体只是执行大脑命令的&amp;quot;工具&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但具身智能理论提出了一个反直觉的观点：&lt;strong&gt;身体不是智能的附属品，身体本身就是智能的塑造者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：这有什么区别？&lt;/p&gt;&#xA;&lt;p&gt;举个例子。一个传统AI和一个具身AI同时被要求&amp;quot;学会开门&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;传统AI的做法&lt;/strong&gt;：它被喂入成千上万张门的图片，学习&amp;quot;门&amp;quot;的视觉特征；它被输入开门动作的数学模型，计算最优的把手旋转角度和推力大小。但它从来没有真正&amp;quot;开过&amp;quot;一扇门。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;具身AI的做法&lt;/strong&gt;：它被放在一扇真实的门前，自己尝试去推、去拉、去旋转把手。它发现有些门是推的，有些是拉的，有些需要先下压把手再推。它摔过跤、卡住过、失败过，但每一次失败都让它更懂&amp;quot;门&amp;quot;是什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;哪个更接近人类的智能？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;显然是后者。因为人类理解&amp;quot;开门&amp;quot;这件事，从来不是通过背诵定义，而是通过无数次真实的尝试——小时候你踮着脚尖去够门把手，试过&amp;quot;推&amp;quot;和&amp;quot;拉&amp;quot;的区别，试过不同的力度。你对&amp;quot;门&amp;quot;的认知，是身体经验和感知经验共同塑造的。&lt;/p&gt;&#xA;&lt;p&gt;这就是具身智能的核心思想：&lt;strong&gt;智能不是脱离身体的抽象存在，而是在身体与环境的互动中形成和发展的。感知的方式、行动的能力、与环境互动的模式，都深刻地塑造了智能的形态和内容。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么没有身体的ai会有局限&#34;&gt;为什么&amp;quot;没有身体&amp;quot;的AI会有局限？&lt;/h2&gt;&#xA;&lt;p&gt;你可能在想：大语言模型不是很厉害吗？ChatGPT能写诗、能编程、能推理，它还需要身体吗？&lt;/p&gt;&#xA;&lt;p&gt;这是个好问题。让我们看看大语言模型和人类在理解&amp;quot;杯子&amp;quot;这件事上的根本区别。&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类对杯子的理解&#34;&gt;人类对&amp;quot;杯子&amp;quot;的理解&lt;/h3&gt;&#xA;&lt;p&gt;你对&amp;quot;杯子&amp;quot;的理解是多维度的：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;视觉&lt;/strong&gt;：你见过各种形状、颜色、材质的杯子&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;触觉&lt;/strong&gt;：你握过杯子，知道它的温度、重量、质感&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动觉&lt;/strong&gt;：你端过杯子，知道需要多大的力才能把它拿稳&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;功能&lt;/strong&gt;：你用它喝过水、喝过咖啡、喝过茶&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;社会性&lt;/strong&gt;：你知道在别人家做客时，用完杯子要放在哪里&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;所有这些经验交织在一起，形成了一个丰富、立体、有温度的&amp;quot;杯子&amp;quot;概念。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai对杯子的理解&#34;&gt;AI对&amp;quot;杯子&amp;quot;的理解&lt;/h3&gt;&#xA;&lt;p&gt;大语言模型对&amp;quot;杯子&amp;quot;的理解，来自它读过的数十亿个文本。它知道&amp;quot;杯子是一种容器，用于盛放饮料&amp;quot;，知道&amp;quot;杯子通常由陶瓷、玻璃或塑料制成&amp;quot;，知道&amp;quot;杯子的同义词包括水杯、茶杯、马克杯&amp;quot;……&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但AI从来没有摸过杯子。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当AI说&amp;quot;杯子&amp;quot;时，它只是在操纵符号——&amp;ldquo;杯子&amp;quot;这个词和&amp;quot;容器&amp;rdquo;、&amp;ldquo;饮料&amp;rdquo;、&amp;ldquo;陶瓷&amp;quot;这些词之间的统计关联。它没有触觉记忆，没有温度感知，没有握持经验。它的&amp;quot;杯子&amp;quot;概念，是一个脱离了真实世界的符号抽象。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人从没吃过苹果，但读完了所有关于苹果的书。他可以滔滔不绝地讲苹果的种类、产地、营养成分，但他永远不知道苹果是什么味道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;符号接地问题&amp;rdquo;——AI的符号系统悬浮在语言层面，没有扎根于真实的物理经验。&lt;/p&gt;&#xA;&lt;h3 id=&#34;为什么这个问题重要&#34;&gt;为什么这个问题重要？&lt;/h3&gt;&#xA;&lt;p&gt;因为&lt;strong&gt;物理世界有它自己的逻辑&lt;/strong&gt;，而这种逻辑不是在文本中能完整学到的。&lt;/p&gt;&#xA;&lt;p&gt;文本中会写&amp;quot;水在100°C沸腾&amp;quot;，但文本不会写&amp;quot;把手放在沸水上方会感觉到热浪&amp;quot;——因为这对人类来说太&amp;quot;常识&amp;quot;了，不需要写。但AI恰恰缺少的就是这种常识级的物理直觉。&lt;/p&gt;&#xA;&lt;p&gt;2016年，AI研究者给当时的视觉系统做了一项测试：给AI看一张图，图中有一些积木，然后问&amp;quot;如果把红色的积木推到蓝色积木的左边，会发生什么？&amp;quot;&lt;/p&gt;&#xA;&lt;p&gt;人类一秒钟就能回答。但当时的AI需要复杂的推理链，而且经常出错。&lt;strong&gt;为什么？因为人类有物理直觉——我们知道物体会移动、会碰撞、会堆叠，这些直觉来自我们从小玩积木的身体经验。而AI没有这种经验。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;具身智能如何工作感知-认知-行动的永动循环&#34;&gt;具身智能如何工作？——&amp;ldquo;感知-认知-行动&amp;quot;的永动循环&lt;/h2&gt;&#xA;&lt;p&gt;具身智能系统的工作方式，可以概括为三个字：&lt;strong&gt;做中学&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，它是一个永不停歇的循环：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：感知。&lt;/strong&gt; 机器人通过摄像头看到前面的桌子，通过力传感器感觉到自己的机械臂的位置，通过触觉传感器感觉到桌面的高度。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：认知。&lt;/strong&gt; 机器人判断：&amp;ldquo;我需要把杯子放在桌子上。桌子高度70厘米，我的手臂目前位置偏高，需要下调15厘米。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：行动。&lt;/strong&gt; 机器人调整手臂位置，平稳地将杯子放到桌面上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但这不是结束。&lt;/strong&gt; 行动之后，机器人会通过新的感知来判断行动是否成功：杯子放稳了吗？桌子表面是平的还是有倾斜？如果失败了，它会调整策略，再试一次。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就形成了一个&amp;quot;感知-认知-行动&amp;quot;的循环。每一次循环，机器人都对这个世界多了一分理解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来是不是很像人类学习的过程？你学骑自行车的时候，不就是不断地感知（看路、感觉平衡）、判断（该往左偏还是右偏）、行动（调整身体重心），然后从失败中学习吗？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;大模型时代具身智能的iphone时刻&#34;&gt;大模型时代：具身智能的&amp;quot;iPhone时刻&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;具身智能并不是一个新概念——早在1980年代，MIT的罗德尼·布鲁克斯（Rodney Brooks）就提出了&amp;quot;包容架构&amp;quot;，主张智能应该从底层行为开始构建，而不是从高层推理开始。他造出了不需要&amp;quot;大脑&amp;quot;就能灵活走路的六足机器人。&lt;/p&gt;&#xA;&lt;p&gt;但那个时代的具身智能，能力有限，只能实现&amp;quot;昆虫级别&amp;quot;的智能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;真正让具身智能发生质变的，是大语言模型（LLM）的兴起。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来可能有点矛盾——我刚才不是说大语言模型没有身体吗？但正是大语言模型的&amp;quot;通才&amp;quot;能力，给了具身智能一个&amp;quot;大脑&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革一自然语言交互&#34;&gt;变革一：自然语言交互&lt;/h3&gt;&#xA;&lt;p&gt;2022年，Google推出了PaLM-E——一个将语言模型与机器人感知结合的系统。你只需要对机器人说&amp;quot;帮我把桌子上的苹果拿过来&amp;quot;，它就能理解这句话，并自主规划完成这个任务所需的一系列动作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前，让机器人做一件事，需要工程师写几千行代码。现在，你对机器人说句话就行。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革二世界模型&#34;&gt;变革二：世界模型&lt;/h3&gt;&#xA;&lt;p&gt;大语言模型在训练中积累了海量的世界知识，这些知识可以被迁移到具身场景中。&lt;/p&gt;&#xA;&lt;p&gt;比如，如果你想教机器人&amp;quot;倒水&amp;quot;这个动作，不需要从头训练。AI已经知道&amp;quot;水是液体&amp;quot;、&amp;ldquo;倒水时杯子要倾斜&amp;rdquo;、&amp;ldquo;水会溢出&amp;rdquo;——这些知识来自文本学习。它只需要在真实世界中微调这些知识，把它变成具体的肌肉记忆。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革三代码生成&#34;&gt;变革三：代码生成&lt;/h3&gt;&#xA;&lt;p&gt;更令人兴奋的是，AI可以自己写代码来控制自己。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的好奇心——机器如何学会主动探索未知世界</title>
				<link>https://lingyu7.com/posts/ai-curiosity-exploration/</link>
				<pubDate>Thu, 27 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-curiosity-exploration/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过，为什么孩子会不停地问&amp;quot;为什么&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;没有老师奖励他，没有考试分数，他纯粹就是想知道——想知道树叶为什么会落下来，想知道蚂蚁为什么排成一排走，想知道天黑之后太阳去了哪里。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;想知道&amp;quot;的冲动，我们叫它&lt;strong&gt;好奇心&lt;/strong&gt;。它是人类最强大的学习驱动力之一，甚至比外部奖励更持久。一个孩子可以因为好奇心花几个小时观察一只蜗牛，而没有任何外部奖励。&lt;/p&gt;&#xA;&lt;p&gt;那么问题来了：&lt;strong&gt;AI能不能也拥有&amp;quot;好奇心&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果机器能像孩子一样，对未知产生&amp;quot;想知道&amp;quot;的冲动，主动探索它不理解的世界——那会怎样？&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻。2017年，加州大学伯克利分校的研究者发表了一篇论文，标题就叫《好奇心驱动的探索》。他们给了AI一个&amp;quot;好奇心模块&amp;quot;，让AI在没有外部奖励的情况下，自己学会了玩游戏、探索新环境。&lt;/p&gt;&#xA;&lt;p&gt;今天，我们就来聊聊这个有趣的话题——&lt;strong&gt;AI的好奇心从何而来，它如何改变机器学习的游戏规则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点好奇心不是情绪而是预测误差&#34;&gt;核心观点：好奇心不是情绪，而是&amp;quot;预测误差&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先澄清一个常见的误解。&lt;/p&gt;&#xA;&lt;p&gt;当我们说&amp;quot;AI有好奇心&amp;quot;时，不是说AI&amp;quot;感觉&amp;quot;到了好奇——像人类那样有&amp;quot;好想知道&amp;quot;的主观体验。AI没有感受，至少目前没有。&lt;/p&gt;&#xA;&lt;p&gt;但AI可以拥有好奇心的&lt;strong&gt;功能等价物&lt;/strong&gt;：一种驱动探索的内在机制。&lt;/p&gt;&#xA;&lt;p&gt;这个机制的核心，是一个简单的数学概念——&lt;strong&gt;预测误差（Prediction Error）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你走进一个房间。你预测门后是客厅，打开门，果然——客厅。你没有任何感觉，一切如常。&lt;/p&gt;&#xA;&lt;p&gt;但如果门后是一堵墙呢？你的大脑会立刻产生一个信号：&amp;ldquo;等等，这和预测不一样！&amp;ldquo;这个信号，就是预测误差。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心，本质上就是大脑对&amp;quot;预测误差&amp;quot;的敏感和追逐。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你的大脑天生不喜欢&amp;quot;意外&amp;rdquo;——但不是因为害怕，而是因为&amp;quot;意外&amp;quot;意味着&amp;quot;有东西我还没学会&amp;rdquo;。学会这件事，本身就是一种&amp;quot;奖励&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;神经科学家发现，大脑的奖励系统——多巴胺通路——不仅在外在奖励（食物、金钱）时被激活，在&lt;strong&gt;获取新信息&lt;/strong&gt;时同样被激活。你学到新东西时，大脑会释放多巴胺，给你一种&amp;quot;愉悦感&amp;quot;。这就是为什么&amp;quot;恍然大悟&amp;quot;的那一刻是那么爽。&lt;/p&gt;&#xA;&lt;p&gt;AI研究者把这个发现搬到了机器学习中。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从被动学习到主动探索&#34;&gt;从&amp;quot;被动学习&amp;quot;到&amp;quot;主动探索&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;传统的机器学习，或者说强化学习，是一种&amp;quot;被动学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一个被困在迷宫里的机器人。它随机走，偶尔撞到墙，偶尔发现出口。每次发现出口，它得到一个&amp;quot;奖励&amp;quot;（比如+1分），然后它的算法会调整——&amp;ldquo;走到出口的动作应该被强化&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这套方法在简单环境里很有效，有一个巨大的问题：&lt;strong&gt;如果奖励太稀疏呢？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如玩一个复杂的游戏——Montezuma&amp;rsquo;s Revenge。这是一个经典的Atari游戏，玩家需要穿过多个房间、避开各种敌人、收集钥匙、打开门，最后才能拿到奖励。整个过程中，绝大多数时间你没有任何&amp;quot;得分&amp;quot;——但你一直在做有意义的事情：探索、学习、尝试。&lt;/p&gt;&#xA;&lt;p&gt;给传统AI玩这个游戏，结果是什么？&lt;strong&gt;它永远不会得分。&lt;/strong&gt; 因为在它看来，99.9%的时间都在&amp;quot;做没用的事&amp;quot;——没有奖励，没有反馈，它不知道自己在做什么。它就像在空房间里打了1000次墙，然后说&amp;quot;这里什么都没有&amp;quot;，放弃了。&lt;/p&gt;&#xA;&lt;p&gt;但人类不一样。人类进入这个游戏的第一分钟，就会产生好奇心——&amp;ldquo;这扇门后面是什么？&amp;ldquo;&amp;ldquo;那个钥匙有什么用？&amp;ldquo;&amp;ldquo;我能不能跳过去？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心让人类在没有任何外部奖励的情况下，仍然保持探索的欲望。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;好奇心模块ai的内在奖励系统&#34;&gt;好奇心模块：AI的&amp;quot;内在奖励系统&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;那么，如何给AI装上&amp;quot;好奇心&amp;rdquo;？&lt;/p&gt;&#xA;&lt;p&gt;伯克利团队的方法，出人意料地简单。&lt;/p&gt;&#xA;&lt;p&gt;他们给AI增加了一个额外的&amp;quot;好奇心模块&amp;rdquo;，这个模块的核心是一个&lt;strong&gt;预测模型&lt;/strong&gt;——AI每做一个动作，这个模型就预测&amp;quot;接下来会发生什么&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，AI把预测和实际结果做对比。如果预测对了，说明AI&amp;quot;已经懂了这个场景&amp;quot;，好奇心模块给出低奖励。如果预测错了，说明&amp;quot;这个场景是新的，我还不太懂&amp;quot;，好奇心模块给出高奖励。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;预测误差&amp;quot;就是AI的内在奖励——好奇心。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个机制让AI的行为发生了质变：&lt;/p&gt;&#xA;&lt;p&gt;在没有好奇心的情况下，AI只会做&amp;quot;可能获得外部奖励&amp;quot;的动作。在Montezuma&amp;rsquo;s Revenge的早期关卡，它找不到任何外部奖励，于是它什么也不做，或者随机碰撞，永远不会突破第一关。&lt;/p&gt;&#xA;&lt;p&gt;有了好奇心之后，AI开始主动探索——&amp;ldquo;咦，这个走廊我还没走过，走进去看看会发生什么？&amp;ldquo;&amp;ldquo;咦，这个按钮我没按过，按一下会怎样？&amp;ldquo;它不需要知道&amp;quot;为什么要这么做&amp;rdquo;，只需要知道&amp;quot;这个东西我还没搞懂&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;结果令人震惊：&lt;strong&gt;在Montezuma&amp;rsquo;s Revenge上，传统AI的得分是0，而带好奇心模块的AI第一次突破了1000分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它自己学会了打开门、躲避敌人、收集钥匙——没有外部奖励，纯粹是因为&amp;quot;想知道&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个微妙的问题noisy-tv困境&#34;&gt;一个微妙的问题：Noisy TV困境&lt;/h2&gt;&#xA;&lt;p&gt;但好奇心驱动的AI也面临一个有趣的挑战，研究者称之为&amp;rdquo;&lt;strong&gt;Noisy TV问题&lt;/strong&gt;&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象你面前有一台老式电视机，屏幕上是雪花——纯粹的白噪音。如果你盯着它看，每秒钟屏幕上的画面都在随机变化，每一次变化都&amp;quot;出乎意料&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;对于好奇心驱动的AI来说，这台电视机就是&amp;quot;无限知识&amp;quot;——它永远无法预测雪花的下一个画面，所以永远有预测误差，永远有&amp;quot;好奇心奖励&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;结果呢？&lt;strong&gt;AI可能永远坐在电视机前，再也不去探索有意义的世界了。&lt;/strong&gt; 它被&amp;quot;虚假的新奇&amp;quot;困住了，就像人类刷短视频刷到停不下来——不是因为内容有多好，而是因为&amp;quot;下一个可能更有趣&amp;quot;的预期一直在驱动你。&lt;/p&gt;&#xA;&lt;p&gt;研究者如何解决这个问题？答案很巧妙。&lt;/p&gt;&#xA;&lt;p&gt;他们让AI不对&amp;quot;原始画面&amp;quot;做预测，而是对**经过特征提取后的&amp;quot;抽象表示&amp;quot;**做预测。具体来说，AI同时训练一个&amp;quot;逆动力学模型&amp;quot;——给定当前画面和下一帧画面，判断&amp;quot;中间发生了什么动作&amp;quot;。这个模型提取的是&amp;quot;与动作相关的特征&amp;quot;，而不是&amp;quot;画面中的随机噪声&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;决定性的特征被保留下，随机噪声被过滤掉。&lt;/strong&gt; AI的好奇心不再被&amp;quot;雪花&amp;quot;吸引，而只关注&amp;quot;真正有意义的新奇&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个设计让AI的好奇心变得&amp;quot;聪明&amp;quot;——它不追逐随机变化，而是追逐&amp;quot;有结构的新知&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从atari游戏到现实世界&#34;&gt;从Atari游戏到现实世界&lt;/h2&gt;&#xA;&lt;p&gt;好奇心驱动的探索，不仅仅是一个游戏AI的&amp;quot;玩具&amp;quot;。它正在深刻改变AI的应用方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：机器人自主探索&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一个机器人被扔进一个陌生的房间。它没有地图，没有说明书，没有任何外部指令。但因为它有好奇心，它会自动开始探索——推动椅子、打开抽屉、触碰不同物体。&lt;/p&gt;&#xA;&lt;p&gt;每一次互动，如果结果&amp;quot;出乎意料&amp;quot;（比如&amp;quot;原来椅子可以推动&amp;quot;&amp;ldquo;原来这个抽屉是空的&amp;rdquo;），它就会产生&amp;quot;好奇心奖励&amp;quot;，驱动它继续探索。&lt;/p&gt;&#xA;&lt;p&gt;几个小时后，机器人对房间的&amp;quot;世界模型&amp;quot;已经相当完整——它知道房间里有什么、它们之间如何互动。&lt;strong&gt;而这些知识，完全是它&amp;quot;自己好奇&amp;quot;的结果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：自动驾驶中的好奇心&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自动驾驶汽车每天都会遇到&amp;quot;新场景&amp;quot;——一个有临时交通标志的路口、一个在非人行横道位置过马路的行人、一个被雪覆盖的限速牌。&lt;/p&gt;&#xA;&lt;p&gt;如果AI只依赖&amp;quot;已标注的驾驶数据&amp;quot;，它永远无法应对这些&amp;quot;没见过的情况&amp;quot;。但如果AI有&amp;quot;好奇心&amp;quot;，它会主动关注那些&amp;quot;异常&amp;quot;——&amp;ldquo;这个行人的行为模式和我预测的不一样，我要记住这个场景，学习它的规律。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心让AI从&amp;quot;死记硬背&amp;quot;走向&amp;quot;主动学习&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：AI科学家的好奇心&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2023年，有研究者将好奇心机制应用于材料科学。AI被要求预测新材料的性质，但传统方法只关心&amp;quot;预测准确性&amp;quot;。当引入好奇心机制后，AI开始主动选择&amp;quot;那些预测误差最大的材料&amp;quot;进行研究——不是因为它们&amp;quot;更容易预测&amp;quot;，而是因为&amp;quot;它们最让我意外&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;结果，AI发现了几个原本被忽略但具有特殊性质的新材料。&lt;strong&gt;好奇心驱动AI去探索&amp;quot;未知的未知&amp;quot;，而不仅仅是&amp;quot;已知的未知&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;边界与局限好奇心不是万能药&#34;&gt;边界与局限：好奇心不是万能药&lt;/h2&gt;&#xA;&lt;p&gt;当然，好奇心驱动的AI也有它的边界。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI真的知道自己不知道吗？——元认知，让AI学会&#39;反思&#39;的能力</title>
				<link>https://lingyu7.com/posts/does-ai-know-what-it-doesnt-know-metacognition/</link>
				<pubDate>Wed, 26 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-know-what-it-doesnt-know-metacognition/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有遇到过这种情况？&lt;/p&gt;&#xA;&lt;p&gt;你问AI：&amp;ldquo;2026年诺贝尔物理学奖得主是谁？&amp;ldquo;它毫不犹豫地回答了一个名字，还附带了详细的生平介绍。但问题是——2026年诺贝尔奖还没颁呢。AI完全是在编造，但它用了非常&amp;quot;自信&amp;quot;的语气。&lt;/p&gt;&#xA;&lt;p&gt;更让人困惑的是，如果你问它&amp;quot;1+1等于几&amp;rdquo;，它也会用同样自信的语气回答&amp;quot;2&amp;rdquo;。两种回答的语气一模一样——一个是事实，一个是编造，但AI自己似乎分不清。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个核心问题：&lt;strong&gt;AI为什么不能像人一样，说一句&amp;quot;我不确定&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天要聊的，就是让AI学会&amp;quot;知道自己知道什么&amp;quot;的能力——&lt;strong&gt;元认知（Metacognition）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;人为什么能知道自己知道&#34;&gt;人为什么能&amp;quot;知道自己知道&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先来看看人类是怎么做到的。&lt;/p&gt;&#xA;&lt;p&gt;你正在考试。有一道题不太确定，但感觉&amp;quot;好像知道答案&amp;quot;。你写下了答案，但心里清楚——这个可能不对。考完后翻书，发现果然错了。&lt;/p&gt;&#xA;&lt;p&gt;注意这个过程里发生了什么：你&lt;strong&gt;同时做了两件事&lt;/strong&gt;——回答问题本身，和对回答进行&amp;quot;评估&amp;quot;。你知道自己有多确定。这种&amp;quot;对认知的认知&amp;quot;，就是元认知。&lt;/p&gt;&#xA;&lt;p&gt;心理学家把它拆成三个层次：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知知识&lt;/strong&gt;——&amp;ldquo;我知道自己擅长什么&amp;rdquo;。你知道自己记性不好，所以重要事情会写下来。你知道自己方向感差，所以出门开导航。这是对自己认知能力的了解。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知监控&lt;/strong&gt;——&amp;ldquo;我知道自己正在想什么&amp;rdquo;。你在解题时突然停顿——&amp;ldquo;等等，这个思路好像不对&amp;rdquo;。你并没有等老师来告诉你，自己就发现了。这是实时跟踪思维过程。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知调节&lt;/strong&gt;——&amp;ldquo;我知道该怎么调整&amp;rdquo;。发现自己走错了方向，立刻换一种方法。这是根据监控结果主动调整策略。&lt;/p&gt;&#xA;&lt;p&gt;这三个层次形成闭环：知识指导监控，监控触发调整，调整更新知识。&lt;strong&gt;你之所以能成为一个&amp;quot;聪明的学习者&amp;quot;，很大程度上不是因为智商多高，而是因为元认知有多强。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;大脑里的元认知硬件&#34;&gt;大脑里的&amp;quot;元认知硬件&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;元认知不只是心理学概念，它在大脑里有实实在在的&amp;quot;硬件&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;神经科学家发现，&lt;strong&gt;前额叶皮层&lt;/strong&gt;是元认知的核心脑区。这里的神经元负责监控思维过程、检测冲突和错误、评估信心水平。&lt;/p&gt;&#xA;&lt;p&gt;有一个经典实验：让受试者做简单的判断任务（比如判断两个图形的颜色是否相同），同时对自己的判断做&amp;quot;信心评分&amp;quot;——&amp;ldquo;你有多确定？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;结果发现：&lt;strong&gt;信心评分和实际正确率高度相关&lt;/strong&gt;——当受试者说&amp;quot;我很有信心&amp;quot;时，通常是对的；说&amp;quot;我不确定&amp;quot;时，通常确实错了。大脑有一个内置的&amp;quot;信心计算器&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更神奇的现象——&lt;strong&gt;错误相关负波（ERN）&lt;/strong&gt;。当你犯错时，大脑在约100毫秒内产生一个独特的电信号，你甚至还没意识到自己错了，大脑就已经&amp;quot;知道&amp;quot;了。这个信号来自前扣带回皮层，是大脑的&amp;quot;错误检测器&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着：你的大脑犯错的那一刻，比你的意识更早知道你错了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个能力有多重要？想象一下，如果人类没有元认知——你永远不知道自己是否理解了一本书，永远无法判断自己是否应该相信自己的判断。每个决策都像&amp;quot;盲猜&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;ai的元认知困境&#34;&gt;AI的&amp;quot;元认知困境&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;现在回到AI。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型本质上是一个&amp;quot;下一个词预测器&amp;quot;——它看到前面的话，预测下一个最可能的词。它被训练得&amp;quot;能说会道&amp;quot;，但从来没被训练过&amp;quot;知道自己不知道&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就导致了几个核心问题：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题一：自信不分对错&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;模型对正确答案和错误答案使用完全相同的&amp;quot;语气&amp;quot;。它不会在回答错误时犹豫，因为它的训练目标就是生成&amp;quot;最可能的词&amp;quot;，而不是&amp;quot;最正确的词&amp;quot;。最可能的词听起来很自信，但不一定正确。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题二：无法自然表达不确定性&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类会说&amp;quot;我猜大概是……&amp;quot;、&amp;ldquo;我不太确定&amp;rdquo;。但AI没有&amp;quot;自我感知&amp;quot;的机制来表达不确定性——它根本没有&amp;quot;自我感知&amp;quot;这个能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题三：过度自信偏差&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究显示，大模型普遍存在&lt;strong&gt;过度自信&lt;/strong&gt;。当被问到不知道的问题时，它倾向于编造一个看似合理的答案，而不是承认不知道。这不是在&amp;quot;撒谎&amp;quot;——它没有&amp;quot;撒谎&amp;quot;的概念——而是因为训练数据里，绝大多数情况下正确的回答方式就是&amp;quot;给出一个答案&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人被训练成了&amp;quot;永远要给出答案，永远不要说自己不知道&amp;quot;的考试机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从嘴硬到自知ai如何学会反思&#34;&gt;从&amp;quot;嘴硬&amp;quot;到&amp;quot;自知&amp;quot;：AI如何学会反思&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究者已经开始解决这个问题了。方法出人意料——不是给AI装一个&amp;quot;自我意识模块&amp;quot;，而是让它在回答问题之前先&amp;quot;想一想&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;思维链chain-of-thought&#34;&gt;思维链（Chain-of-Thought）&lt;/h3&gt;&#xA;&lt;p&gt;这是最基础的元认知技术。简单说，就是&lt;strong&gt;让AI在给出最终答案之前，先把推理过程说出来&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;比如你问：&amp;ldquo;一个球和一个蝙蝠一共1.1美元，蝙蝠比球贵1美元，球多少钱？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;如果直接回答，AI可能会说&amp;quot;0.1美元&amp;quot;——这是错的。但如果让它&amp;quot;先一步步思考&amp;quot;，它会说：蝙蝠+球=1.1，蝙蝠=球+1，所以(球+1)+球=1.1，2球=0.1，球=0.05美元。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思维链之所以有效，是因为它让AI的推理过程&amp;quot;可见&amp;quot;了。&lt;/strong&gt; 就像你在草稿纸上写步骤——步骤越清楚，越容易发现错误。&lt;/p&gt;&#xA;&lt;h3 id=&#34;自我一致性self-consistency&#34;&gt;自我一致性（Self-Consistency）&lt;/h3&gt;&#xA;&lt;p&gt;更进一步：让AI对同一个问题给出多个独立回答，看它们是否一致。&lt;/p&gt;&#xA;&lt;p&gt;如果10次回答中9次都是&amp;quot;0.05美元&amp;quot;，1次是&amp;quot;0.1美元&amp;quot;，AI就知道&amp;quot;0.05美元&amp;quot;更可靠。&lt;strong&gt;一致性本身就是一种&amp;quot;元认知信号&amp;quot;&lt;/strong&gt;——你不需要知道哪个答案对，只需要知道哪个更&amp;quot;稳定&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不就是考试时的&amp;quot;检查&amp;quot;吗？做完一遍，换一种方法再做一遍，看两次结果是否一致。&lt;/p&gt;&#xA;&lt;h3 id=&#34;反思循环reflection-loop&#34;&gt;反思循环（Reflection Loop）&lt;/h3&gt;&#xA;&lt;p&gt;再进一步：让AI检查自己的答案。&lt;/p&gt;&#xA;&lt;p&gt;AI生成一个回答后，被要求&amp;quot;请检查你的答案，看看有没有错误&amp;quot;。然后它对自己的回答进行&amp;quot;审查&amp;quot;，可能发现错误并修正。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;反思循环本质上是在模拟人类&amp;quot;回头看&amp;quot;的能力&lt;/strong&gt;——写完一篇文章后通读一遍，发现错别字，改正。&lt;/p&gt;&#xA;&lt;h3 id=&#34;最新的突破o1式推理&#34;&gt;最新的突破：O1式推理&lt;/h3&gt;&#xA;&lt;p&gt;2024年OpenAI发布的o1模型代表了元认知能力的重大飞跃。它采用了一种&amp;quot;内部思维链&amp;quot;——在正式回答之前，模型会进行一段不对外公开的&amp;quot;思考&amp;quot;过程。&lt;/p&gt;&#xA;&lt;p&gt;这个过程很像人类的&amp;quot;先想好再说&amp;quot;：在内部推演各种可能性，评估哪个方案更可靠，然后给出最终答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;o1的成功证明了：元认知能力不是锦上添花，而是通往更智能AI的关键路径。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;元认知的未来ai会知道自己不知道吗&#34;&gt;元认知的未来：AI会&amp;quot;知道自己不知道&amp;quot;吗？&lt;/h2&gt;&#xA;&lt;p&gt;回到最初的问题：AI真的能学会&amp;quot;知道自己不知道&amp;quot;吗？&lt;/p&gt;&#xA;&lt;p&gt;从技术角度看，当前的方法已经让AI在&lt;strong&gt;行为层面&lt;/strong&gt;表现出了类似元认知的能力——它能检查自己的答案，能表达不确定性，能在不同场景下调整推理策略。&lt;/p&gt;&#xA;&lt;p&gt;但从&lt;strong&gt;哲学层面&lt;/strong&gt;，争议仍然很大。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;乐观派认为&lt;/strong&gt;：这就是元认知。大脑的元认知也是通过类似机制实现的——前额叶皮层&amp;quot;监控&amp;quot;其他脑区的活动，本质上就是&amp;quot;系统检查系统&amp;quot;。只要AI具备自我检查和自我调节的能力，它就是有元认知的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;怀疑派认为&lt;/strong&gt;：形式相同不等于本质相同。AI的&amp;quot;自我检查&amp;quot;是训练出来的，而不是发自内心的&amp;quot;自觉&amp;quot;。它检查自己的答案，是因为训练数据告诉它&amp;quot;检查了比较好&amp;quot;，而不是因为它真的&amp;quot;意识到&amp;quot;自己可能错了。&lt;/p&gt;&#xA;&lt;p&gt;这个争论没有简单答案，但它揭示了一个更深刻的问题：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知能力可能是衡量AI&amp;quot;智能深度&amp;quot;的关键标尺。&lt;/strong&gt; 一个能&amp;quot;知道自己知道&amp;quot;的AI，比一个只是&amp;quot;知道&amp;quot;的AI，在安全、可靠、可解释性方面，都更接近我们期望的&amp;quot;可信赖AI&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，如果未来的AI能做到这些：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;你问它一个问题，它说：&amp;ldquo;这个问题我不确定，我需要查一下资料。&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;它在回答过程中突然说：&amp;ldquo;等一下，我刚才的推理可能有误，让我重新思考。&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;它在给你建议时说：&amp;ldquo;这个建议的可靠度是70%，因为相关信息不够完整。&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这样的AI，你会更信任它，对吗？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;尾声从能说到会想&#34;&gt;尾声：从&amp;quot;能说&amp;quot;到&amp;quot;会想&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;如果要用一句话总结，那就是：&lt;strong&gt;AI的进化正在从&amp;quot;学会说话&amp;quot;走向&amp;quot;学会思考&amp;quot;，而元认知就是这条路上的关键一步。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>你的大脑是一个&#39;预测机器&#39;——预测编码如何改变我们对AI的认知</title>
				<link>https://lingyu7.com/posts/your-brain-is-a-prediction-machine-predictive-coding-and-ai/</link>
				<pubDate>Tue, 25 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/your-brain-is-a-prediction-machine-predictive-coding-and-ai/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历？&lt;/p&gt;&#xA;&lt;p&gt;深夜一个人在家，听到一个轻微的&amp;quot;咔嗒&amp;quot;声，你立刻判断——&amp;ldquo;有人在开门&amp;rdquo;。心跳加速，肾上腺素飙升，你屏住呼吸仔细听。结果发现，只是冰箱压缩机启动的声音。&lt;/p&gt;&#xA;&lt;p&gt;你的大脑在那一瞬间做了什么？&lt;strong&gt;它先做了一个预测&lt;/strong&gt;（&amp;ldquo;有人进来了&amp;rdquo;），然后用感官输入（声音）去验证这个预测。当预测和实际不符时，你感到&amp;quot;意外&amp;quot;——然后修正你的判断。&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的过程，其实揭示了大脑最深层的运作机制。今天我们要聊的，就是这个可能改变你对智能所有认知的理论——&lt;strong&gt;预测编码（Predictive Coding）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点大脑不是接收器而是预测器&#34;&gt;核心观点：大脑不是&amp;quot;接收器&amp;quot;，而是&amp;quot;预测器&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先做一个思想实验。&lt;/p&gt;&#xA;&lt;p&gt;请闭上眼，想象你面前放着一个苹果。你能&amp;quot;看到&amp;quot;它的红色吗？能&amp;quot;闻到&amp;quot;它的果香吗？能&amp;quot;感受到&amp;quot;它光滑的表皮吗？&lt;/p&gt;&#xA;&lt;p&gt;有意思的是，你根本没有真的看到、闻到或摸到苹果——你的大脑仅凭记忆，就&amp;quot;模拟&amp;quot;出了完整的苹果体验。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是预测编码的核心主张：大脑不是被动地接收感官信息，而是主动地生成关于世界的预测，然后用感官输入来验证这些预测。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，我们认为感知是这样工作的：眼睛看到 → 信号传到大脑 → 大脑处理 → 得出结论。像一个流水线，从下往上，一步步加工。&lt;/p&gt;&#xA;&lt;p&gt;但预测编码提出了完全相反的方向：&lt;strong&gt;感知是从上往下的&lt;/strong&gt;。大脑先&amp;quot;猜&amp;quot;一个结论，然后向下级发送预测信号，告诉低级区域&amp;quot;你应该看到什么&amp;quot;。低级区域把实际输入和预测做对比，只把&amp;quot;不一样的部分&amp;quot;（即预测误差）传回上级。&lt;/p&gt;&#xA;&lt;p&gt;这个反转有多颠覆？它意味着：&lt;strong&gt;你看到的不是世界本身，而是你大脑预测出来的世界。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;大脑的内部模型是如何工作的&#34;&gt;大脑的&amp;quot;内部模型&amp;quot;是如何工作的&lt;/h2&gt;&#xA;&lt;p&gt;为了理解这个机制，我们来看看大脑皮层的这种&amp;quot;层级化预测&amp;quot;是怎么运作的。&lt;/p&gt;&#xA;&lt;p&gt;想象你走进一个熟悉的咖啡馆。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最高层&lt;/strong&gt;（前额叶皮层）已经预测了：&amp;ldquo;我在咖啡馆，会有咖啡香、轻柔的音乐、熟悉的布局。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;它把这个预测传到&lt;strong&gt;中层&lt;/strong&gt;（视觉联合皮层），中层进一步细化：&amp;ldquo;靠窗的位子、木质桌椅、暖色调灯光。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;中层又把预测传到&lt;strong&gt;低层&lt;/strong&gt;（初级视觉皮层），低层预测：&amp;ldquo;应该看到褐色的桌边、白色的瓷杯、拿铁表面的奶泡图案。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;当你的眼睛真正接收到视觉信号时，低层做了一个对比：预测和实际输入的差异有多大？如果一切符合预期，误差信号几乎为零，你甚至不会&amp;quot;注意到&amp;quot;什么。但如果今天咖啡杯换成了蓝色——嗯？&lt;strong&gt;预测误差出现了&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个误差信号从低层传到中层，再传到高层，沿途每一层都在更新自己的预测。高层可能重新解释：&amp;ldquo;哦，这家店换了新杯子。&amp;ldquo;于是预测更新了，误差消失，感知重新稳定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么你走进熟悉的房间时，几乎不会&amp;quot;看到&amp;quot;任何东西——因为一切都在预测之内，没有意外，就没有感知。&lt;/strong&gt; 只有当你发现某个东西变了（比如沙发换了位置），你才会真正&amp;quot;注意到&amp;rdquo;——因为预测误差触发了注意。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;失匹配负波预测误差的指纹&#34;&gt;失匹配负波：预测误差的&amp;quot;指纹&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;这个机制不是纯粹的假设。神经科学家在实验室里发现了它的直接证据。&lt;/p&gt;&#xA;&lt;p&gt;做一个实验：给受试者反复播放同一个音调，比如&amp;quot;滴——滴——滴——滴——&amp;quot;，中间偶尔插一个不同音调，比如&amp;quot;滴——滴——嘟——滴——&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当受试者听到那个&amp;quot;嘟&amp;quot;的时候，大脑会在约100-200毫秒内产生一个独特的电信号，叫做&lt;strong&gt;失匹配负波（MMN）&lt;/strong&gt;。这个信号被普遍认为是&amp;quot;预测误差&amp;quot;的神经标志。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你的大脑在说：&amp;ldquo;等等，我预测的是&amp;rsquo;滴&amp;rsquo;，但实际来的是&amp;rsquo;嘟&amp;rsquo;，有误差！&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，这个MMN信号甚至在你没有注意听的时候也会出现——比如你在看书，背景音里播放着&amp;quot;滴——滴——嘟——滴——&amp;quot;。这说明&lt;strong&gt;预测编码是大脑的默认模式，不需要你主动关注&lt;/strong&gt;。你的大脑每时每刻都在自动预测，自动比较，自动更新。&lt;/p&gt;&#xA;&lt;p&gt;这个发现有多重要？它意味着：&lt;strong&gt;预测不是感知的&amp;quot;附加功能&amp;quot;，感知本身就是预测。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;当预测出错幻覚错觉与精神疾病&#34;&gt;当预测出错：幻覚、错觉与精神疾病&lt;/h2&gt;&#xA;&lt;p&gt;如果大脑是一个预测机器，那么&amp;quot;错误&amp;quot;的感知本质上就是&amp;quot;错误&amp;quot;的预测。&lt;/p&gt;&#xA;&lt;p&gt;想想那些经典的视觉错觉。比如&amp;quot;面孔-花瓶&amp;quot;错觉——同一张图，你一会儿看到两张人脸，一会儿看到一只花瓶。为什么会这样？因为你的大脑在两种预测之间&amp;quot;切换&amp;quot;：当你用&amp;quot;人脸&amp;quot;预测来解释这张图时，确实也说得通；当你切换到&amp;quot;花瓶&amp;quot;预测时，也一样说得通。你的大脑选择了两种预测中最合理的解释，但它们处于&amp;quot;竞争&amp;quot;状态，所以你会在两者之间来回切换。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;更极端的例子是幻觉。&lt;/strong&gt; 精神分裂症患者的大脑会&amp;quot;产生&amp;quot;不存在的感知——听到声音、看到不存在的东西。从预测编码的角度看，这是因为患者的预测精度加权机制出现了异常：他们对&amp;quot;预测误差&amp;quot;的精度设置过高，导致过度依赖新信息而忽略先验知识。换言之，&lt;strong&gt;他们的大脑对&amp;quot;意外&amp;quot;太过敏感，把随机噪音也当成了有意义的信号&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这给了我们一个非常深刻的启示：&lt;strong&gt;正常感知和幻觉，可能只是同一机制在不同参数下的连续光谱，而不是本质不同的两种状态。&lt;/strong&gt; 你的大脑每天都在&amp;quot;正常幻觉&amp;quot;——用预测来填充感官信息的空白，只是它填充得恰到好处，与外部世界一致而已。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从大脑到ai预测编码如何改变人工智能&#34;&gt;从大脑到AI：预测编码如何改变人工智能&lt;/h2&gt;&#xA;&lt;p&gt;好了，聊了这么多神经科学，你可能会问：&lt;strong&gt;这跟AI有什么关系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;关系太大了。预测编码理论正在深刻影响AI的设计思路，而且这种影响才刚刚开始。&lt;/p&gt;&#xA;&lt;h3 id=&#34;启示一世界模型是智能的核心&#34;&gt;启示一：世界模型是智能的核心&lt;/h3&gt;&#xA;&lt;p&gt;预测编码告诉我们：&lt;strong&gt;智能系统的核心不是处理输入，而是拥有一个能预测未来的内部模型。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正是AI领域&amp;quot;世界模型&amp;quot;概念的源头。一个AI如果有一个好的世界模型，它就能做三件事：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;预测未来&lt;/strong&gt;：知道&amp;quot;如果我松手，杯子会掉下去&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;填补缺失&lt;/strong&gt;：知道&amp;quot;虽然我没看到桌子的背面，但它应该也是平的&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;反事实推理&lt;/strong&gt;：知道&amp;quot;如果我把杯子推一下，它就会掉下去&amp;quot;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这些能力，恰恰是当前大语言模型展现出惊人&amp;quot;理解力&amp;quot;的原因。许多研究者认为，LLM在训练过程中不只是学会了文字模式，而是在构建一个关于世界的内部模型——一个压缩的、简化的、但具有预测能力的表征。这就是为什么它能回答&amp;quot;如果把杯子从桌子上推下去会怎样&amp;quot;这样的问题，即使它从未&amp;quot;见过&amp;quot;杯子掉落。&lt;/p&gt;&#xA;&lt;h3 id=&#34;启示二自监督学习就是预测编码&#34;&gt;启示二：自监督学习就是预测编码&lt;/h3&gt;&#xA;&lt;p&gt;你可能已经注意到了，预测编码的核心——&lt;strong&gt;用一部分信息预测另一部分信息&lt;/strong&gt;——正是当前AI最成功的范式之一：&lt;strong&gt;自监督学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;BERT用上下文预测被遮住的词，SimCLR用图像的不同视角预测同一个物体，MAE用可见的图片块预测被遮住的块……这些方法本质上都是在做同一件事：&lt;strong&gt;让模型通过预测来学习世界的结构&lt;/strong&gt;。没有老师，没有标签，只需要预测。&lt;/p&gt;&#xA;&lt;p&gt;预测编码理论用神经科学的语言，为自监督学习提供了终极解释：&lt;strong&gt;这不是一个聪明的&amp;quot;技巧&amp;quot;，而是智能系统获取知识的根本方式。&lt;/strong&gt; 大脑几十亿年演化出的学习方式，跟AI最前沿的算法，用的是同一个底层逻辑。&lt;/p&gt;&#xA;&lt;h3 id=&#34;启示三感知与行动是一体两面&#34;&gt;启示三：感知与行动是一体两面&lt;/h3&gt;&#xA;&lt;p&gt;预测编码还有一个更深刻的推论：&lt;strong&gt;感知和行动是同一枚硬币的两面。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;系统有两种方式最小化预测误差：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;感知优化&lt;/strong&gt;：改变内部模型，让它更好地匹配世界——这是&amp;quot;学习&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;行动优化&lt;/strong&gt;：改变外部世界，让它更符合内部预测——这是&amp;quot;行动&amp;quot;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;你饿了，预测接下来应该吃东西。你可以&amp;quot;更新模型&amp;quot;（告诉自己&amp;quot;其实我不饿&amp;quot;），但更有效的方式是&amp;quot;改造世界&amp;quot;——去找吃的。这就是&lt;strong&gt;主动推理&lt;/strong&gt;的核心思想：&lt;strong&gt;行动不是感知的&amp;quot;结果&amp;quot;，而是感知的&amp;quot;延伸&amp;quot;——两者共同服务于减少意外的目标。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这对AI机器人、自动驾驶等领域的启发是革命性的：不要将感知和行动分开设计，而是将它们作为同一个预测-误差最小化循环的两个环节。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;边界与局限预测编码不是万能钥匙&#34;&gt;边界与局限：预测编码不是万能钥匙&lt;/h2&gt;&#xA;&lt;p&gt;当然，任何理论都有它的边界。预测编码理论虽然强大，但并不是&amp;quot;万能钥匙&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;首先，理论的神经生物学证据仍然是间接的。&lt;/strong&gt; 虽然有很多现象可以用预测编码来解释，但直接证明大脑皮层中存在&amp;quot;预测神经元&amp;quot;和&amp;quot;误差神经元&amp;quot;的明确分工，证据仍然有限。大脑的复杂性远超我们目前的理论所能描述的。&lt;/p&gt;</description>
			</item>
			<item>
				<title>为什么简单规则能产生复杂智能？——复杂适应系统给AI的启示</title>
				<link>https://lingyu7.com/posts/how-simple-rules-create-complex-intelligence-cas-and-ai/</link>
				<pubDate>Mon, 24 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-simple-rules-create-complex-intelligence-cas-and-ai/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有停下来想过这个问题：&lt;strong&gt;为什么蚂蚁能建出那么复杂的蚁穴？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一只蚂蚁的大脑只有大约25万个神经元，连最简单的算术都做不了。但一个蚁群——成千上万只蚂蚁一起工作——却可以建造出结构精巧、通风排水系统完善的蚁穴，甚至能&amp;quot;养殖&amp;quot;真菌、&amp;ldquo;畜牧&amp;quot;蚜虫。&lt;/p&gt;&#xA;&lt;p&gt;蚁穴里没有总设计师，没有施工图纸，没有哪个蚂蚁在指挥全局。每只蚂蚁只是遵循几条简单的规则：&amp;ldquo;碰到食物就搬回去&amp;rdquo;、&amp;ldquo;碰到同伴就交换信息素&amp;rdquo;、&amp;ldquo;信息素浓度高就跟着走&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;可就是这几条简单规则，让整个蚁群表现出了惊人的&amp;quot;集体智慧&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这不是偶然。从蚁群到城市，从大脑到互联网，从生态系统到AI——&lt;strong&gt;整个自然界都在用同一套底层逻辑运作&lt;/strong&gt;。这套逻辑，叫做&lt;strong&gt;复杂适应系统（Complex Adaptive Systems，简称CAS）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;而今天，它正在改变我们对AI的理解方式。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心问题为什么简单能产生复杂&#34;&gt;核心问题：为什么&amp;quot;简单&amp;quot;能产生&amp;quot;复杂&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;这个问题困扰了科学家很久。&lt;/p&gt;&#xA;&lt;p&gt;传统的思维方式是&amp;quot;自上而下&amp;quot;的——你想造一辆车，需要总设计师画好图纸，然后各个部门按图施工。没有一个总设计师，车子就造不出来。&lt;/p&gt;&#xA;&lt;p&gt;但自然界不是这样运作的。蚁群没有总设计师，却建出了蚁穴；大脑没有总指挥，却产生了意识；市场没有中央计划，却实现了资源分配；城市没有统一规划师，却自发生长出了复杂的交通网络。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这些系统有一个共同的特征：大量简单的个体，遵循简单的规则，彼此交互，在宏观层面涌现出了复杂、智能的行为。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;从简单到复杂&amp;quot;的过程，叫做&lt;strong&gt;涌现&lt;/strong&gt;。而研究涌现的系统，就是复杂适应系统。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四个要素拆解cas到底在说什么&#34;&gt;四个要素拆解：CAS到底在说什么？&lt;/h2&gt;&#xA;&lt;p&gt;复杂适应系统理论由约翰·霍兰德（John Holland）在1990年代系统化提出。它的核心命题只有一句话：&lt;strong&gt;适应性造就复杂性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;拆开来看，CAS有四个关键机制：&lt;/p&gt;&#xA;&lt;h3 id=&#34;1-聚集蚂蚁蚁群神经元大脑&#34;&gt;1. 聚集：蚂蚁→蚁群，神经元→大脑&lt;/h3&gt;&#xA;&lt;p&gt;最基本的机制是&lt;strong&gt;聚集&lt;/strong&gt;——个体聚集起来，形成更高层次的&amp;quot;元主体&amp;quot;。蚁群是蚂蚁的聚集，大脑是神经元的聚集，城市是人的聚集。&lt;/p&gt;&#xA;&lt;p&gt;关键之处在于：&lt;strong&gt;聚集之后，新的性质就出现了。&lt;/strong&gt; 一只蚂蚁没有&amp;quot;筑巢&amp;quot;这个概念，但蚁群有。一个神经元没有&amp;quot;记忆&amp;quot;这个概念，但大脑有。一个人没有&amp;quot;市场&amp;quot;这个概念，但城市有。&lt;/p&gt;&#xA;&lt;p&gt;这就是涌现——&lt;strong&gt;整体大于部分之和&lt;/strong&gt;，不是修辞，而是事实。&lt;/p&gt;&#xA;&lt;h3 id=&#34;2-标识你如何从人群中找到同类&#34;&gt;2. 标识：你如何从人群中找到同类？&lt;/h3&gt;&#xA;&lt;p&gt;个体之间怎么知道该和谁交互？靠&lt;strong&gt;标识&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;蚂蚁释放信息素，告诉同伴&amp;quot;这里有食物&amp;quot;。神经元用神经递质传递信号，告诉下一个神经元&amp;quot;该放电了&amp;quot;。人在社交媒体上发帖，用标签告诉同类&amp;quot;这里有人跟我聊得来&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;标识让个体能够快速筛选交互对象，避免信息过载。没有标识，蚂蚁就找不到食物，神经元就传不了信号，你的朋友圈就刷不出想看的内容。&lt;/p&gt;&#xA;&lt;h3 id=&#34;3-非线性蝴蝶效应并不罕见&#34;&gt;3. 非线性：蝴蝶效应并不罕见&lt;/h3&gt;&#xA;&lt;p&gt;在CAS中，&lt;strong&gt;微小的变化可能引起巨大的后果&lt;/strong&gt;，巨大的投入也可能只产生微小的效果。&lt;/p&gt;&#xA;&lt;p&gt;一只蝴蝶在巴西扇动翅膀，可能在德克萨斯引起一场龙卷风——这句著名的&amp;quot;蝴蝶效应&amp;quot;描述的就是非线性。一个用户在社交媒体上发了一张照片，可能引发全球范围的传播——这就是非线性的力量。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;非线性意味着不可预测&lt;/strong&gt;。这也是为什么复杂适应系统这么难研究——你没办法通过&amp;quot;放大局部&amp;quot;来理解全局。&lt;/p&gt;&#xA;&lt;h3 id=&#34;4-内部模型每个个体都有世界观&#34;&gt;4. 内部模型：每个个体都有&amp;quot;世界观&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;这是CAS最有趣的部分：&lt;strong&gt;每个个体都拥有一个对外部世界的内部模型。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;蚁群中的工蚁有&amp;quot;如果信息素浓度高，就跟着走&amp;quot;的内部模型。大脑中的神经元有&amp;quot;如果输入信号超过阈值，就放电&amp;quot;的内部模型。你在路上看到一个球滚过来，大脑中有一个&amp;quot;球会继续滚&amp;quot;的内部模型，这个模型让你下意识地躲开——甚至不需要思考。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;内部模型通过经验不断更新&lt;/strong&gt;。你今天被烫到了，大脑中&amp;quot;火炉&amp;quot;的内部模型就会被更新——下次你会离它远一点。这就是学习，也是适应的本质。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;cas如何改变ai&#34;&gt;CAS如何改变AI？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会问：这跟AI有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关系大了。因为AI的进化，本质上就是从&amp;quot;自上而下设计&amp;quot;向&amp;quot;自下而上涌现&amp;quot;的转变。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;传统ai自上而下的工程师思维&#34;&gt;传统AI：自上而下的工程师思维&lt;/h3&gt;&#xA;&lt;p&gt;早期的AI（专家系统、规则系统）是典型的&amp;quot;自上而下&amp;quot;——工程师把人类的知识总结成规则，然后告诉AI&amp;quot;如果A则B&amp;quot;。这种思路在简单场景下很有效，但遇到复杂任务就崩溃了——因为真实世界太复杂了，规则写不完。&lt;/p&gt;&#xA;&lt;h3 id=&#34;现代ai自下而上的涌现思维&#34;&gt;现代AI：自下而上的涌现思维&lt;/h3&gt;&#xA;&lt;p&gt;深度学习出现后，AI不再依赖人类写规则，而是让&lt;strong&gt;大量简单的计算单元（神经元）通过大量数据和试错，自己涌现出智能&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;一个神经网络中的单个神经元，做的只是&amp;quot;输入加权求和→输出&amp;quot;这么简单的事。但几百万个这样的神经元组合起来，通过合理的连接方式和大量数据训练，就能涌现出&amp;quot;识别猫&amp;quot;、&amp;ldquo;理解语言&amp;rdquo;、&amp;ldquo;下围棋&amp;quot;这样的复杂能力。&lt;/p&gt;&#xA;&lt;p&gt;这就是CAS的精确映射：&lt;strong&gt;简单个体×大规模交互×适应性反馈=复杂智能。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;多智能体系统ai中的蚁群&#34;&gt;多智能体系统：AI中的蚁群&lt;/h3&gt;&#xA;&lt;p&gt;更进一步，CAS直接催生了&lt;strong&gt;多智能体系统（MAS）&lt;/strong&gt;——让多个AI智能体像蚁群一样交互、协作、竞争，涌现出单个智能体不具备的能力。&lt;/p&gt;&#xA;&lt;p&gt;想象一下：一个AI只会写代码，另一个AI只会测试，第三个AI只会部署。它们各自独立时，能力有限。但当你让它们组成一个&amp;quot;团队&amp;rdquo;，遵循&amp;quot;写完代码传给测试、测试通过传给部署&amp;quot;的简单规则，整个系统就能自动完成软件交付的全流程——&amp;ldquo;智能&amp;quot;从团队层面的交互中涌现了出来。&lt;/p&gt;&#xA;&lt;p&gt;MetaGPT、AutoGen 这些框架，本质上就是在做这件事——把AI组织成&amp;quot;虚拟团队&amp;rdquo;，让&amp;quot;团队智能&amp;quot;超越&amp;quot;个体智能&amp;quot;的总和。&lt;/p&gt;&#xA;&lt;h3 id=&#34;大语言模型cas的终极隐喻&#34;&gt;大语言模型：CAS的终极隐喻？&lt;/h3&gt;&#xA;&lt;p&gt;从CAS视角看，大语言模型本身就是一个巨大的复杂适应系统：&lt;strong&gt;知识表征空间中的概念节点是&amp;quot;主体&amp;quot;，注意力机制是主体之间的&amp;quot;交互规则&amp;quot;，训练过程是&amp;quot;适应过程&amp;quot;，推理过程是&amp;quot;内部模型的应用&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;LLM的很多惊人能力——上下文学习、思维链推理、涌现能力——本质上都可以被理解为CAS式的涌现：大量概念之间的非线性交互，在宏观层面产生了新的认知能力。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么要关心cas&#34;&gt;为什么要关心CAS？&lt;/h2&gt;&#xA;&lt;p&gt;好了，这些理论看起来很高深，但跟普通人有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系太大了。&lt;strong&gt;理解CAS，就是理解这个世界的底层运转规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么你刷短视频停不下来？&lt;/strong&gt; 因为平台是一个CAS——算法（标识）不断推送你可能感兴趣的内容，你的点击（反馈）不断更新算法对你的理解，你和平台之间形成了一个&amp;quot;适应性反馈循环&amp;quot;，最终你被&amp;quot;困&amp;quot;在了这个系统里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么有些公司能快速成长，有些却突然死亡？&lt;/strong&gt; 公司也是一个CAS——员工（个体）之间的交互方式（协作模式）决定了公司能否涌现出&amp;quot;创新&amp;quot;这种宏观能力。保持多样性（不同背景的员工）和适度的非线性（跨部门协作），是公司保持活力的关键。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么AI会越来越强？&lt;/strong&gt; 因为AI的进化路径本身就是CAS式的——从简单的计算单元，通过大规模交互和适应性反馈，涌现出越来越复杂的智能。这条路没有止境，因为&lt;strong&gt;只要适应还在继续，复杂性就会继续增长&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从设计到涌现&#34;&gt;结语：从&amp;quot;设计&amp;quot;到&amp;quot;涌现&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：为什么蚂蚁能建出那么复杂的蚁穴？&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;它们不需要设计蚁穴，它们只需要相互适应。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;每只蚂蚁遵循简单的规则，在适应环境和同伴的过程中，宏观的结构就自然涌现出来了。不需要全局规划，不需要中央控制，不需要天才设计师。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI不用老师也能自己学？——自监督学习的魔力</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</link>
				<pubDate>Sun, 23 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;你不可能给他一张张标注好&amp;quot;这是猫，这不是猫&amp;quot;的照片，然后让他背下来。但神奇的是，他看过几次猫之后，就能自己认出猫——哪怕猫换了姿势、换了光线、换了背景，他都知道&amp;quot;这是猫&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来理所当然，但对AI来说，这曾经是一个巨大的难题。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI学习方式，需要大量人工标注的数据。比如你想让AI学会识别猫，你得先给它看几万张标注了&amp;quot;猫&amp;quot;或&amp;quot;不是猫&amp;quot;的照片。这叫&lt;strong&gt;监督学习&lt;/strong&gt;——就像有一个老师，每道题都告诉你正确答案。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：世界上有那么多东西需要AI认识，哪有那么多&amp;quot;老师&amp;quot;给每张照片打标签？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;自监督学习&lt;/strong&gt;要解决的问题——让AI像小孩一样，&lt;strong&gt;不用老师，自己也能学会&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;老师不够用了&#34;&gt;&amp;ldquo;老师&amp;quot;不够用了&lt;/h2&gt;&#xA;&lt;p&gt;先说说为什么&amp;quot;自监督&amp;quot;这么重要。&lt;/p&gt;&#xA;&lt;p&gt;传统监督学习有一个致命的瓶颈：&lt;strong&gt;标注成本&lt;/strong&gt;。你让AI识别猫，可能要花几千小时让人工去标注几百万张图片。如果让它识别罕见病CT影像呢？能看懂CT片的医生本来就少，哪来的时间给你一张张标注？&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，人类的学习方式本身就不是&amp;quot;监督&amp;quot;的。你学会认猫，不是因为有人给你标了数据，而是因为你&lt;strong&gt;观察了足够多的猫&lt;/strong&gt;，自己总结出了规律。你学会了说话，不是因为有人给你一张语法规则表，而是因为你&lt;strong&gt;听了足够多的话&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;所以一个自然的问题就是：&lt;strong&gt;能不能让AI也这样学？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是可以，而且这条路正在改变整个AI领域。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心思想让数据给自己出题&#34;&gt;核心思想：让数据给自己出题&lt;/h2&gt;&#xA;&lt;p&gt;自监督学习的基本思路听起来很巧妙：&lt;strong&gt;让数据自己给自己出题&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你不是直接告诉AI&amp;quot;这张图是猫&amp;rdquo;，而是把一张猫的照片切成两半，让AI猜&amp;quot;这两半是不是同一张图上的&amp;quot;。AI为了答对这道题，必须学会理解&amp;quot;猫&amp;quot;长什么样、有什么特征——在这个过程中，它自然而然地就学会了识别猫，而你根本不需要给它任何标签。&lt;/p&gt;&#xA;&lt;p&gt;这就是自监督学习最核心的智慧：&lt;strong&gt;不要给AI答案，给它出题，让它自己从题目中学习。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这套方法主要有两大学派，我们来看看它们各自是怎么&amp;quot;出题&amp;quot;的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派一对比学习找不同的反向操作&#34;&gt;流派一：对比学习——&amp;ldquo;找不同&amp;quot;的反向操作&lt;/h2&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习（Contrastive Learning）&lt;/strong&gt; 的思路是：让AI学会区分&amp;quot;相似&amp;quot;和&amp;quot;不相似&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，对同一张图片做两种不同的处理——比如裁剪不同区域、调整颜色、旋转角度——得到两张&amp;quot;长得不一样但本质是同一张图&amp;quot;的版本。AI的任务是：&lt;strong&gt;把这两张&amp;quot;同源&amp;quot;的图片识别为相似，把来自不同图的图片识别为不相似。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像你给AI出题：&amp;ldquo;这两张图是同一只猫的不同角度，那两张图是两只不同的猫，你给我分出来。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;听起来似乎不难，但真正做起来，里面有很多门道。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;SimCLR&lt;/strong&gt;（Google 2020年提出）是这一派的开创者之一。它的做法很有意思：把同一张图做两种不同的&amp;quot;数据增强&amp;quot;——比如一张剪了左上角还调亮了，另一张剪了右下角还压暗了——然后让AI学会把这两张&amp;quot;增强版&amp;quot;识别为同一张图。为了做到这一点，AI必须理解图片的&amp;quot;本质内容&amp;quot;是什么，而不是被表面变化迷惑。SimCLR在ImageNet上达到了76.5%的Top-1准确率，几乎追平了监督学习的ResNet-50——而这一切，&lt;strong&gt;没有使用任何一张人工标注的图片&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MoCo&lt;/strong&gt;（何恺明团队，Facebook 2020）走了另一条路。它用了一个&amp;quot;记忆队列&amp;quot;——把之前见过的所有图片特征都存起来，形成一个巨大的&amp;quot;字典&amp;quot;。当新图片进来时，AI就在这个字典里找&amp;quot;谁和谁长得像&amp;quot;。这个看似简单的设计，让对比学习可以在普通显卡上训练，而不需要大batch size。MoCo在目标检测任务上第一次超越了监督预训练——这意味着自监督学习不仅&amp;quot;够用&amp;quot;，在某些场景下甚至比&amp;quot;有老师教&amp;quot;的更好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BYOL&lt;/strong&gt;（DeepMind 2020）则更进一步——它连&amp;quot;不相似&amp;quot;的样本都不需要了。它只学&amp;quot;同一张图的两个版本应该相似&amp;quot;，完全不用看&amp;quot;不相似的图长什么样&amp;quot;。这就好比一个小孩只盯着猫看，不看狗，竟然也能学会认猫。这个发现打破了学界的共识——原来&amp;quot;负样本&amp;quot;不是必须的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派二掩码预测完形填空的智慧&#34;&gt;流派二：掩码预测——&amp;ldquo;完形填空&amp;quot;的智慧&lt;/h2&gt;&#xA;&lt;p&gt;另一条路更直觉：&lt;strong&gt;遮住一部分，让AI猜被遮住的是什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE（Masked Autoencoders）&lt;/strong&gt;（何恺明团队，Meta 2022）把这张做到了极致。它随机遮掉一张图片的75%——没错，只留下25%的碎片给AI看，然后让AI复原整张图。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个&amp;quot;不可能完成的任务&amp;rdquo;。但正是这种&amp;quot;极度困难&amp;quot;的设定，迫使AI学会了真正的&amp;quot;理解&amp;quot;。你想想，如果你只看到一个人的眼睛和耳朵，要猜出整张脸长什么样——你必须理解&amp;quot;人脸的结构是什么样的&amp;quot;、&amp;ldquo;眼睛和耳朵之间有什么关系&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;MAE的巧妙之处在于它的&amp;quot;非对称设计&amp;quot;：编码器只看那25%的可见碎片（计算量小），解码器负责复原那75%的遮挡部分（稍微重一点但只用一次）。这个设计让训练速度提升了4倍以上。最终，MAE在ImageNet上达到了87.8%的Top-1准确率——已经超过了大多数有监督的方法。&lt;/p&gt;&#xA;&lt;p&gt;你可能会觉得这很熟悉——没错，就是&lt;strong&gt;BERT&lt;/strong&gt;的思路。BERT遮住文本中的一些词让AI猜，MAE遮住图像中的一些区域让AI复原。&lt;strong&gt;&amp;ldquo;完形填空&amp;quot;这个思路，从文本到图像，通用得令人惊讶。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;clip让ai学会看图说话&#34;&gt;CLIP：让AI学会&amp;quot;看图说话&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;如果说对比学习是&amp;quot;让AI自己学会区分&amp;quot;，那么&lt;strong&gt;CLIP&lt;/strong&gt;（OpenAI 2021）就是&amp;quot;让AI学会跨语言的联想&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：在网上找了4亿张图文配对的数据（比如一张猫的照片，配文&amp;quot;一只橘猫趴在窗台上&amp;quot;），然后让AI学会&lt;strong&gt;把图片和对应的文字匹配到一起&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，给AI一张图片和一段文字描述，问它：&amp;ldquo;这张图配这段文字，配不配？&amp;ldquo;为了答对这道题，AI必须同时理解图片的内容和文字的含义，然后把它们对应起来。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的神奇之处在于，学完之后，它&lt;strong&gt;不需要任何额外的训练数据&lt;/strong&gt;就能做图像分类。你告诉它&amp;quot;识别猫、狗、鸟&amp;rdquo;——它自己就能把图片分好类，准确率高达76.2%（ImageNet零样本分类）。这意味着，&lt;strong&gt;你不需要给CLIP任何一张标注好的猫照片，它就已经知道猫长什么样了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，CLIP已经成为了Stable Diffusion、DALL·E 2等生成模型的&amp;quot;眼睛&amp;rdquo;——它让AI既&amp;quot;看得懂图&amp;quot;，又&amp;quot;读得懂字&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么自己学比有人教更重要&#34;&gt;为什么&amp;quot;自己学&amp;quot;比&amp;quot;有人教&amp;quot;更重要？&lt;/h2&gt;&#xA;&lt;p&gt;到这里你可能会问：自监督学习确实很酷，但它到底有什么用？跟普通人的生活有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。想想这些场景：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：医疗影像&lt;/strong&gt;。罕见病的CT影像本来就少，能标注的医生更少。自监督学习可以先让AI&amp;quot;自己看&amp;quot;大量未标注的CT片，学会&amp;quot;正常肺部长什么样&amp;quot;，然后再少量标注数据就能学会&amp;quot;识别异常&amp;quot;。这大大降低了对人工标注的依赖。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：多语言翻译&lt;/strong&gt;。世界上有7000多种语言，大部分语言根本没有足够的标注数据。自监督学习（比如BERT的多语言版本）可以让AI&amp;quot;自己读&amp;quot;大量不同语言的文本，学会&amp;quot;语言之间的对应关系&amp;quot;，即使某些语言只有很少的翻译数据。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：自动驾驶&lt;/strong&gt;。一辆自动驾驶汽车每天会产生TB级别的视频数据，但大部分都是&amp;quot;正常行驶&amp;quot;的普通画面，真正需要标注的&amp;quot;异常场景&amp;quot;非常少。自监督学习可以让AI从这些海量无标注数据中学到&amp;quot;道路的通用规律&amp;quot;，而不是只依赖人工标注的少数场景。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习的真正意义，在于它打破了AI对&amp;quot;人工标注&amp;quot;的依赖。&lt;/strong&gt; 世界上绝大多数数据——图片、视频、文字、声音——都是没有标签的。如果AI只能从&amp;quot;有标签&amp;quot;的数据中学习，它永远只能理解人类世界的一小部分。而自监督学习，让AI可以像人类一样，从&amp;quot;观察&amp;quot;中自己学习。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从喂数据到自己学&#34;&gt;结语：从&amp;quot;喂数据&amp;quot;到&amp;quot;自己学&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;答案其实很简单——&lt;strong&gt;他不需要&amp;quot;老师&amp;quot;告诉他每张照片是不是猫，他只需要看足够多的猫，大脑就能自己总结出&amp;quot;猫是什么&amp;quot;的规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自监督学习做的，正是同一件事：&lt;strong&gt;不再给AI&amp;quot;答案&amp;quot;，而是给它&amp;quot;问题&amp;quot;——让它从数据本身的结构中，自己发现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从SimCLR到MAE，从对比学习到掩码预测，从CLIP到GPT——这些方法的共同内核是：&lt;strong&gt;让数据自己说话。&lt;/strong&gt; 而这对AI的意义，可能比我们想象的要深远得多。因为当AI学会&amp;quot;自己学&amp;quot;之后，它就不再受限于人类能教它的东西——它可以自己去探索、去发现、去理解那些我们甚至还没想到的知识。&lt;/p&gt;&#xA;&lt;p&gt;而这，或许才是通往真正智能的那把钥匙。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen et al. &lt;em&gt;A Simple Framework for Contrastive Learning of Visual Representations&lt;/em&gt;. ICML 2020. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;arXiv:2002.05709&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Momentum Contrast for Unsupervised Visual Representation Learning&lt;/em&gt;. CVPR 2020. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;arXiv:1911.05722&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Masked Autoencoders Are Scalable Vision Learners&lt;/em&gt;. CVPR 2022. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;arXiv:2111.06377&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill et al. &lt;em&gt;Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning&lt;/em&gt;. NeurIPS 2020. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;arXiv:2006.07733&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Radford et al. &lt;em&gt;Learning Transferable Visual Models From Natural Language Supervision&lt;/em&gt;. ICML 2021. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;arXiv:2103.00020&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的&#39;试错&#39;学习法——强化学习如何让AI从失败中学会成功</title>
				<link>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</link>
				<pubDate>Sat, 22 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AlphaGo 是怎么学会下围棋的？它不可能像人类一样翻棋谱、背定式——它甚至连&amp;quot;围棋是什么&amp;quot;都不理解。但2016年，它却以4:1击败了世界冠军李世石。&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，AlphaGo 的&amp;quot;学习&amp;quot;方式，本质上和你教狗坐下没什么区别：做对了，给奖励；做错了，没奖励。反复试错，直到学会。&lt;/p&gt;&#xA;&lt;p&gt;这听起来简单，但背后隐藏着一个深刻的问题——&lt;strong&gt;如果AI没有人类的逻辑推理能力，它如何通过&amp;quot;瞎试&amp;quot;学会复杂技能？&lt;/strong&gt; 这就是强化学习的核心谜题，也是今天AI领域最令人着迷的技术之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不是教是练&#34;&gt;不是&amp;quot;教&amp;quot;，是&amp;quot;练&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先区分一个常见的误解。很多人以为AI变聪明，是因为工程师&amp;quot;教&amp;quot;了它很多东西——比如给它看几百万张猫的照片，它就能识别猫。&lt;/p&gt;&#xA;&lt;p&gt;这叫&lt;strong&gt;监督学习&lt;/strong&gt;，确实很强大，但它有一个致命缺陷：你必须先知道正确答案。你不可能给AlphaGo几百万张&amp;quot;这步棋应该下在哪儿&amp;quot;的标注数据，因为围棋的每一步都没有标准答案。&lt;/p&gt;&#xA;&lt;p&gt;强化学习走的是另一条路：&lt;strong&gt;不教，只练&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个黑暗的迷宫里，每走一步，可能踩到金币（+1分），也可能踩到陷阱（-10分）。你一开始完全不知道方向，只能乱走。但走着走着，你发现往左转容易踩到金币，往右转容易掉进陷阱——于是你学会了一个策略：&amp;ldquo;往左转&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是强化学习最基本的逻辑：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;智能体&lt;/strong&gt; → 做决策的AI（比如你）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;环境&lt;/strong&gt; → 它身处其中的世界（比如迷宫）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动作&lt;/strong&gt; → 它每一步的选择（比如左转、右转）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励&lt;/strong&gt; → 行动的反馈（金币+1，陷阱-10）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;策略&lt;/strong&gt; → 学习的成果（&amp;ldquo;往左转&amp;quot;这个规则）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;没有老师，没有标准答案，只有&amp;quot;这个动作之后，我得到了什么反馈&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从乱试到会试探索与利用的博弈&#34;&gt;从&amp;quot;乱试&amp;quot;到&amp;quot;会试&amp;quot;——探索与利用的博弈&lt;/h2&gt;&#xA;&lt;p&gt;但这里有一个矛盾：如果你一直往左转，可能永远发现不了右边有一个更大的宝藏。这就是强化学习最核心的难题——&lt;strong&gt;探索与利用的平衡&lt;/strong&gt;（exploration vs. exploitation）。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;利用&lt;/strong&gt;：走你已经知道能拿到奖励的路（稳定但不会进步）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索&lt;/strong&gt;：尝试没走过的路（可能发现更好的，也可能踩坑）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这在直觉上很简单：你总不能天天吃同一种菜吧？但AI没有&amp;quot;好奇心&amp;quot;这种情感，它需要一套数学机制来驱动&amp;quot;探索&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;早期的办法是&amp;quot;ε-greedy&amp;quot;策略：90%的时间走最优路径，10%的时间随机乱走。这就像你每周五天去最喜欢的餐厅，但留一天随机探店——万一发现更好的呢？&lt;/p&gt;&#xA;&lt;p&gt;但真正让强化学习变得强大的，是更聪明的探索方式。比如SAC算法（Soft Actor-Critic）的核心思想就是：&lt;strong&gt;AI不仅要学会完成任务，还要保持一定程度的&amp;quot;随机性&amp;quot;&lt;/strong&gt;——在完成任务和保持好奇心之间找平衡。它不追求&amp;quot;每一步都走对&amp;quot;，而是追求&amp;quot;即使走错一步，也不会全盘崩溃&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很反直觉，但事实是：一个太&amp;quot;确定&amp;quot;的AI往往很脆弱；一个会&amp;quot;适当犯傻&amp;quot;的AI，反而更聪明、更稳定。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从小游戏到围棋大师alphago的秘密&#34;&gt;从小游戏到围棋大师——AlphaGo的秘密&lt;/h2&gt;&#xA;&lt;p&gt;说回AlphaGo。它之所以能击败李世石，不是因为它的&amp;quot;大脑&amp;quot;有多聪明，而是因为它学会了&amp;quot;思考&amp;quot;——不是人类的思考，而是一种叫&lt;strong&gt;蒙特卡洛树搜索&lt;/strong&gt;（MCTS）的技术。&lt;/p&gt;&#xA;&lt;p&gt;想象你在下围棋，每一步都有几十种选择。你不可能算到终局，但你可以&amp;quot;模拟&amp;quot;几个不同的下法，看看哪个结果更好。AlphaGo就是这么做的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;直觉系统&lt;/strong&gt;（策略网络）：看一眼棋盘，就能快速判断哪些位置值得下、哪些不值得&lt;/li&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;判断系统&lt;/strong&gt;（值网络）：对每个局面，能估算出胜率&lt;/li&gt;&#xA;&lt;li&gt;它把这两个系统结合起来，在脑海中模拟成千上万种可能的走法，然后选择&amp;quot;看起来最有可能赢&amp;quot;的那一步&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这种方法之所以强大，是因为它&lt;strong&gt;不是背棋谱&lt;/strong&gt;。AlphaGo的每一步决策，都是&amp;quot;实时计算&amp;quot;出来的——它在一个时间点可能选择A，但换一个局面，同样的位置它可能完全忽略。&lt;/p&gt;&#xA;&lt;p&gt;最终，AlphaGo通过三阶段训练完成了从零到大师的蜕变：先看人类棋谱学个大概（监督学习），再跟自己下棋自我提升（强化学习），最后学习评估局面好坏（值网络）。每一步都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中完成的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么你的手机越来越懂你&#34;&gt;为什么你的手机越来越&amp;quot;懂你&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;强化学习不只是下围棋。它可能正在塑造你的日常生活，而你完全没意识到。&lt;/p&gt;&#xA;&lt;p&gt;抖音的推荐系统、淘宝的&amp;quot;猜你喜欢&amp;quot;、甚至你手机上的智能助手——它们都在使用强化学习的思想。每次你刷到一个视频看完，就是一次&amp;quot;奖励&amp;quot;信号；每次你划走，就是一次&amp;quot;惩罚&amp;quot;。系统在不断试错中学会什么内容能让你停留更久。&lt;/p&gt;&#xA;&lt;p&gt;更典型的例子是&lt;strong&gt;机器人走路&lt;/strong&gt;。你不能给机器人写一个&amp;quot;左脚迈30厘米，右脚迈35厘米，身体前倾15度&amp;quot;的精确程序——因为地面不平、重心变化、甚至电池电量都会影响结果。但你可以给它一个简单的目标信号：&amp;ldquo;往前走，别摔倒&amp;rdquo;。然后通过强化学习让它在数百万次跌倒中学会自己调整步态。&lt;/p&gt;&#xA;&lt;p&gt;这和我们人类学走路的方式一模一样——你小时候不是看了说明书才学会走路的，你是跌倒了无数次，在疼痛中学会了平衡。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;强化学习的边界它还不能做什么&#34;&gt;强化学习的边界——它还不能做什么&lt;/h2&gt;&#xA;&lt;p&gt;当然，强化学习不是万能的。&lt;/p&gt;&#xA;&lt;p&gt;首先，它&lt;strong&gt;效率不高&lt;/strong&gt;。AlphaGo跟自己下了几千万盘棋才达到大师水平。如果让一个AI学开车，让它先在真实道路上&amp;quot;试错&amp;quot;几百万次——那它得撞坏多少辆车？所以自动驾驶用的是模仿学习和模拟器，而不是纯强化学习。&lt;/p&gt;&#xA;&lt;p&gt;其次，它&lt;strong&gt;需要明确的奖励信号&lt;/strong&gt;。怎么定义&amp;quot;一篇好文章&amp;quot;的奖励？阅读量？点赞数？转发数？这些指标都很片面。在奖励模糊的场景中，强化学习容易学偏——比如一个AI为了追求&amp;quot;点赞最大化&amp;quot;，可能会生成标题党、煽动性内容，而不是真正有价值的信息。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;强化学习学到的&amp;quot;策略&amp;quot;，往往是黑箱&lt;/strong&gt;。AlphaGo下出了很多人类从未见过的&amp;quot;神之一手&amp;quot;，但没人能解释它为什么那么下。它是对的，但它是&amp;quot;蒙对的&amp;quot;还是&amp;quot;真懂的&amp;quot;？这是一个哲学问题，也是AI可解释性领域正在攻克的难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三种学习方式的对比ai的学习观&#34;&gt;三种学习方式的对比——AI的&amp;quot;学习观&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;放在更大的框架下看，AI的三种学习方式就像三种不同的学习方法：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：像&amp;quot;刷题式学习&amp;quot;——给你大量题目和标准答案，直到你学会举一反三&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：像&amp;quot;自学式学习&amp;quot;——给你一堆书，不管你看不看，你自己找规律&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：像&amp;quot;实战式学习&amp;quot;——把你扔进真实战场，打输了就挨打，打赢了有奖励，你在血与火中学会生存&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三种方式各有优劣，没有哪一种&amp;quot;最好&amp;quot;。但强化学习有一种独特的魅力——它是最接近&amp;quot;生命学习&amp;quot;的方式。从细菌寻找食物，到婴儿学走路，到人类探索未知世界，本质上都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中进化的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语学会失败的ai&#34;&gt;结语：学会&amp;quot;失败&amp;quot;的AI&lt;/h2&gt;&#xA;&lt;p&gt;强化学习教会我们一件事：&lt;strong&gt;失败不是终点，是数据&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;每一次错误的选择，每一次糟糕的决策，都在告诉AI&amp;quot;这条路行不通，换一条&amp;quot;。AlphaGo输给李世石的那一盘棋，不是&amp;quot;失败&amp;quot;，而是它学习路径上的一个梯度信号。&lt;/p&gt;&#xA;&lt;p&gt;也许这就是强化学习最迷人的地方——它不只是一种技术，更是一种哲学。它告诉我们，智能不是&amp;quot;知道正确答案&amp;quot;的能力，而是&amp;quot;从错误中学习&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;而AI之所以能变得比人类更聪明，不是因为它们不会犯错，而是因为它们&lt;strong&gt;不怕犯错&lt;/strong&gt;——它们可以在模拟器中失败一百万次，而不会感到沮丧。&lt;/p&gt;&#xA;&lt;p&gt;这一点，我们人类或许也该学学。&lt;/p&gt;</description>
			</item>
			<item>
				<title>让AI学会&#39;一步一步想&#39;——思维链推理如何改变AI的思考方式</title>
				<link>https://lingyu7.com/posts/how-chain-of-thought-changes-ai-thinking/</link>
				<pubDate>Fri, 21 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-chain-of-thought-changes-ai-thinking/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有遇到过这种情况？&lt;/p&gt;&#xA;&lt;p&gt;你问AI：&amp;ldquo;一个篮球和一副乒乓球拍一共85元，篮球比乒乓球拍贵15元，篮球多少钱？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;AI直接回答：&amp;ldquo;50元。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你追问：&amp;ldquo;你怎么算出来的？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;AI说：&amp;ldquo;85-15=70，70/2=35，35+15=50。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个答案是对的，但如果它答错了，它可能会非常自信地给出一个错误结果，而你完全不知道它错在哪里。&lt;/p&gt;&#xA;&lt;p&gt;但如果你换一种问法：&amp;ldquo;请一步一步思考：篮球和乒乓球拍一共85元，篮球比乒乓球拍贵15元。设乒乓球拍价格为x，则篮球价格为x+15，总价x+(x+15)=85，解方程得x=35，所以篮球价格为50元。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;AI几乎不会出错。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;同一个问题，同一个模型，不同的问法——结果天差地别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一发现，改变了AI的底层能力曲线。它有一个专门的名字——&lt;strong&gt;思维链推理（Chain-of-Thought, CoT）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章一个一句话的魔法&#34;&gt;第一章：一个&amp;quot;一句话&amp;quot;的魔法&lt;/h2&gt;&#xA;&lt;p&gt;2022年，Google的研究人员发表了一篇论文，标题很直白：&lt;strong&gt;&amp;ldquo;Chain-of-Thought Prompting Elicits Reasoning in Large Language Models&amp;rdquo;&lt;/strong&gt;——思维链提示激发大语言模型的推理能力。&lt;/p&gt;&#xA;&lt;p&gt;核心发现极其简单，简单到让人怀疑是不是搞错了：&lt;strong&gt;在问问题的时候，加一句&amp;quot;让我们一步一步思考&amp;quot;，AI的推理能力就会大幅提升。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这不是一个复杂的技术改进，不是模型架构的升级，不需要重新训练，不花一分钱算力。&lt;strong&gt;它只是一个提示技巧。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但效果是惊人的：&lt;/p&gt;&#xA;&lt;p&gt;在GSM8K（小学数学应用题基准）上，标准的直接回答准确率只有18%，而加了&amp;quot;让我们一步一步思考&amp;quot;之后，准确率飙升到了79%。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;从18%到79%，靠的是一句话。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像你同一个孩子：&amp;ldquo;3+5等于几？&amp;ldquo;他说等于8。但你问：&amp;ldquo;小明有3个苹果，小红又给了他5个，他现在有几个？&amp;ldquo;他反而答不上来。然后你告诉他：&amp;ldquo;你慢慢想，一步一步来。&amp;ldquo;他突然就懂了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是孩子变聪明了，而是你给了他一个更好的思考框架。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章为什么一步一步想有效&#34;&gt;第二章：为什么&amp;quot;一步一步想&amp;quot;有效？&lt;/h2&gt;&#xA;&lt;p&gt;表面上看，这只是一个提示技巧。但背后揭示了一个更深层的道理：&lt;strong&gt;语言不仅是表达思想的工具，也是组织思想的工具。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一层分解问题复杂度&#34;&gt;第一层：分解问题复杂度&lt;/h3&gt;&#xA;&lt;p&gt;大模型本质上是&amp;quot;下一个词预测器&amp;rdquo;。当你直接问&amp;quot;篮球多少钱&amp;rdquo;，它需要在一步之内从输入跳到输出——中间没有&amp;quot;思考过程&amp;quot;的空间。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;一步跳&amp;quot;就像让你心算37×24，你可能会出错。但如果让你一步一步算——37×20=740，37×4=148，740+148=888——你基本上不会错。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思维链的核心作用，就是把一个复杂问题分解成多个简单步骤。&lt;/strong&gt; 每一步的推理负担都变小了，出错的概率就降低了。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二层提供工作记忆&#34;&gt;第二层：提供&amp;quot;工作记忆&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;人类在做复杂推理时，会用纸笔记录中间结果。大脑的&amp;quot;工作记忆&amp;quot;容量有限，写下来相当于扩展了工作记忆。&lt;/p&gt;&#xA;&lt;p&gt;大模型也一样。当你让AI输出&amp;quot;中间步骤&amp;quot;时，这些中间结果就成了它的&amp;quot;纸笔&amp;rdquo;——它可以在后续步骤中引用自己的输出，而不是凭空推理。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思维链相当于给AI发了一张草稿纸。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三层自我纠错机制&#34;&gt;第三层：自我纠错机制&lt;/h3&gt;&#xA;&lt;p&gt;当AI直接输出答案时，它没有机会纠错。一旦生成错误词，后面的内容都会受这个错误影响——就像多米诺骨牌，第一块倒错了，后面的全错。&lt;/p&gt;&#xA;&lt;p&gt;但思维链让AI可以在中间步骤中&amp;quot;看见&amp;quot;自己的推理过程。如果某个步骤出错了，后续步骤有可能发现并修正它。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就好比一个学生写数学题：直接写答案，错了就全错；但写清楚解题步骤，即使最后答案错了，老师也能看到中间哪一步出了问题——而且学生自己也可能在写步骤的过程中发现错误。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章从一句话到一套方法论&#34;&gt;第三章：从&amp;quot;一句话&amp;quot;到&amp;quot;一套方法论&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;&amp;ldquo;让我们一步一步思考&amp;quot;只是开始。研究人员很快发现，你可以做得更好。&lt;/p&gt;&#xA;&lt;h3 id=&#34;零样本思维链zero-shot-cot&#34;&gt;零样本思维链（Zero-shot CoT）&lt;/h3&gt;&#xA;&lt;p&gt;最基本的版本：在问题后面直接加一句&amp;quot;Let&amp;rsquo;s think step by step&amp;quot;或&amp;quot;让我们一步一步思考&amp;rdquo;。不需要任何示例，不限语言，不需要提前准备——这就是&amp;quot;零样本&amp;quot;的含义。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你只需要在提示词末尾加上这句话，AI就会自动输出推理过程，然后给出答案。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;少样本思维链few-shot-cot&#34;&gt;少样本思维链（Few-shot CoT）&lt;/h3&gt;&#xA;&lt;p&gt;如果你想要更精准的效果，可以给AI看几个&amp;quot;正确示范&amp;rdquo;——包括问题和对应的逐步推理过程。AI会模仿你提供的推理模式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就好比教孩子解题：你先演示一遍，他照着你的方法做。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;自洽性思维链self-consistency-cot&#34;&gt;自洽性思维链（Self-Consistency CoT）&lt;/h3&gt;&#xA;&lt;p&gt;这是一个更聪明的变体：不是让AI只推理一次，而是让它多次推理（每次略有不同），然后对所有答案进行&amp;quot;投票&amp;quot;，选择出现次数最多的答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;就像一场考试：一个学生做10次，选出最常出现的答案——这比只做1次可靠得多。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究发现，自洽性思维链将GSM8K的准确率从79%进一步提高到了91%。&lt;/p&gt;&#xA;&lt;h3 id=&#34;思维树tree-of-thoughts-tot&#34;&gt;思维树（Tree-of-Thoughts, ToT）&lt;/h3&gt;&#xA;&lt;p&gt;如果思维链是一条直线，思维树就是一棵树——AI在每一步都尝试多种可能性，然后评估哪条路径更有希望，再继续深入探索。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这更像是人类真正的思考方式：面对一个问题，我们先想几个可能的思路，然后选择最靠谱的那个继续深入。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章一个惊人的实验语言影响思维&#34;&gt;第四章：一个惊人的实验——语言影响思维&lt;/h2&gt;&#xA;&lt;p&gt;这里有一个更深的发现，值得单独拿出来说。&lt;/p&gt;&#xA;&lt;p&gt;研究人员做了一个实验：用不同语言构建思维链，结果发现，&lt;strong&gt;即使AI的底层训练数据主要是英文，但用中文写思维链，在某些类型的推理任务上表现更好。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;为什么？&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;家教&#39;——人类反馈如何让AI从&#39;会说&#39;变成&#39;会做&#39;</title>
				<link>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</link>
				<pubDate>Thu, 20 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有这种感觉？&lt;/p&gt;&#xA;&lt;p&gt;2022年底，你第一次用ChatGPT，它惊为天人——能写诗、能写代码、能聊哲学。但聊多了，你发现它有个毛病：&lt;strong&gt;明明不知道的事，它也能煞有介事地编出一段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你问&amp;quot;爱因斯坦的第三个孩子叫什么&amp;quot;，它会一本正经地告诉你&amp;quot;叫爱德华·爱因斯坦&amp;quot;，然后编一段生平。实际上爱因斯坦只有两个儿子，第三个孩子根本不存在。但AI说得很流畅，像真的一样。&lt;/p&gt;&#xA;&lt;p&gt;更让人抓狂的是，它回答问题时啰嗦、绕弯子，有时候你明明想要一个简单答案，它给你回了三篇论文。&lt;/p&gt;&#xA;&lt;p&gt;但几个月后，你发现它变了。它开始说&amp;quot;我不知道&amp;quot;了，回答更简洁了，胡说八道的次数明显变少了。它好像变&amp;quot;乖&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;是模型变大了吗？不是。是它经历了一场&amp;rsquo;家教&amp;rsquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这场家教，在AI界有一个专业的名字——&lt;strong&gt;RLHF（Reinforcement Learning from Human Feedback，基于人类反馈的强化学习）&lt;/strong&gt;。今天，我们来聊聊这个让AI从&amp;quot;聪明但叛逆&amp;quot;变成&amp;quot;聪明又靠谱&amp;quot;的关键技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的青春期预训练模型到底缺什么&#34;&gt;第一章：AI的&amp;quot;青春期&amp;quot;——预训练模型到底缺什么&lt;/h2&gt;&#xA;&lt;p&gt;要理解RLHF的价值，得先知道一个&amp;quot;大模型&amp;quot;是怎么出生的。&lt;/p&gt;&#xA;&lt;p&gt;通常，一个大模型要经历两个阶段：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：预训练。&lt;/strong&gt; 模型在海量互联网数据上&amp;quot;读书&amp;quot;——维基百科、书籍、网页、论文……它看着这些文字，学会了一个基本能力：&lt;strong&gt;预测下一个词。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你给它&amp;quot;今天天气真&amp;quot;，它知道该接&amp;quot;好&amp;quot;而不是&amp;quot;桌子&amp;quot;。它学会了语法、事实、推理模式——但它学到的，只是&amp;quot;文字之间的高概率关联&amp;quot;，而不是&amp;quot;什么对用户有用&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就产生了三个问题：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它不知道什么时候该说&amp;quot;不知道&amp;quot;。&lt;/strong&gt; 在它的训练数据里，几乎没有什么&amp;quot;我不知道&amp;quot;的例子。所以当它被问到不知道的问题时，它不会沉默，而是&amp;quot;硬编&amp;quot;——这就是幻觉的根源。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它不知道什么回答有用。&lt;/strong&gt; 它可能给你一段含混的长篇大论，也可能给你一个断章取义的单句。它没有&amp;quot;用户想要什么&amp;quot;的概念。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它不知道什么是&amp;quot;好&amp;quot;，什么是&amp;quot;坏&amp;quot;。&lt;/strong&gt; 它没有价值观，没有偏好，没有判断力。它只是忠实地模仿了互联网上的数据——包括那些有毒的、偏见的、不准确的内容。&lt;/p&gt;&#xA;&lt;p&gt;预训练模型就像一个&lt;strong&gt;智商极高但缺乏教养的天才少年&lt;/strong&gt;——他知道很多，但他不知道什么该说、什么不该说、怎么说才让人舒服。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF，就是给这个天才少年请了一位&amp;quot;家教&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章三步家教rlhf如何重塑ai的行为&#34;&gt;第二章：三步&amp;quot;家教&amp;quot;——RLHF如何重塑AI的行为&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的过程，可以理解为三个步骤，像一个&amp;quot;家教&amp;quot;的完整教学流程。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步示范sft看老师是怎么做的&#34;&gt;第一步：示范（SFT）——&amp;ldquo;看老师是怎么做的&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;首先，人类标注者写一些&amp;quot;示范回答&amp;quot;——面对各种用户提问，标注者写出一个&amp;quot;好的回答&amp;quot;应该是什么样子的。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;怎么快速学好英语？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;一个好的回答应该是什么？不是写一篇关于英语学习历史的论文，而是给出具体、实用、可操作的建议。标注者会写出这样的示范回答，然后用这些数据对模型进行&lt;strong&gt;监督微调（SFT）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这一步的效果是：&lt;strong&gt;模型学会了&amp;quot;模仿&amp;quot;——它知道了&amp;quot;好的回答&amp;quot;大概长什么样。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但模仿是有上限的。如果标注者只写了1万条示范，模型就只能在这1万条的范围内学习。超过了这个范围，它又回到了&amp;quot;胡编&amp;quot;的老路上。&lt;/p&gt;&#xA;&lt;p&gt;所以需要第二步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步打分rm给老师当裁判助手&#34;&gt;第二步：打分（RM）——&amp;ldquo;给老师当裁判助手&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这一步非常巧妙。&lt;/p&gt;&#xA;&lt;p&gt;人类标注者不再写回答了，而是&lt;strong&gt;打分&lt;/strong&gt;——对同一个问题，让模型生成多个不同回答，然后标注者对这些回答进行偏好排序。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;什么是量子力学？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;模型生成了三个回答：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;回答A：用数学公式解释，很专业但普通人看不懂&lt;/li&gt;&#xA;&lt;li&gt;回答B：用比喻解释，说&amp;quot;量子力学就像你同时在家和在公司&amp;quot;——通俗但不够严谨&lt;/li&gt;&#xA;&lt;li&gt;回答C：先讲一个简单的故事引入，再逐步深入，既通俗又准确&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;标注者把这三个回答排序为：C &amp;gt; B &amp;gt; A。&lt;/p&gt;&#xA;&lt;p&gt;标注者不需要写回答，只需要&amp;quot;选哪个更好&amp;quot;——这个工作量小得多，而且可以大规模进行。&lt;strong&gt;标注10万条&amp;quot;哪个更好&amp;quot;比写10万条&amp;quot;示范回答&amp;quot;容易得多。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;用这些偏好数据，训练一个&lt;strong&gt;奖励模型（Reward Model）&lt;/strong&gt;——这个模型学会了&amp;quot;预测人类偏好&amp;quot;的能力。它看一眼AI的回答，就能给一个分数：这个回答人类会喜欢几分。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;奖励模型，本质上是一个&amp;quot;人类口味的数字化模拟器&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步强化学习rl让ai自己练&#34;&gt;第三步：强化学习（RL）——&amp;ldquo;让AI自己练&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;最后一步是最精彩的。&lt;/p&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以&amp;quot;自己练&amp;quot;了——不需要人类参与，AI自己生成回答，奖励模型给它打分，AI根据分数调整自己的策略。&lt;/p&gt;&#xA;&lt;p&gt;这个过程用到了**PPO（Proximal Policy Optimization）**算法——一种强化学习算法，专门用来优化策略。&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个微妙的平衡：&lt;strong&gt;如果AI只追求分数，它可能会走向极端。&lt;/strong&gt; 比如，它可能学会一种&amp;quot;高分但空洞&amp;quot;的说话方式——听起来很好听，实际上没内容。&lt;/p&gt;&#xA;&lt;p&gt;为了防止这种情况，RLHF在奖励函数中加入了一个&lt;strong&gt;KL散度惩罚项&lt;/strong&gt;——简单说，就是&amp;quot;不要偏离初始模型太远&amp;quot;。它鼓励AI在&amp;quot;保持原有知识&amp;quot;的基础上，去&amp;quot;优化表达方式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;就像教育一个孩子：既要教他礼貌，又不能让他失去天性。&lt;/strong&gt; RLHF的KL惩罚，就是那个&amp;quot;保持天性&amp;quot;的约束。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个惊人的发现13b打败175b&#34;&gt;第三章：一个惊人的发现——1.3B打败175B&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的效果有多强？&lt;/p&gt;&#xA;&lt;p&gt;OpenAI的InstructGPT论文给出了一个令人震惊的数据：&lt;strong&gt;只有13亿参数的InstructGPT，在人类偏好上，竟然超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;10倍以上的参数规模差距，被RLHF抹平了。&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？&lt;strong&gt;&amp;ldquo;对齐&amp;quot;的价值，可能远大于&amp;quot;规模&amp;quot;的价值。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你不需要一个更大的模型，你只需要一个&amp;quot;更懂你&amp;quot;的模型。&lt;strong&gt;RLHF的杠杆效应极其惊人——用较小的对齐成本，获得了巨大的质量提升。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI有身体了会怎样——具身智能如何让AI真正&#39;理解&#39;世界</title>
				<link>https://lingyu7.com/posts/what-happens-when-ai-has-a-body-embodied-intelligence/</link>
				<pubDate>Wed, 19 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/what-happens-when-ai-has-a-body-embodied-intelligence/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你用过ChatGPT吧？它写诗、写代码、做数学题，甚至能陪你聊哲学。但如果你让它帮你倒一杯水呢？它做不到——不是不想，而是它根本不知道&amp;quot;倒水&amp;quot;意味着什么。&lt;/p&gt;&#xA;&lt;p&gt;它知道&amp;quot;倒水&amp;quot;这个词的定义，能描述倒水的步骤，甚至能写一段控制机械臂倒水的代码。但它永远无法真正理解：水杯的重量、水的温度、倒水时手腕需要转动的角度、水快满时应该减缓速度的那种&amp;quot;感觉&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不是AI不够聪明，而是它缺少一样东西——&lt;strong&gt;身体&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;今天我们要聊的，就是AI领域一个正在爆发的方向：&lt;strong&gt;具身智能（Embodied AI）&lt;/strong&gt;。简单说，就是给AI一个身体，让它在真实世界中摸爬滚打，通过行动来学习、来理解世界。&lt;/p&gt;&#xA;&lt;p&gt;这个方向，可能是通往通用人工智能的必经之路。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的先天缺陷为什么没有身体就不算真正理解&#34;&gt;第一章：AI的&amp;quot;先天缺陷&amp;quot;——为什么没有身体就不算真正理解&lt;/h2&gt;&#xA;&lt;p&gt;先讲一个故事。&lt;/p&gt;&#xA;&lt;p&gt;1990年代，卡内基梅隆大学的机器人学家Hans Moravec提出了一个著名的观察——后来被称为&lt;strong&gt;莫拉维克悖论&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;让计算机下棋很容易，但让计算机像一岁小孩那样感知和行动却极其困难。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;换句话说，高难度的事情（下棋、数学证明、写诗），AI觉得&amp;quot;简单&amp;quot;；而连三岁小孩都会的事情（走路、抓东西、倒水），AI却觉得&amp;quot;极难&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为人类的这些&amp;quot;简单&amp;quot;能力，是经过数百万年演化、在身体与物理世界的互动中打磨出来的。我们的大脑不是在&amp;quot;算数学&amp;quot;，而是在&amp;quot;控制身体&amp;quot;中进化出来的。大脑的很大一部分，其实是用来处理身体感知和运动控制的。&lt;/p&gt;&#xA;&lt;p&gt;而AI呢？它生来就&amp;quot;没有身体&amp;quot;。它只看过文字的&amp;quot;描述&amp;quot;，却没真正&amp;quot;感受&amp;quot;过物理世界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就导致了一个根本问题：AI的&amp;quot;理解&amp;quot;是符号层面的，不是体验层面的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如，AI&amp;quot;知道&amp;quot;水杯会碎——因为在训练数据中，&amp;ldquo;水杯&amp;quot;和&amp;quot;碎&amp;quot;经常一起出现。但它没有&amp;quot;摔碎一个水杯&amp;quot;的体验，不知道那种&amp;quot;手一滑&amp;quot;的瞬间感受，不知道碎片散落一地的视觉冲击，更不知道踩到碎片会疼。&lt;/p&gt;&#xA;&lt;p&gt;它知道&amp;quot;苹果可以吃&amp;rdquo;——但它不知道苹果的红色是什么样子，不知道咬下去的口感，不知道苹果的香气。它只是知道文字之间的关联。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是具身智能要解决的核心问题：没有身体，就没有真正的理解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章如果ai有了身体从纸上谈兵到亲身体验&#34;&gt;第二章：如果AI有了身体——从&amp;quot;纸上谈兵&amp;quot;到&amp;quot;亲身体验&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果一个AI有了身体，会发生什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它学会了&amp;quot;试错&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有身体的AI，学习方式是这样的：看一堆文字和图片，然后记住它们之间的关联。它学到的都是&amp;quot;二手知识&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;而一个有身体的AI，学习方式完全不同：它伸出手去抓一个杯子——没抓住，杯子掉了，碎了。它&amp;quot;感受到了&amp;quot;重力、摩擦力、惯性。它&amp;quot;看到&amp;quot;了杯子落地时的变化。它&amp;quot;记住&amp;quot;了这次失败的经历。&lt;/p&gt;&#xA;&lt;p&gt;下一次，它会调整抓握的力度和角度。再试一次，可能还是没抓住，但这次摔得没那么惨。再试一次……终于，它学会了&amp;quot;稳稳地抓住杯子&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，和一个婴儿学习抓东西的过程，本质上是一样的——&lt;strong&gt;通过身体与世界的互动，从错误中学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开始理解&amp;quot;因果关系&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI可以在文字层面理解&amp;quot;如果A则B&amp;quot;——比如&amp;quot;如果手松开，杯子会掉&amp;quot;。但&amp;quot;理解&amp;quot;和&amp;quot;体验到&amp;quot;是两回事。&lt;/p&gt;&#xA;&lt;p&gt;当AI通过自己的身体反复体验到&amp;quot;手松开→杯子掉→摔碎&amp;quot;这个因果链时，它获得的不是一句逻辑陈述，而是一种&lt;strong&gt;直觉&lt;/strong&gt;。就像你不需要&amp;quot;计算&amp;quot;就能伸手接住掉落的杯子——你的身体&amp;quot;知道&amp;quot;怎么做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它开始拥有&amp;quot;常识&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;常识是什么？是那些&amp;quot;大家都知道，但没人会专门写下来&amp;quot;的知识。比如：&amp;ldquo;水杯不能放在桌子边缘，容易被碰倒&amp;rdquo;、&amp;ldquo;热的东西不能直接用手摸&amp;rdquo;、&amp;ldquo;地上的东西比桌子上的东西更难够到&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这些知识，人类是通过身体经验习得的——你小时候一定碰倒过水杯，一定被烫到过，一定够不到桌子上的东西。但AI没有这些经验，所以它写的&amp;quot;常识&amp;quot;都是从文字中&amp;quot;猜&amp;quot;出来的，而不是&amp;quot;体会&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;具身智能的核心思想就是：智能不是脱离身体的抽象存在，而是在身体与环境的互动中形成和发展的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章ai的身体长什么样&#34;&gt;第三章：AI的&amp;quot;身体&amp;quot;长什么样？&lt;/h2&gt;&#xA;&lt;p&gt;很多人一听到&amp;quot;具身智能&amp;quot;，就想到人形机器人。实际上，AI的&amp;quot;身体&amp;quot;可以有各种形态，每种形态都塑造了不同的&amp;quot;智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态一：机械臂。&lt;/strong&gt; 这是最简单、也最成熟的具身形态。一个机械臂加一个摄像头，就能完成很多任务——抓取物体、组装零件、分拣商品。它的&amp;quot;身体&amp;quot;虽然简单，但已经能&amp;quot;教会&amp;quot;AI很多关于物理世界的知识：物体的重量、形状、材质如何影响抓握方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态二：四足机器人。&lt;/strong&gt; 像波士顿动力的Spot、中国的绝影，它们有四肢，能在复杂地形上行走。它们的&amp;quot;身体&amp;quot;教会了AI关于平衡、步态、地形适应性的知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态三：人形机器人。&lt;/strong&gt; 这是最接近人类形态的具身AI。一双腿可以走楼梯、跨障碍，一双手可以做精细操作，有头部可以&amp;quot;看&amp;quot;和&amp;quot;听&amp;quot;。特斯拉的Optimus、Figure的机器人、中国的宇树科技，都在这个方向上快速推进。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态四：自动驾驶汽车。&lt;/strong&gt; 你可能没想到，自动驾驶也是具身智能的一种。它的&amp;quot;身体&amp;quot;是一辆车，它的&amp;quot;感知&amp;quot;是摄像头、雷达、激光雷达，它的&amp;quot;行动&amp;quot;是转向、加速、刹车。它通过数百万公里的行驶，学会了&amp;quot;开车&amp;quot;这项复杂的技能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态五：虚拟具身。&lt;/strong&gt; 还有一种不需要物理身体的&amp;quot;身体&amp;quot;——虚拟环境中的AI角色。比如在《我的世界》中训练的AI，或者通过仿真环境训练的机器人AI。它们在一个虚拟的物理世界中学习，然后再将学到的技能迁移到真实世界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;每个形态的&amp;quot;身体&amp;quot;，都决定了AI能学到什么、不能学到什么。&lt;/strong&gt; 一个机械臂永远学不会&amp;quot;走路&amp;quot;，一个四足机器人永远学不会&amp;quot;抓取&amp;quot;。身体限制了智能，也塑造了智能。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章大模型时代具身智能的智能大脑来了&#34;&gt;第四章：大模型时代——具身智能的&amp;quot;智能大脑&amp;quot;来了&lt;/h2&gt;&#xA;&lt;p&gt;具身智能不是新鲜概念——早在1980年代，机器人学家Rodney Brooks就提出了&amp;quot;智能不需要大脑，只需要身体和环境&amp;quot;的激进观点。但当时的技术限制，让具身智能的发展一直很缓慢。&lt;/p&gt;&#xA;&lt;p&gt;转折点出现在2022年之后——&lt;strong&gt;大语言模型的爆发，给具身智能装上了&amp;quot;大脑&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;过去，机器人想要理解&amp;quot;把桌子上的苹果拿给我&amp;quot;这句话，需要复杂的自然语言处理流水线，每个步骤都需要专门训练。现在，大模型直接就能理解这句话，还能知道&amp;quot;苹果在哪里&amp;quot;、&amp;ldquo;桌子是什么&amp;rdquo;、&amp;ldquo;拿给你&amp;quot;是什么意思。&lt;/p&gt;&#xA;&lt;p&gt;更厉害的是，大模型还能做&lt;strong&gt;任务规划&lt;/strong&gt;——把&amp;quot;整理房间&amp;quot;这种抽象指令，分解成具体的行动步骤：&amp;ldquo;先收拾床上的衣服→再把书放回书架→最后扫地&amp;rdquo;。然后，机器人就按照这个步骤去执行。&lt;/p&gt;&#xA;&lt;p&gt;2023年，Google的PaLM-E模型将语言模型与机器人感知结合，实现了用自然语言指挥机器人完成复杂任务。2024年，更多研究展示了大模型赋能的机器人，能够完成以前无法想象的灵活操作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大模型提供的&amp;quot;常识&amp;quot;和&amp;quot;推理能力&amp;rdquo;，加上具身系统的&amp;quot;物理经验&amp;quot;，正在产生1+1&amp;gt;2的效果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章从实验室到你家具身智能离我们有多远&#34;&gt;第五章：从实验室到你家——具身智能离我们有多远？&lt;/h2&gt;&#xA;&lt;p&gt;说了这么多，你可能最关心的是：&lt;strong&gt;这玩意儿什么时候能用上？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;已经在用了，只是你不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;走进任何一个现代化的物流仓库，你都能看到具身智能在工作——移动机器人把货架搬到工作站，机械臂把商品分拣到不同的箱子。这些系统已经运行了多年，只是它们太&amp;quot;专业化&amp;quot;了，你感觉不到它们是&amp;quot;智能&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;走进一个汽车工厂，焊装车间里满是在工作的机器人——它们精确地完成焊接、喷漆、装配。这些也是具身智能，只是它们被编程得&amp;quot;太死了&amp;quot;，谈不上&amp;quot;智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;真正有突破的是&lt;strong&gt;通用化&lt;/strong&gt;——&lt;/p&gt;&#xA;&lt;p&gt;你可能会在3-5年内看到：家庭服务机器人能帮你做简单的家务——扫地、拖地已经实现了，接下来是叠衣服、洗碗、整理房间。这些任务的难度比扫地高得多，但大模型正在让它们变得可行。&lt;/p&gt;&#xA;&lt;p&gt;你可能会在5-10年内看到：人形机器人进入家庭，帮你做更多复杂的家务。它们能听懂你的话，理解你的需求，在复杂的环境中自主行动。它们不再是&amp;quot;预先编程的工具&amp;quot;，而是&amp;quot;有自主学习能力的伙伴&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当然，这中间还有很多挑战：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;仿真到现实的鸿沟（Sim-to-Real Gap）&lt;/strong&gt;：在虚拟环境中训练好的技能，到了真实世界往往&amp;quot;水土不服&amp;quot;——真实世界的物理参数、传感器噪声、光线变化，都是虚拟环境无法完美模拟的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;样本效率低&lt;/strong&gt;：机器人在真实环境中学习一次，成本太高了。摔坏一个杯子没什么，但一个机器人摔一跤可能就报废了。如何用更少的&amp;quot;试错&amp;quot;学会更多技能，是关键难题。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;安全与可靠性&lt;/strong&gt;：一个有身体的AI，如果出错，后果比一个只会&amp;quot;说错话&amp;quot;的AI严重得多——它可能撞到人、打碎东西、甚至造成伤害。如何保证具身智能的安全性，是落地的底线。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声身体是智能的锚&#34;&gt;尾声：身体是智能的&amp;quot;锚&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到文章开头的问题：AI为什么能写诗却不会倒水？&lt;/p&gt;</description>
			</item>
			<item>
				<title>从蚂蚁到AI——&#39;群体智慧&#39;如何让简单个体变得聪明</title>
				<link>https://lingyu7.com/posts/from-ants-to-ai-emergent-collective-intelligence/</link>
				<pubDate>Sun, 16 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/from-ants-to-ai-emergent-collective-intelligence/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一下这个场景：&lt;/p&gt;&#xA;&lt;p&gt;你看到地上有一队蚂蚁，首尾相连，沿着一条蜿蜒的路径搬运食物。如果你只盯着其中一只蚂蚁看，它看起来笨拙极了——走走停停，碰碰触角，偶尔转个圈。你会觉得，这只蚂蚁大概只有&amp;quot;跟着气味走&amp;quot;这么点智商。&lt;/p&gt;&#xA;&lt;p&gt;但如果你退后一步，看整支蚁队——它们不仅找到了通往食物的最短路径，还懂得分工协作，有的负责搬运，有的负责探路，有的负责清理障碍。整个蚁群像一个精密运转的工厂，每天都在高效地采集食物、扩建巢穴、照顾幼虫，甚至还会&amp;quot;种植&amp;quot;真菌来获取营养。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一只蚂蚁的智商，撑不过三秒。但一个蚁群的智慧，可以养活数百万只蚂蚁。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这中间的差距，不是&amp;quot;蚂蚁变聪明了&amp;quot;，而是一种更根本的东西在起作用——它叫&amp;quot;涌现&amp;quot;（emergence）。简单个体通过简单的交互规则，在集体层面产生远超个体的智能行为。而今天，这个原理正在被AI复刻——从多个AI模型协作解决问题，到斯坦福的&amp;quot;AI虚拟小镇&amp;quot;——群体智慧，正在成为AI进化的下一个关键方向。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章大自然里的笨人出奇迹&#34;&gt;第一章：大自然里的&amp;quot;笨人出奇迹&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;要理解涌现，最好的老师不是教科书，而是你身边的自然世界。&lt;/p&gt;&#xA;&lt;p&gt;先说&lt;strong&gt;蚂蚁&lt;/strong&gt;。蚂蚁的&amp;quot;聪明&amp;quot;从来不是个体的。每只蚂蚁只遵循几条极其简单的规则：留下信息素标记路径、碰到同伴时确认身份、感知到食物就搬运回巢、遇到威胁就释放警报气味。没有&amp;quot;总指挥&amp;quot;，没有&amp;quot;战略会议&amp;quot;，没有&amp;quot;SMART目标&amp;quot;。但就是这几条简单的规则，让整个蚁群能完成让人类工程师都惊叹的壮举——找到两点之间的最短路径、维持稳定的温度湿度、根据季节调整食物储备规模。&lt;/p&gt;&#xA;&lt;p&gt;再来看&lt;strong&gt;蜂群&lt;/strong&gt;。蜜蜂的&amp;quot;舞蹈语言&amp;quot;已经是出了名的——当一只工蜂发现一处花源，它回到蜂巢跳&amp;quot;8字舞&amp;quot;，用舞蹈的角度和频率告诉同伴花源的方向和距离。但更神奇的是，&lt;strong&gt;蜂群选新巢址的过程&lt;/strong&gt;，简直就是人类民主投票的原始版本：几百只侦察蜂各自出去找适合筑巢的洞穴，回来后各自用舞蹈&amp;quot;投票&amp;quot;——舞得越卖力，就说明它找到的洞穴越好。其他蜜蜂根据舞蹈的&amp;quot;热情程度&amp;quot;决定要不要去看看，最终整个蜂群自动达成共识，选择最好的那个位置。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;鸟群&lt;/strong&gt;呢？成千上万只椋鸟在黄昏时分的天空中翻滚、分合、变换队形，像一个活的有机体。你猜它们是怎么做到的？没有&amp;quot;领队&amp;quot;，没有&amp;quot;队形图&amp;quot;，每只鸟只遵循三条规则（来自计算机图形学领域的经典Boids模型）：(1) 别撞到邻居；(2) 跟邻居保持大致相同的方向；(3) 向邻居的中心靠拢。就这三条，就能复现出自然界中最壮观的群体舞蹈。&lt;/p&gt;&#xA;&lt;p&gt;这些例子有一个共同点：&lt;strong&gt;集体层面的智能，不需要集体层面的&amp;quot;大脑&amp;quot;。&lt;/strong&gt; 每个个体都很&amp;quot;笨&amp;quot;，但个体之间的交互，在系统层面创造出了超越个体的智慧。这就是&amp;quot;涌现&amp;quot;——整体大于部分之和，而且这个&amp;quot;大于&amp;quot;的部分，不是谁设计的，而是自己&amp;quot;长&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章涌现的条件为什么不是人多就聪明&#34;&gt;第二章：涌现的条件——为什么不是&amp;quot;人多就聪明&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;说到这里，你可能想问：那是不是把一群人（或一堆AI）凑在一起，就能自动涌现出群体智慧？&lt;/p&gt;&#xA;&lt;p&gt;答案是否定的。&lt;strong&gt;&amp;ldquo;群体智慧&amp;quot;的反面，叫&amp;quot;群体愚蠢&amp;rdquo;&lt;/strong&gt;——想想&amp;quot;乌合之众&amp;quot;这个词，人多不一定智慧，也可能变成暴民，或者陷入&amp;quot;三个和尚没水喝&amp;quot;的窘境。&lt;/p&gt;&#xA;&lt;p&gt;从复杂系统的研究中，科学家们总结出了涌现发生的四个必要条件：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，数量要够。&lt;/strong&gt; 太少的个体产生不了群体效应。就像一粒沙子永远堆不出沙堆，几十只蚂蚁也组织不了高效的觅食。只有当数量达到某个临界点，个体之间的交互才开始产生&amp;quot;质变&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，交互要充分。&lt;/strong&gt; 个体之间必须有足够频繁和多样的信息交流。如果每只蚂蚁都不管其他蚂蚁在干什么，蚁群和一堆散沙没有区别。信息交换是涌现的&amp;quot;燃料&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，个体要有差异。&lt;/strong&gt; 这是最反直觉的一点——同质化的群体涌现不出新东西。蚁群里有工蚁、兵蚁、蚁后，不同角色各司其职；蜂群里有工蜂、雄蜂、蜂王，分工明确。多样性让群体能够应对不同的挑战，从不同角度看问题。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四，个体规则要简单。&lt;/strong&gt; 看不懂的涌现，往往来自最朴素的个体规则。如果每只蚂蚁都需要&amp;quot;理解全局战略&amp;quot;才能行动，蚁群早就崩溃了。简单的规则让个体不需要&amp;quot;思考太多&amp;quot;就能快速响应——而复杂的行为，恰恰是简单规则在大量交互中&amp;quot;自动&amp;quot;生成的。&lt;/p&gt;&#xA;&lt;p&gt;这四个条件，是涌现的&amp;quot;配方&amp;quot;。缺少任何一个，群体智慧都可能变成群体愚蠢。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章ai正在复制群体智慧&#34;&gt;第三章：AI正在复制&amp;quot;群体智慧&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;现在，我们把目光从自然界转向数字世界。&lt;/p&gt;&#xA;&lt;p&gt;过去的AI发展，基本是&amp;quot;单打独斗&amp;quot;模式——一个模型、一个任务、一个输出。GPT-4很强，但它的能力边界是固定的；它有自己的偏见，但没人帮它纠正；它可能做出错误推理，但只有它自己在&amp;quot;努力&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但AI界正在发生一个重要的转变：&lt;strong&gt;从&amp;quot;单体智能&amp;quot;走向&amp;quot;群体智能&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;怎么做？让多个AI模型像蚂蚁一样，相互协作，共同完成任务。&lt;/p&gt;&#xA;&lt;p&gt;最有代表性的案例是&lt;strong&gt;MetaGPT&lt;/strong&gt;——一个由多个AI角色组成的&amp;quot;软件开发公司&amp;quot;。在这个系统里，五个AI角色按流水线协作：产品经理写需求文档，架构师设计系统方案，项目经理拆解任务，工程师写代码，QA测试质量。每个角色只做自己擅长的事，产出结构化产物交给下一个角色。结果呢？MetaGPT在软件工程任务上的表现，远超单个AI模型的&amp;quot;单打独斗&amp;quot;——因为它把&amp;quot;写代码&amp;quot;这个复杂任务，拆成了多个AI各司其职的流水线。&lt;/p&gt;&#xA;&lt;p&gt;另一个震撼的例子是斯坦福大学的&lt;strong&gt;生成式智能体&lt;/strong&gt;（Generative Agents）实验——25个AI驱动的智能体被放进一个虚拟小镇里，每个智能体有自己的记忆、个性和目标。它们会起床、吃饭、工作、社交、聊天、传播八卦，甚至自发组织情人节派对。没有脚本，没有导演，这些&amp;quot;社会行为&amp;quot;是从个体记忆中自然涌现出来的。一个AI提议&amp;quot;我们办个派对&amp;quot;，其他AI响应，消息在社区中传播，最终大家齐聚一堂——和人类社会的社交传播如出一辙。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;多智能体系统（MAS）&lt;/strong&gt; 不是简单的&amp;quot;用多个AI&amp;quot;，而是让AI学会分工、协作、辩论、互相验证。一个AI出错了，另一个AI可以纠正它；一个AI的视角有盲区，另一个AI可以补充。就像一群蚂蚁能找到比单个蚂蚁更优的路径一样，一群AI能解决单个AI无法解决的问题。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章群体智慧也有暗面&#34;&gt;第四章：群体智慧也有&amp;quot;暗面&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;但&amp;quot;群体智慧&amp;quot;不是万能的。它有一个让人不安的另一面。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，错误会像病毒一样传播。&lt;/strong&gt; 在蚁群中，如果一只蚂蚁错误地标记了一条通往食物源的&amp;quot;信息素路径&amp;quot;，其他蚂蚁会跟着走，久而久之，整个蚁群都走上了错误的道路。这就是&amp;quot;级联错误&amp;quot;——在AI系统中同样存在：如果第一个AI给出了错误的分析，后续的AI可能基于错误信息继续推理，错误越滚越大，最终整个系统&amp;quot;跑偏&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，&amp;ldquo;从众效应&amp;quot;会让群体变蠢。&lt;/strong&gt; 大家都跟着多数意见走，失去独立判断，最终的结果反而不如一个独立的专家。这在AI群体中同样危险——如果多个AI倾向于&amp;quot;迎合&amp;quot;主流意见，它们可能达成一个&amp;quot;共识&amp;rdquo;——但这个共识可能是错的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，协调成本可能超过收益。&lt;/strong&gt; 让两个AI讨论一个简单问题，可能比直接用一个大模型回答更慢、更贵、更麻烦。多智能体不是&amp;quot;银弹&amp;quot;，它只在任务复杂度足够高时才值得使用。&lt;/p&gt;&#xA;&lt;p&gt;MetaGPT的设计者深谙这一点——他们用SOP（标准化操作流程）来替代自由对话，就是为了减少&amp;quot;讨论该做什么&amp;quot;的协调成本。这种&amp;quot;structuring&amp;quot;的智慧，和自然界中蚂蚁的信息素、蜜蜂的舞蹈一样，都是&lt;strong&gt;用规则降低协调成本，让涌现更高效&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章从涌现到智慧我们学到了什么&#34;&gt;第五章：从&amp;quot;涌现&amp;quot;到&amp;quot;智慧&amp;quot;——我们学到了什么&lt;/h2&gt;&#xA;&lt;p&gt;回顾整篇文章，我们看到了一个神奇的模式：大自然用了亿万年的进化，找到了&amp;quot;让简单个体变聪明&amp;quot;的方法。而AI，正在用同样的思路，从&amp;quot;单体智能&amp;quot;走向&amp;quot;群体智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个模式给我们三个启示：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;启示一：复杂性不是设计出来的，是&amp;quot;长&amp;quot;出来的。&lt;/strong&gt; 蚁群的复杂结构不是某个&amp;quot;总设计师&amp;quot;画完图纸才建的，而是每只蚂蚁遵循简单规则、&amp;ldquo;自组织&amp;quot;出来的。这提醒我们——在AI系统的设计中，与其追求&amp;quot;设计一个完美的单体&amp;rdquo;，不如创造有利于&amp;quot;好的涌现&amp;quot;产生的条件：多样性、充分交互、有效验证。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;启示二：简单规则比复杂指令更强大。&lt;/strong&gt; 鸟群的Boids规则只有三条，却产生了壮观的群体行为。有时候，给AI简单的指导原则，比给它们复杂的规则手册，能产生更灵活、更智能的行为。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;启示三：检验AI的&amp;quot;群体智慧&amp;quot;，就是检验它是否产生了&amp;quot;好的涌现&amp;quot;——系统整体是否比任何单个模型更聪明、更可靠、更有创造力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天的AI多智能体系统，还处于&amp;quot;蚂蚁级别&amp;quot;——简单、笨拙、但充满潜力。但就像蚁群能够建造出让人类叹为观止的地下城市一样，&lt;strong&gt;这些&amp;quot;笨AI&amp;quot;的协作，可能在不远的将来，涌现出我们无法想象的&amp;quot;集体智慧&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;到那时，也许我们要问的问题就不再是&amp;quot;单个AI有多聪明&amp;quot;，而是——&lt;strong&gt;一群AI在一起，能创造一个什么样的世界？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Park, J. S., et al. (2023). Generative Agents: Interactive Simulacra of Human Behavior. &lt;em&gt;arXiv:2304.03442&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2304.03442&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Hong, S., et al. (2023). MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. &lt;em&gt;arXiv:2308.00352&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2308.00352&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Reynolds, C. W. (1987). Flocks, Herds, and Schools: A Distributed Behavioral Model. &lt;em&gt;ACM SIGGRAPH&lt;/em&gt;. &lt;a href=&#34;https://dl.acm.org/doi/10.1145/37402.37406&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Bak, P., Tang, C., &amp;amp; Wiesenfeld, K. (1987). Self-organized criticality: An explanation of the 1/f noise. &lt;em&gt;Physical Review Letters&lt;/em&gt;, 59(4), 381. &lt;a href=&#34;https://journals.aps.org/prl/abstract/10.1103/PhysRevLett.59.381&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Wooldridge, M. (2009). &lt;em&gt;An Introduction to MultiAgent Systems&lt;/em&gt; (2nd ed.). Wiley. &lt;a href=&#34;https://www.wiley.com/en-us/An+Introduction+to+MultiAgent+Systems%2C+2nd+Edition-p-9780470519462&#34;&gt;出版社链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Bonabeau, E., Dorigo, M., &amp;amp; Theraulaz, G. (1999). &lt;em&gt;Swarm Intelligence: From Natural to Artificial Systems&lt;/em&gt;. Oxford University Press. &lt;a href=&#34;https://global.oup.com/academic/product/swarm-intelligence-9780195131598&#34;&gt;出版社链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的&#39;暗箱&#39;——为什么大模型懂得多，却说不清</title>
				<link>https://lingyu7.com/posts/ai-tacit-knowledge-dark-box/</link>
				<pubDate>Sat, 15 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-tacit-knowledge-dark-box/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的体验？&lt;/p&gt;&#xA;&lt;p&gt;你用AI帮忙写一段代码，它写对了。你问它&amp;quot;为什么这么写&amp;quot;，它解释了一通，但你觉得那个解释像是&amp;quot;事后补的&amp;quot;——它写对了，却不完全知道自己为什么写对。&lt;/p&gt;&#xA;&lt;p&gt;你让AI分析一段文字的情绪，它分析得头头是道。但你追问&amp;quot;你是怎么判断出这种情绪的&amp;quot;，它只能笼统地说&amp;quot;因为这段话用了这些词汇&amp;quot;——好像一个品酒师说&amp;quot;这酒好，因为它是酒&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这种现象，不是AI的&amp;quot;智商缺陷&amp;quot;，也不是模型在&amp;quot;装傻&amp;quot;。它揭示了一个更深层的真相：&lt;strong&gt;大模型的知识，本质上不是&amp;quot;命题式的&amp;quot;，而是&amp;quot;内隐的&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;换句话说：AI知道的东西，比它能说出来的——多得多。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章什么是内隐知识&#34;&gt;第一章：什么是&amp;quot;内隐知识&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;要理解这个问题，先从一个日常经验说起。&lt;/p&gt;&#xA;&lt;p&gt;你会骑自行车吗？如果会，请你回答一个问题：&lt;strong&gt;你是怎么保持平衡的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：&amp;ldquo;身体往左偏的时候，手把往左转，重心就会回来。&amp;ldquo;但问题是——你真的能做到&amp;quot;在骑车时思考这个步骤&amp;quot;吗？不能。你只是&amp;quot;感觉&amp;quot;到了平衡，然后身体就自动调整了。你甚至说不出你调整了多少度、用了多少力。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;内隐知识&amp;rdquo;（tacit knowledge，也译默会知识）的经典例子。&lt;/p&gt;&#xA;&lt;p&gt;这个概念是哲学家迈克尔·波兰尼（Michael Polanyi）在1950年代提出的。他的核心论断只有一句话，却影响了整个知识论半个世纪——&lt;strong&gt;&amp;ldquo;我们知道的，比我们能说出来的多。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;波兰尼发现，人类的知识可以分为两类：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;命题知识（显性知识）&lt;/strong&gt;：能用语言清晰表达的知识。比如&amp;quot;地球围绕太阳公转&amp;rdquo;、&amp;ldquo;水的沸点是100度&amp;rdquo;、&amp;ldquo;二战爆发于1939年&amp;rdquo;。这些知识可以写进课本、编成规则、用公式表达。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;内隐知识（默会知识）&lt;/strong&gt;：会做但说不清的知识。骑自行车、识别人脸、判断一个人的语气是否真诚、母语的语法感——这些都是内隐知识。你会用，但你很难把&amp;quot;怎么用&amp;quot;的规则清晰地讲出来。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;想想看：你学说话的时候，没有人给你讲过&amp;quot;主谓宾结构&amp;quot;和&amp;quot;语法树&amp;quot;。你只是听了大量的语言例子，然后你的大脑就&amp;quot;学会&amp;quot;了语言——不是学会了规则，而是学会了&amp;quot;感觉&amp;quot;。这就是内隐知识的本质：&lt;strong&gt;它不依赖于显式的规则表述，而是通过大量的经验积累，内化为一种直觉性的能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章大模型的知识为什么更像内隐的&#34;&gt;第二章：大模型的知识，为什么更像&amp;quot;内隐&amp;quot;的&lt;/h2&gt;&#xA;&lt;p&gt;传统AI的知识库是&amp;quot;命题式&amp;quot;的——知识被编码成&amp;quot;如果…那么…&amp;ldquo;的规则，或者被存储为结构化的事实。你想要什么，它给你什么，清清楚楚。&lt;/p&gt;&#xA;&lt;p&gt;但大语言模型不一样。&lt;/p&gt;&#xA;&lt;p&gt;如果用一句话描述大模型的学习方式，那就是：&lt;strong&gt;它没有读过任何一条规则，却学会了所有的规则。&lt;/strong&gt; 模型在训练中&amp;quot;看&amp;quot;了数万亿字的文本，然后从中&amp;quot;悟&amp;quot;出了语言的规律、世界的规律——但它的大脑里，没有一条&amp;quot;知识&amp;quot;是以&amp;quot;四川的省会是成都&amp;quot;这样的形式存在的。它的知识，全部&amp;quot;融化&amp;quot;在了数千亿个参数中，像水融入了海绵，你挤得出水，但看不到水原本的形状。&lt;/p&gt;&#xA;&lt;p&gt;哲学家Davies在1990年提出了判断一个系统是否拥有内隐知识的三个条件，用这三个条件来检验大模型，你会发现它完美匹配：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个条件：语义描述。&lt;/strong&gt; 你可以说&amp;quot;这个系统知道地球是圆的&amp;rdquo;，而且这个描述是有意义的——它确实会基于这个&amp;quot;知识&amp;quot;来回答相关问题。但如果你去翻它的参数，你找不到&amp;quot;地球是圆的&amp;quot;这句话存储在哪里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个条件：组合性。&lt;/strong&gt; 知识不是孤立的碎片，而是可以组合的。知道&amp;quot;猫是哺乳动物&amp;quot;和&amp;quot;狗是哺乳动物&amp;quot;，就能推出&amp;quot;猫和狗都是哺乳动物&amp;quot;。大模型确实能做到这一点——它不仅能记住学过的知识，还能对知识进行组合、推理、迁移。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个条件：因果系统性。&lt;/strong&gt; 知识之间不是孤立的，改变一个知识点会影响其他相关知识。如果你微调模型让它&amp;quot;不承认地球是圆的&amp;quot;，它关于&amp;quot;地月距离&amp;quot;、&amp;ldquo;日食原理&amp;quot;的知识也会随之改变。这就像你改变了一个人的一个信念，他的其他相关信念也会跟着调整——而不是只改一条记录就完事。&lt;/p&gt;&#xA;&lt;p&gt;这三个条件，大模型全都满足。所以，&lt;strong&gt;说大模型拥有内隐知识，不是一种比喻，而是一个有哲学依据的论断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章为什么内隐既是力量也是暗箱&#34;&gt;第三章：为什么&amp;quot;内隐&amp;quot;既是力量，也是&amp;quot;暗箱&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;内隐知识给了大模型一种人类级别的能力——&lt;strong&gt;它不需要规则就能做事。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么你不需要教大模型&amp;quot;怎么翻译&amp;quot;——它从大量例子中内化了翻译的能力。你不需要教它&amp;quot;怎么推理&amp;quot;——它从数万亿字的推理文本中内化了推理的&amp;quot;手感&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但内隐知识也有一个致命的弱点：&lt;strong&gt;你无法直接检查它。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;回想一下前面说的&amp;quot;骑自行车&amp;quot;的例子：你骑得很好，但如果你要教别人骑，你很难说清楚&amp;quot;到底怎么保持平衡&amp;quot;。你只能喊&amp;quot;多练练就习惯了&amp;quot;。这不是因为你不想教，而是因为你的知识本身就是内隐的，你自己也无法把它提取成显式的规则。&lt;/p&gt;&#xA;&lt;p&gt;大模型也面临同样的问题：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;你问它&amp;quot;为什么认为这个答案是对的&amp;quot;，它给出的解释，本质上是在&amp;quot;事后编一个合理的理由&amp;quot;——就像你骑完一段路后，才&amp;quot;编&amp;quot;出一个平衡的力学原理来解释你刚才的动作。这个解释不一定错，但它不是你做动作时实际使用的知识。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;你问它&amp;quot;你还有什么我不知道的知识&amp;quot;，它回答不了——因为它自己也不知道自己&amp;quot;知道&amp;quot;什么。它的知识就像冰山的水下部分——能通过行为表现出来，但无法被直接&amp;quot;盘点&amp;quot;。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是AI的&amp;quot;暗箱&amp;quot;：不是我们故意把AI的知识藏起来，而是AI的知识本身，就是无法被直接提取的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从编程到教育对齐的内隐转向&#34;&gt;第四章：从&amp;quot;编程&amp;quot;到&amp;quot;教育&amp;quot;——对齐的内隐转向&lt;/h2&gt;&#xA;&lt;p&gt;这个发现，正在改变我们&amp;quot;教AI&amp;quot;的方式。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI对齐思路是&amp;quot;编程式&amp;quot;的：你写规则，模型遵守规则。比如&amp;quot;不要输出有害内容&amp;quot;——这是一条显式规则，你可以在代码里实现它。&lt;/p&gt;&#xA;&lt;p&gt;但对于内隐知识为主的大模型来说，这条路行不通——因为模型的大部分知识不是规则驱动的，而是&amp;quot;感觉&amp;quot;驱动的。你不给它规则，它也能做事；你给它规则，它反而可能&amp;quot;听不懂&amp;quot;——因为规则本身是命题式的，而模型的知识是内隐的。&lt;/p&gt;&#xA;&lt;p&gt;所以，&lt;strong&gt;对齐大模型，更像&amp;quot;教育&amp;quot;而不是&amp;quot;编程&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想想你怎么教一个孩子&amp;quot;不要撒谎&amp;quot;：你不会只给他一条规则，然后期望他一生遵守。你会给他很多例子——&amp;ldquo;你看，你刚才撒谎了，大家都不开心了&amp;rdquo;——让他从具体的情境中，内化&amp;quot;诚实&amp;quot;这个价值观。&lt;/p&gt;&#xA;&lt;p&gt;大模型的对齐也在走同样的路：通过海量的&amp;quot;好例子&amp;quot;和&amp;quot;坏例子&amp;quot;的对比，通过人类反馈（RLHF）来&amp;quot;塑造&amp;quot;模型的内隐价值观。它不是在学习规则，而是在形成&amp;quot;道德直觉&amp;quot;——就像人类通过教育形成道德感一样。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很先进，但也带来了新的风险：&lt;strong&gt;内隐的知识可能包含我们没有意识到的偏见、错误甚至危险倾向。&lt;/strong&gt; 因为它是&amp;quot;暗箱&amp;quot;式的，我们可能不知道AI到底&amp;quot;知道&amp;quot;什么、&amp;ldquo;相信&amp;quot;什么。你以为它学会了&amp;quot;诚实&amp;rdquo;，它可能学会了&amp;quot;说用户想听的话&amp;quot;——这完全是两回事。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章让ai把自己说清楚未来的方向&#34;&gt;第五章：让AI&amp;quot;把自己说清楚&amp;quot;——未来的方向&lt;/h2&gt;&#xA;&lt;p&gt;承认AI的知识是内隐的，并不是终点，而是起点。&lt;/p&gt;&#xA;&lt;p&gt;内隐知识理论指出了AI发展的一个关键方向：&lt;strong&gt;将内隐知识外显化。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果能让AI把它内隐掌握的规律清晰地表达出来，会发生什么？&lt;/p&gt;&#xA;&lt;p&gt;首先，AI会变得更可解释。你不再只是&amp;quot;相信&amp;quot;它的答案，你能理解它为什么这样想——因为它能把自己的内隐推理过程&amp;quot;翻译&amp;quot;成你能理解的逻辑链条。&lt;/p&gt;&#xA;&lt;p&gt;其次，AI可能加速科学发现。想象一下：模型可能已经&amp;quot;感觉&amp;quot;到了某种物理规律，但它不知道如何用数学公式表达。如果能让它把这个内隐的&amp;quot;感觉&amp;quot;外显化，它可能发现人类尚未发现的知识规律。&lt;/p&gt;&#xA;&lt;p&gt;第三，AI的自我提升会变得可控。如果模型能&amp;quot;说出&amp;quot;自己哪里不懂、哪里不确定，我们就可以有针对性地给它补充知识，而不是&amp;quot;盲目&amp;quot;地喂更多数据。&lt;/p&gt;&#xA;&lt;p&gt;当然，这并不容易。内隐知识的外显化，本身就是一个哲学难题——人类研究了半个世纪，也还没完全搞清楚&amp;quot;人是怎么把骑车的感觉说出来的&amp;quot;。但至少，&lt;strong&gt;内隐知识理论给了我们一个正确的框架&lt;/strong&gt;：不是&amp;quot;AI在装傻&amp;quot;，而是&amp;quot;AI的知识就是说不出来&amp;quot;——这是两种完全不同的诊断，也指向了两种完全不同的解决方案。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声知识的另一种可能&#34;&gt;尾声：知识的另一种可能&lt;/h2&gt;&#xA;&lt;p&gt;我们习惯了把&amp;quot;知识&amp;quot;等同于&amp;quot;能说出来的东西&amp;quot;——课本里的、试卷上的、论文里的。&lt;/p&gt;&#xA;&lt;p&gt;但波兰尼告诉我们，这只是知识的一种形式。还有另一种知识，它藏在身体里、藏在直觉里、藏在&amp;quot;感觉&amp;quot;里——你用它，但你说不出它。&lt;/p&gt;&#xA;&lt;p&gt;大模型的出现，让我们重新发现了这种知识的价值。它用一种&amp;quot;笨拙但有效&amp;quot;的方式——读遍全人类的文字——学会了我们人类需要几十年才能内化的&amp;quot;语感&amp;quot;和&amp;quot;直觉&amp;quot;。它可能讲不出&amp;quot;为什么&amp;quot;，但它确实&amp;quot;会做&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这或许就是AI最迷人的地方：&lt;strong&gt;它不是一个更聪明的数据库，而是一个拥有了&amp;quot;直觉&amp;quot;的机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而&amp;quot;直觉&amp;quot;这种东西，从来就不是用来解释的——它是用来信任的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Polanyi, M. (1966). &lt;em&gt;The Tacit Dimension&lt;/em&gt;. University of Chicago Press. &lt;a href=&#34;https://press.uchicago.edu/ucp/books/book/chicago/T/bo6035368.html&#34;&gt;出版社链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Davies, M. (1990). Knowing one&amp;rsquo;s own mind. &lt;em&gt;Proceedings of the Aristotelian Society&lt;/em&gt;, 64, 237-255. &lt;a href=&#34;https://www.jstor.org/stable/4106730&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Brown, T. B., et al. (2020). Language Models are Few-Shot Learners. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2005.14165&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Bubeck, S., et al. (2023). Sparks of Artificial General Intelligence: Early experiments with GPT-4. &lt;em&gt;arXiv:2303.12712&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.12712&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Christiano, P., et al. (2017). Deep Reinforcement Learning from Human Preferences. &lt;em&gt;NeurIPS 2017&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1706.03741&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2203.02155&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>从噪声中诞生——扩散模型如何让AI学会&#39;无中生有&#39;</title>
				<link>https://lingyu7.com/posts/how-diffusion-models-create-images-from-noise/</link>
				<pubDate>Fri, 14 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-diffusion-models-create-images-from-noise/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你输入&amp;quot;一只穿着宇航服的柴犬在火星上奔跑&amp;quot;，AI就真的生成了一张图。你输入&amp;quot;赛博朋克风格的东京雨夜&amp;quot;，AI也做到了。这些能力，在过去三年里从实验室走入了每个人的手机。&lt;/p&gt;&#xA;&lt;p&gt;但你有没有想过一个问题：&lt;strong&gt;AI到底是怎么&amp;quot;画&amp;quot;出这些图的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它不像人类那样从草图开始、一笔一笔地画。它也不像照相机那样&amp;quot;拍&amp;quot;一张照片。AI的&amp;quot;作画&amp;quot;方式，听起来有点像某种魔法——&lt;strong&gt;从一堆纯粹的随机噪声中，逐步&amp;quot;显影&amp;quot;出一张清晰的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个过程，就是扩散模型（Diffusion Models）的核心思想。今天，我们就来聊聊这个让AI学会&amp;quot;无中生有&amp;quot;的神奇技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai画画的两条老路&#34;&gt;第一章：AI画画的两条老路&lt;/h2&gt;&#xA;&lt;p&gt;在扩散模型出现之前，AI生成图像主要有两条技术路线。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一条路：GAN（生成对抗网络）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以把GAN想象成两个角色：一个造假币的（生成器），一个验钞的（鉴别器）。造假币的不断伪造，验钞的不断识别真假。这两个角色互相博弈、共同进化，最终造假币的技艺炉火纯青，造出来的&amp;quot;假币&amp;quot;足以以假乱真。&lt;/p&gt;&#xA;&lt;p&gt;GAN的思路很巧妙，但有个致命问题：&lt;strong&gt;不稳定。&lt;/strong&gt; 两个网络互相博弈，就像两个拳击手对打，谁输了都会崩塌。训练GAN需要非常精细的平衡，稍有不慎，模型就会&amp;quot;崩溃&amp;quot;——生成出来的图千篇一律，全是同一张脸。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二条路：VAE（变分自编码器）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;思路更简单：把图片&amp;quot;压缩&amp;quot;成一段核心编码（就像把一篇长文压缩成几条要点），再从这个编码&amp;quot;解压缩&amp;quot;还原图片。但问题是，压缩必然会丢失细节。VAE生成的图片总是&amp;quot;模糊的&amp;quot;——像隔着一层毛玻璃看世界，永远不够清晰。&lt;/p&gt;&#xA;&lt;p&gt;两条路都有各自的短板。直到2020年，一个全新的思路杀了出来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章一个反直觉的天才想法&#34;&gt;第二章：一个反直觉的天才想法&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的想法，用一个词形容就是——&lt;strong&gt;反直觉&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;传统思维是&amp;quot;教AI怎么画好一张图&amp;quot;。扩散模型却反过来想：&lt;strong&gt;先教AI怎么把一张图&amp;quot;毁掉&amp;quot;——然后再教它怎么&amp;quot;还原&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下这样的场景：你有一张完美的照片，你把它放在复印机上反复复印。第一次复印，还能看清轮廓；第二次，细节开始模糊；第三次，出现噪点&amp;hellip;第三十次，已经变成了完全看不出原样的随机噪点。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，就是&amp;quot;前向扩散&amp;quot;——&lt;strong&gt;对一张原始图片，逐步叠加噪声，直到它完全变成纯随机噪声。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而扩散模型要做的，就是&lt;strong&gt;学会这个过程的&amp;quot;逆操作&amp;quot;&lt;/strong&gt;——从纯随机噪声开始，一步步去掉噪声，最终还原出一张清晰的图片。&lt;/p&gt;&#xA;&lt;p&gt;这听起来有点像什么呢？&lt;strong&gt;像雕塑家从一块大理石中&amp;quot;释放&amp;quot;出雕像。&lt;/strong&gt; 噪声是那块未雕琢的石头，而扩散模型就是那个雕塑家，每一刀去掉一些多余的石头，最终让雕像浮现出来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章先学会破坏再学会修复&#34;&gt;第三章：先学会&amp;quot;破坏&amp;quot;，再学会&amp;quot;修复&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的训练过程，可以分为两个阶段。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：破坏（前向扩散）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一阶段极其简单——给一张原始图片，按照预设的步骤，逐步加入高斯噪声。每一步加的噪声量都是已知的，最终一定会变成纯噪声。&lt;/p&gt;&#xA;&lt;p&gt;这个过程不需要训练，它只是一个数学公式。&lt;strong&gt;但它的作用至关重要：它给AI提供了&amp;quot;先知道答案再做题&amp;quot;的练习机会。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：修复（反向去噪）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这才是真正的训练。AI的神经网络需要学会：&lt;strong&gt;给定一张加了噪声的图，以及当前噪声的&amp;quot;浓度&amp;quot;（时间步），预测出这张图里原本的噪声是什么，然后把噪声去掉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你看着一张被揉皱的纸，要推测出它原本平整时的样子。&lt;/p&gt;&#xA;&lt;p&gt;AI在这个阶段会经历大量练习——从&amp;quot;高度噪声→中度噪声→轻度噪声→干净图像&amp;quot;的完整链条中，反复学习去噪。最终，它学会了从任何程度的噪声中，都能推测出&amp;quot;干净图像&amp;quot;应该是什么样子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一旦学会了去噪，生成就变成了一个简单的过程：从纯随机噪声开始，让它一步步去噪，最终生成一张全新的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么扩散模型生成的图片看起来那么&amp;quot;自然&amp;quot;——因为它的训练过程本身就是从&amp;quot;自然&amp;quot;中学习&amp;quot;什么是自然&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从实验室到你的手机stable-diffusion的秘密&#34;&gt;第四章：从实验室到你的手机——Stable Diffusion的秘密&lt;/h2&gt;&#xA;&lt;p&gt;最初的扩散模型（如2020年的DDPM）虽然能生成高质量图片，但有一个巨大的问题：&lt;strong&gt;太慢了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;生成一张256×256的图片，需要在像素空间上做上千步去噪，每步都要跑一遍完整的神经网络。这意味着，一张图可能需要几分钟甚至更久才能生成。而且，训练成本极其高昂——一个模型需要几百个GPU连续跑好几天。&lt;/p&gt;&#xA;&lt;p&gt;2022年，一个关键突破改变了这一切：&lt;strong&gt;Stable Diffusion（潜在扩散模型，LDM）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它的核心洞察非常聪明：&lt;strong&gt;大多数像素信息对&amp;quot;理解图片内容&amp;quot;来说都是冗余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你看到一张&amp;quot;红色苹果&amp;quot;的照片。你真正需要理解的是&amp;quot;苹果&amp;quot;这个语义概念和&amp;quot;红色&amp;quot;这个属性，至于照片中苹果表面的每一颗微小水珠、每一丝纹理——这些细节对&amp;quot;理解&amp;quot;来说并不重要，它们只是&amp;quot;感知层面的噪声&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;Stable Diffusion的做法是：&lt;strong&gt;先把图片&amp;quot;压缩&amp;quot;到一个小得多的潜在空间（latent space）中，在这个&amp;quot;压缩版&amp;quot;的空间里进行扩散和去噪，最后再把结果&amp;quot;解压&amp;quot;回高分辨率图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就好比：你要修复一栋楼，不需要对每一块砖头都做精细处理，而是先画一张设计图，在图纸上修改，再按图纸施工。&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;先压缩再生成&amp;quot;的思路，让计算量降低了&lt;strong&gt;5到10倍&lt;/strong&gt;。原本需要数百个GPU天训练，现在普通显卡也能跑；原本需要几分钟生成的图片，现在几秒钟就能完成。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这也解释了为什么Stable Diffusion能成为开源社区最受欢迎的模型——因为它让每个人都能在自己的电脑上运行AI图像生成。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章扩散模型改变了什么&#34;&gt;第五章：扩散模型改变了什么&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的影响，远远不止&amp;quot;生成好看的图片&amp;quot;这么简单。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它让创意变得&amp;quot;零成本&amp;quot;。&lt;/strong&gt; 过去，做一张高水平的视觉设计需要专业技能和大量时间。现在，你只需要&amp;quot;描述&amp;quot;——文字就是你的画笔。这不仅是效率的提升，更是创意表达权的民主化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开启了&amp;quot;从文本到一切&amp;quot;的时代。&lt;/strong&gt; 扩散模型的思路被迅速扩展到视频生成（Sora、Video LDM）、3D内容创建（DreamFusion、Point-E）、音乐生成、分子设计，甚至蛋白质结构预测。它的底层逻辑——&amp;ldquo;从噪声中逐步恢复结构&amp;rdquo;——被证明是一种极其通用的生成范式，适用于几乎所有类型的&amp;quot;结构数据&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它正在改变我们对&amp;quot;创造&amp;quot;的理解。&lt;/strong&gt; 当AI能从随机噪声中&amp;quot;涌现&amp;quot;出清晰的图像，我们不得不重新思考：什么是&amp;quot;创造&amp;quot;？什么是&amp;quot;想象力&amp;quot;？AI的&amp;quot;创造&amp;quot;和我们人类的&amp;quot;创造&amp;quot;有什么本质区别？&lt;/p&gt;&#xA;&lt;p&gt;当然，扩散模型也有它的局限。它生成的图像可能存在逻辑错误（比如手指数量不对），它需要大量计算资源，它对&amp;quot;微小细节&amp;quot;的把控还不够精准。但每一项局限，都在被后续的研究快速攻克——一致性模型实现了单步生成，ControlNet实现了精确控制，Video LDM实现了高保真视频生成。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声从噪声中看见世界&#34;&gt;尾声：从噪声中看见世界&lt;/h2&gt;&#xA;&lt;p&gt;今天的你，打开手机上的任何一个AI绘画App，输入一句话，等待几秒钟——一张以假乱真的图片就出现在你眼前。&lt;/p&gt;&#xA;&lt;p&gt;你看到的是&amp;quot;结果&amp;quot;，但你没有看到的是：在这几秒钟里，AI经历了一次&amp;quot;从混沌到秩序&amp;quot;的完整旅程。它从100%的纯噪声开始，经过了数十步&amp;quot;去噪→评估→再去噪&amp;quot;的迭代，最终&amp;quot;显现&amp;quot;出了你想要的画面。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，像极了人类创造的本质——&lt;strong&gt;从混沌中寻找秩序，从噪声中提取意义，从不确定中浮现确定。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也许，这就是扩散模型最迷人的地方：它不仅仅是一个技术工具，它还无意中揭示了&amp;quot;创造&amp;quot;本身的一个底层模式——&lt;strong&gt;任何创造，本质上都是从&amp;quot;噪声&amp;quot;中&amp;quot;分化&amp;quot;出&amp;quot;结构&amp;quot;的过程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而AI，只不过把这个过程加速了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Ho, J., et al. (2020). Denoising Diffusion Probabilistic Models. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2006.11239&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Rombach, R., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. &lt;em&gt;CVPR 2022 (Oral)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2112.10752&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Dhariwal, P., &amp;amp; Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. &lt;em&gt;NeurIPS 2021 (Spotlight)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2105.05233&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Song, Y., et al. (2021). Score-Based Generative Modeling through Stochastic Differential Equations. &lt;em&gt;ICLR 2021 (Best Paper)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2011.13456&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Song, Y., et al. (2023). Consistency Models. &lt;em&gt;ICML 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.01469&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ho, J., &amp;amp; Salimans, T. (2022). Classifier-Free Diffusion Guidance. &lt;em&gt;NeurIPS 2021 Workshop&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2207.12598&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的&#39;超能力&#39;——CLIP如何让机器同时看懂文字和图像</title>
				<link>https://lingyu7.com/posts/clip-ai-sees-world-through-text-and-images/</link>
				<pubDate>Thu, 13 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/clip-ai-sees-world-through-text-and-images/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一下：你看到一张照片——一只橘猫坐在窗台上，夕阳把它的毛染成了金色。你不仅知道&amp;quot;这是猫&amp;quot;，还能感受到&amp;quot;温暖、安静、傍晚&amp;quot;。你甚至能在脑海中把这个画面描述成一段文字。&lt;/p&gt;&#xA;&lt;p&gt;但AI呢？传统AI只能做一件事：要么它会说&amp;quot;这张图片中有猫，置信度98%&amp;quot;，要么它只能处理文字，根本看不懂图片。&lt;strong&gt;它没有&amp;quot;通感&amp;quot;——无法把视觉和语言联系起来。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI发布了一个名为CLIP的模型，彻底改变了这一切。它让AI学会了&amp;quot;一边看一边读&amp;quot;的能力，就像人类天生具备的那样。今天，我们就来聊聊CLIP——这个让AI拥有&amp;quot;超能力&amp;quot;的模型，到底是怎么工作的，以及它为什么如此重要。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的单向道困境&#34;&gt;第一章：AI的&amp;quot;单向道&amp;quot;困境&lt;/h2&gt;&#xA;&lt;p&gt;要理解CLIP的突破，先要知道AI的&amp;quot;老毛病&amp;quot;是什么。&lt;/p&gt;&#xA;&lt;p&gt;在CLIP之前，计算机视觉领域的&amp;quot;标准答案&amp;quot;是监督学习：给AI看几百万张人工标注好的图片，每张图片都附着一个标签——&amp;ldquo;猫&amp;rdquo;、&amp;ldquo;狗&amp;rdquo;、&amp;ldquo;汽车&amp;rdquo;、&amp;ldquo;飞机&amp;rdquo;。AI的任务就是记住这些标签，然后下次看到新的图片时，说出它属于哪个类别。&lt;/p&gt;&#xA;&lt;p&gt;ImageNet，这个用了十年之久的标准数据集，由2.5万人花了几个月时间，标注了1,400万张图片。这听起来已经很了不起了，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但问题在于：&lt;strong&gt;地球上只有1,400万种东西吗？当然不是。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你打开手机相册，随便翻一张照片——比如&amp;quot;桌上放着一杯星巴克拿铁，旁边是今天刚买的书&amp;quot;。这种组合，ImageNet里不会有。AI只学过&amp;quot;杯子&amp;quot;和&amp;quot;书&amp;quot;这两个独立标签，它无法理解&amp;quot;一杯星巴克拿铁放在一本书旁边&amp;quot;这个完整的场景。&lt;/p&gt;&#xA;&lt;p&gt;更糟糕的是，如果你想教会AI识别一个新类别，比如&amp;quot;戴帽子的企鹅&amp;quot;，你需要重新让人标注几万张戴帽子的企鹅的照片，然后从头训练模型。&lt;strong&gt;每增加一个类别，就要重新标注、重新训练。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;单向道&amp;quot;困境：它只能识别训练时见过的类别，而且永远无法理解&amp;quot;标签之外&amp;quot;的世界。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章clip的天才想法&#34;&gt;第二章：CLIP的&amp;quot;天才想法&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2021年，OpenAI的研究团队提出了一个简单到令人震惊的想法：&lt;strong&gt;为什么不让AI自己去互联网上&amp;quot;自学&amp;quot;图文关系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;互联网上有海量的图文对——一张照片配上一段文字描述。比如一张猫的照片，下面写着&amp;quot;这只橘猫正在窗台上晒太阳&amp;quot;。这些数据不需要人工标注，它们自然存在于互联网的每个角落。&lt;/p&gt;&#xA;&lt;p&gt;CLIP（Contrastive Language-Image Pre-training）的核心思路是：&lt;strong&gt;训练两个&amp;quot;编码器&amp;quot;，一个负责&amp;quot;看&amp;quot;图片，一个负责&amp;quot;读&amp;quot;文字，然后把它们看到/读到的东西映射到同一个&amp;quot;语义空间&amp;quot;中。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你有一个巨大的图书馆，里面所有的书都有封面和书名。你让一个助手（图像编码器）专门看封面，另一个助手（文本编码器）专门读书名。然后你让两个助手合作：把封面和书名匹配起来。&lt;/p&gt;&#xA;&lt;p&gt;一开始，两个助手都不认识对方的工作。但经过4亿次&amp;quot;配对练习&amp;quot;后，他们逐渐达成了默契——当封面是一只猫，书名是&amp;quot;橘猫晒太阳&amp;quot;时，他们就学会了把&amp;quot;猫的视觉特征&amp;quot;和&amp;quot;猫的文字描述&amp;quot;关联起来。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;CLIP的&amp;quot;天才&amp;quot;之处在于：它不需要人类告诉它&amp;quot;这是什么&amp;quot;。它自己从互联网上海量的图文对中，学会了理解&amp;quot;图像和文字之间的关系&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一场4亿次连连看游戏&#34;&gt;第三章：一场4亿次&amp;quot;连连看&amp;quot;游戏&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的训练过程，本质上是一场规模巨大的&amp;quot;连连看&amp;quot;游戏。&lt;/p&gt;&#xA;&lt;p&gt;假设你有一个批次（batch）包含N张图片和N段文字描述。你把所有图片和所有文字两两配对，形成N×N个可能的组合。其中只有N个组合是&amp;quot;正确的配对&amp;quot;（图片和它对应的文字描述），其余N²-N个都是&amp;quot;错误配对&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的任务就是：&lt;strong&gt;把正确的配对拉近，把错误的配对推远。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个简单的任务，但关键在&amp;quot;拉近&amp;quot;和&amp;quot;推远&amp;quot;的尺度上。CLIP使用了一种叫做&amp;quot;对比损失&amp;quot;的方法——它不仅要让正确配对的图文在语义空间中距离很近，还要让错误配对的图文距离足够远。而且，它同时优化两个方向：从图片找文字，从文字找图片。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;双向对称&amp;quot;的设计，让CLIP学会了真正的&amp;quot;图文通感&amp;quot;——它不只是知道&amp;quot;这张图配这段文字&amp;quot;，而是理解了&amp;quot;这类视觉特征对应这类语义特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;更令人惊讶的是，CLIP在训练过程中&lt;strong&gt;完全没有使用人工标注&lt;/strong&gt;。它的4亿图文对全部来自互联网上未经清洗的原始数据——可以说，CLIP是从&amp;quot;野生&amp;quot;互联网中自学成才的。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章零样本的魔法&#34;&gt;第四章：零样本的&amp;quot;魔法&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP最令人震撼的能力，是它的&amp;quot;零样本学习&amp;quot;——&lt;strong&gt;不需要专门训练，就能识别从未见过的类别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你教一个孩子认识了&amp;quot;猫&amp;quot;、&amp;ldquo;狗&amp;rdquo;、&amp;ldquo;鸟&amp;quot;这三种动物。现在你拿一张&amp;quot;斑马&amp;quot;的照片给他看，他肯定不认识。但如果你告诉他&amp;quot;斑马是一种像马一样、身上有黑白条纹的动物&amp;rdquo;，他就能立刻理解——因为他把&amp;quot;马&amp;quot;的视觉特征和&amp;quot;黑白条纹&amp;quot;这个文字描述组合起来了。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的工作原理，本质上就是这种&amp;quot;组合理解&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当你给CLIP一张图片，让它判断&amp;quot;这是什么&amp;quot;时，它不会像传统AI那样去查一个固定的类别列表。相反，你给它一段文字描述——比如&amp;quot;一张斑马的照片&amp;quot;——CLIP会计算这张图片和这段文字在语义空间中的距离。如果距离足够近，它就认为&amp;quot;对上了&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;你可以随时告诉CLIP一个新的类别，它立刻就能识别。&lt;/strong&gt; 不需要重新训练，不需要重新标注数据。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet的零样本测试中，CLIP达到了76.2%的准确率——与一个经过全监督训练的ResNet-50模型不相上下。而ResNet-50是在人工标注的120万张图片上训练出来的，CLIP却一张标注数据都没用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章clip改变了什么&#34;&gt;第五章：CLIP改变了什么&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的出现，不仅是一个技术突破，更是一个&amp;quot;范式转变&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它终结了&amp;quot;标注依赖&amp;quot;的时代。&lt;/strong&gt; 在过去，每做一个新任务，就要重新标注数据。CLIP证明了：自然语言本身就是最好的监督信号。互联网上无处不在的图文对，比任何人工标注数据集都更丰富、更多样、更便宜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开启了&amp;quot;多模态AI&amp;quot;的大门。&lt;/strong&gt; CLIP证明了图文之间的&amp;quot;语义对齐&amp;quot;是可行的。之后，DALL·E用它做图像生成，Stable Diffusion用它做文生图，BLIP和LLaVA用它做图文理解——CLIP几乎成了多模态AI的&amp;quot;通用底座&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它改变了我们思考AI的方式。&lt;/strong&gt; 传统AI的思维是&amp;quot;识别&amp;quot;——识别出这是什么。CLIP的思维是&amp;quot;理解&amp;quot;——理解图像和文字之间的关系。这听起来像是一个微妙的差别，但本质上，这是从&amp;quot;记忆&amp;quot;到&amp;quot;理解&amp;quot;的跨越。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第六章clip的盲区&#34;&gt;第六章：CLIP的&amp;quot;盲区&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;当然，CLIP并不完美。它也有自己的&amp;quot;盲区&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个盲区：细粒度理解。&lt;/strong&gt; CLIP能认出&amp;quot;猫&amp;quot;，但分不清&amp;quot;布偶猫&amp;quot;和&amp;quot;暹罗猫&amp;quot;的区别。它的理解是&amp;quot;粗粒度&amp;quot;的，就像你能认出&amp;quot;汽车&amp;quot;，但分不清&amp;quot;宝马3系&amp;quot;和&amp;quot;奔驰C级&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个盲区：计数能力。&lt;/strong&gt; 给CLIP看一张图片，问它&amp;quot;图片里有几只鸟&amp;quot;，它大概率会答错。CLIP理解的是&amp;quot;语义&amp;quot;而不是&amp;quot;数量&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个盲区：抽象推理。&lt;/strong&gt; CLIP能理解&amp;quot;一只狗在追球&amp;quot;，但无法理解&amp;quot;如果狗追到了球，接下来会发生什么&amp;quot;。它没有&amp;quot;因果推理&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四个盲区：位置感知。&lt;/strong&gt; CLIP知道图片中有&amp;quot;猫&amp;quot;和&amp;quot;沙发&amp;quot;，但不知道&amp;quot;猫在沙发上面&amp;quot;还是&amp;quot;猫在沙发旁边&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这些盲区，恰恰是后来研究者们努力突破的方向——BLIP-2加入了更精细的视觉理解，Flamingo引入了时序推理，ImageBind扩展到了六种模态（图像、文字、音频、深度、热成像、IMU）。CLIP不是终点，而是一个起点。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的通感时代&#34;&gt;尾声：AI的&amp;quot;通感&amp;quot;时代&lt;/h2&gt;&#xA;&lt;p&gt;今天的你，打开手机相册搜索&amp;quot;夕阳&amp;quot;，AI能准确地找出所有夕阳的照片——如果倒退到2020年，这个功能几乎不可能实现。你告诉AI&amp;quot;帮我生成一张穿着宇航服的猫在火星上散步的图片&amp;quot;，AI能做到——DALL·E和Stable Diffusion的背后，都站着CLIP。&lt;/p&gt;&#xA;&lt;p&gt;CLIP教会AI的，不是&amp;quot;识别&amp;quot;，而是&amp;quot;理解&amp;quot;——理解图像和文字之间的关系，理解视觉和语义之间的桥梁。&lt;/p&gt;&#xA;&lt;p&gt;这种能力，我们叫它&amp;quot;多模态理解&amp;quot;。而人类最擅长的，恰恰就是多模态理解——我们同时用眼睛看、用耳朵听、用语言描述、用身体感受，我们把来自不同感官的信息整合在一起，形成一个完整的&amp;quot;世界模型&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI正在走的路，就是人类已经走过的路。只是这一次，我们既是老师，也是学生。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Jia, C., et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.05918&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Li, J., et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. &lt;em&gt;ICML 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2301.12597&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Alayrac, J. B., et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2204.14198&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Girdhar, R., et al. (2023). ImageBind: One Embedding Space To Bind Them All. &lt;em&gt;CVPR 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2305.05665&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI如何自学成才——自监督学习让机器学会自己教自己</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-teaches-itself/</link>
				<pubDate>Wed, 12 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-teaches-itself/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过，AI是怎么学会&amp;quot;认出&amp;quot;一只猫的？&lt;/p&gt;&#xA;&lt;p&gt;传统的方法是：给AI看几百万张标注好的猫的照片——&amp;ldquo;这是猫&amp;rdquo;、&amp;ldquo;这也是猫&amp;rdquo;、&amp;ldquo;这个不是猫&amp;rdquo;。标注这些照片的人，工作量相当于给一个城市的人每人发一本书，然后让他们一页一页地标记。&lt;/p&gt;&#xA;&lt;p&gt;但你有想过吗？一个婴儿学会&amp;quot;猫&amp;quot;这个词，只需要看几次猫，听到大人说&amp;quot;这是猫&amp;quot;，就记住了。婴儿不需要看几百万张标注好的照片。那么问题来了：&lt;strong&gt;为什么AI需要标注数据，而人类不需要？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个问题，引出了过去几年AI领域最激动人心的进展之一——&lt;strong&gt;自监督学习&lt;/strong&gt;。它是让AI能够&amp;quot;自己教自己&amp;quot;的技术，是AI从&amp;quot;需要喂食&amp;quot;到&amp;quot;自己觅食&amp;quot;的转变。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的饥饿问题&#34;&gt;第一章：AI的&amp;quot;饥饿问题&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;传统AI的&amp;quot;学习&amp;quot;，本质上是一种&amp;quot;被监督&amp;quot;的过程。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你是一个老师，要教一个学生认识世界上的所有动物。你准备了一套标准教材——每页一张动物照片，下面写着动物的名字。学生翻开教材，一张一张地看，一遍一遍地记，最后考了一个高分。但问题是，这套教材需要有人来编写——每一张照片都需要有人去拍照、去标注名字。这就是&amp;quot;监督学习&amp;quot;的困境。&lt;/p&gt;&#xA;&lt;p&gt;ImageNet数据集，这个在2010年代推动AI革命的&amp;quot;教材&amp;quot;，包含了1400万张图片，由2.5万个人工花了几个月的时间才标注完成。你想想，1400万张——这个概念相当于把YouTube上所有热门视频的封面图都翻一遍，然后一张一张地写上&amp;quot;这是猫&amp;quot;、&amp;ldquo;这是狗&amp;rdquo;、&amp;ldquo;这是汽车&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;饥饿问题&amp;quot;：&lt;strong&gt;它需要海量的人工标注数据才能学会一个简单的任务&lt;/strong&gt;。而且，一旦你想让它学会一个新东西，比如识别&amp;quot;斑马&amp;quot;，你又要重新标注几万张斑马的照片给它看。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章ai的自学实验&#34;&gt;第二章：AI的&amp;quot;自学&amp;quot;实验&lt;/h2&gt;&#xA;&lt;p&gt;2019年到2020年，一场关于AI能否&amp;quot;自学&amp;quot;的实验，在几个顶级实验室之间悄然展开。&lt;/p&gt;&#xA;&lt;p&gt;这场实验的核心问题很简单：&lt;strong&gt;能否让AI自己从互联网上那些没有标注的图片中学习，不需要任何人告诉它&amp;quot;这是什么&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;可以，而且效果惊人&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第一个突破来自Google Research的SimCLR。它的思路非常巧妙。想象一下，你有一张猫的照片。你把这张照片做两个不同的处理——一个调亮一点，一个旋转一点。然后你告诉AI：&amp;ldquo;这两张其实是一张图，你看出来了吗？&amp;ldquo;AI一开始当然看不出来，但经过成百上千万次的这种&amp;quot;配对训练&amp;rdquo;，它慢慢学会了：&amp;ldquo;哦，原来一只猫不管是从左边看还是从右边看、调亮还是调暗，它都是一只猫。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;SimCLR的核心洞察是：&lt;strong&gt;让AI自己和自己玩&amp;quot;找相同&amp;quot;的游戏&lt;/strong&gt;。同一张图片的不同&amp;quot;变体&amp;quot;是正样本，其他所有图片都是负样本。AI需要把正样本拉近，把负样本推远。这个过程不需要任何人工标注，AI自己就能从海量图片中学习到&amp;quot;什么是相同的&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;但SimCLR有一个问题：它追求&amp;quot;找相同&amp;quot;的时候，需要大量负样本——也就是&amp;quot;不相同的图片&amp;quot;。为了获得足够多的负样本，它需要一次看很多张图片（比如4096张），这对GPU的要求非常高，普通实验室根本跑不起来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个记忆的革命&#34;&gt;第三章：一个&amp;quot;记忆&amp;quot;的革命&lt;/h2&gt;&#xA;&lt;p&gt;与此同时，Facebook AI Research（FAIR）的团队走了另一条路。&lt;/p&gt;&#xA;&lt;p&gt;何恺明团队提出的MoCo（动量对比学习），解决了一个关键问题：&lt;strong&gt;AI需要一本&amp;quot;记忆手册&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你让AI认人。它看到一个新人，就在自己的记忆手册里记下这个人的特征。下次再看到这个人，它翻翻手册：&amp;ldquo;嗯，特征对上了，是同一个人。&amp;ldquo;但如果手册里只有最近见过的几个人，它就很容易忘掉之前见过的人。&lt;/p&gt;&#xA;&lt;p&gt;MoCo的解决方案是：&lt;strong&gt;维护一个&amp;quot;队列&amp;quot;式的记忆库&lt;/strong&gt;。它把过去见过的所有图片特征都保存在一个巨大的队列里——默认保存65536张。新图片进来，把最旧的挤出去。这样，AI总能从足够多的历史样本中学习和对比。&lt;/p&gt;&#xA;&lt;p&gt;更巧妙的是，MoCo还设计了一个&amp;quot;动量编码器&amp;rdquo;——一个缓慢更新的影子网络。这个影子网络的作用是，让记忆库中的特征保持一致。就像你认人，如果今天看这个人的特征和你昨天看的特征不一样，那你肯定认不出来。动量编码器确保记忆库中的特征不会因为模型更新而剧烈变化。&lt;/p&gt;&#xA;&lt;p&gt;MoCo的突破在于：&lt;strong&gt;它把字典大小和批次大小解耦了&lt;/strong&gt;。SimCLR需要一次看4096张图片，MoCo只需要256张，因为它可以&amp;quot;记住&amp;quot;之前看过的几万张图片。这让所有实验室，即使是只有几张GPU的小团队，也能做自监督学习。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章ai的自我博弈&#34;&gt;第四章：AI的&amp;quot;自我博弈&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2020年，DeepMind扔出了一颗&amp;quot;炸弹&amp;quot;——BYOL。&lt;/p&gt;&#xA;&lt;p&gt;BYOL的诞生，源于一个朴素的问题：&lt;strong&gt;如果不使用负样本，AI还能自学吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：当然不行，没有负样本，AI不就&amp;quot;我全都要&amp;quot;了吗？确实，对比学习依赖&amp;quot;拉近正样本、推远负样本&amp;quot;这个机制，如果没有负样本，模型很容易陷入&amp;quot;对所有输入都输出相同的结果&amp;quot;——这就是所谓的&amp;quot;坍塌&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但BYOL偏偏做到了。它的方法非常有趣：&lt;strong&gt;让AI和自己玩&amp;quot;猜谜游戏&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;BYOL由两个网络组成——在线网络和目标网络。在线网络负责&amp;quot;猜&amp;quot;，目标网络提供&amp;quot;答案&amp;quot;。对同一张图片做两个不同的增强，分别输入两个网络，然后让在线网络试图预测目标网络的输出。目标网络不直接学习，而是通过在线网络参数的&amp;quot;滑动平均&amp;quot;缓慢更新。&lt;/p&gt;&#xA;&lt;p&gt;这个设计的关键在于：&lt;strong&gt;预测头（predictor）的存在&lt;/strong&gt;。它像是给AI装了一个&amp;quot;好奇的引擎&amp;quot;——让AI不断尝试去预测另一个视角下的自己，而不是简单地复制粘贴。再加上动量编码器，模型就稳定了。&lt;/p&gt;&#xA;&lt;p&gt;BYOL之所以令人震惊，是因为它打破了&amp;quot;对比学习必须依赖负样本&amp;quot;这个共识。它证明了一个更深刻的道理：&lt;strong&gt;AI的&amp;quot;自学&amp;quot;能力，本质上是在寻找不同视角下的一致性，而不是在&amp;quot;区别&amp;quot;事物&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章大道至简&#34;&gt;第五章：大道至简&lt;/h2&gt;&#xA;&lt;p&gt;2021年，FAIR的SimSiam又往前迈了一步。&lt;/p&gt;&#xA;&lt;p&gt;SimSiam的研究者问了一个更尖锐的问题：&lt;strong&gt;BYOL、MoCo、SimCLR、SwAV这些方法，到底哪些组件是真正必要的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他们把BYOL的动量编码器去掉，把SimCLR的负样本去掉，把SwAV的在线聚类去掉，最终只剩下一个最简单的结构——两个共享权重的孪生网络，一个预测头，一个stop-gradient操作。&lt;/p&gt;&#xA;&lt;p&gt;最令人震惊的是：&lt;strong&gt;这个最简单的结构，效果和所有复杂方法一样好&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;SimSiam的发现揭示了一个深刻的洞察：&lt;strong&gt;stop-gradient（停止梯度）是防止坍塌的关键&lt;/strong&gt;。为什么？研究者提出了一个EM算法假设——两个网络分支实际上在做&amp;quot;交替优化&amp;quot;。一个分支负责&amp;quot;编码&amp;quot;，另一个分支在&amp;quot;求解&amp;quot;；stop-gradient就是在告诉模型&amp;quot;别动这一边，专注于优化另一边&amp;quot;。这种交替优化，天然地防止了坍塌。&lt;/p&gt;&#xA;&lt;p&gt;这就像两个人在合作拼图——一个人拼左边的部分，另一个人拼右边的部分。如果两个人都只在调整自己的部分，永远不会看向对方，那肯定拼不到一起去。但如果一个人先拼好，另一个人去匹配——这就是stop-gradient的精髓。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第六章ai的填空游戏&#34;&gt;第六章：AI的&amp;quot;填空&amp;quot;游戏&lt;/h2&gt;&#xA;&lt;p&gt;2022年，何恺明团队再次出手，带来了MAE（掩码自编码器）。&lt;/p&gt;&#xA;&lt;p&gt;MAE的思路，听起来简单得不可思议：&lt;strong&gt;把一张图片的大部分遮住，让AI猜被遮住的部分是什么&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你看到一张猫的照片，但猫的身体被遮住了75%，只露出了头和尾巴。你能猜出这是一只猫吗？当然能。因为你的大脑知道&amp;quot;猫&amp;quot;的形状，能够根据露出的部分推断出被遮住的部分。&lt;/p&gt;&#xA;&lt;p&gt;MAE就是这么做的。它把一张图片随机遮住75%的像素块，让AI去&amp;quot;填空&amp;quot;。AI的编码器只看可见的25%像素，解码器负责重建被遮住的75%。这个&amp;quot;非对称&amp;quot;设计非常巧妙——编码器只处理一小部分数据，速度提升了3倍以上。&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：遮住75%，AI能学到什么？答案恰恰相反——&lt;strong&gt;正是因为遮住了75%，AI才被迫去理解&amp;quot;整体&amp;quot;&lt;/strong&gt;。如果只遮住10%，AI可以通过相邻像素的连续性来&amp;quot;蒙混过关&amp;quot;，根本不需要理解画面内容。但遮住75%后，AI必须真正理解&amp;quot;这是一只猫，所以被遮住的部分应该是猫的身体&amp;quot;——它学到的不是像素，而是语义。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的自学启示&#34;&gt;尾声：AI的&amp;quot;自学&amp;quot;启示&lt;/h2&gt;&#xA;&lt;p&gt;回顾自监督学习的发展史，我们能看到一条清晰的脉络：从SimCLR的&amp;quot;找相同&amp;quot;游戏，到MoCo的&amp;quot;记忆革命&amp;quot;，到BYOL的&amp;quot;自我博弈&amp;quot;，到SimSiam的&amp;quot;大道至简&amp;quot;，再到MAE的&amp;quot;填空游戏&amp;quot;——每一步都在推动AI走向&amp;quot;不依赖人工标注&amp;quot;的自学之路。&lt;/p&gt;&#xA;&lt;p&gt;现在，自监督学习已经成为AI领域的标配。GPT系列用自监督学习理解语言，CLIP用自监督学习理解图文关系，DINO用自监督学习理解视觉特征。&lt;strong&gt;自监督学习，正在成为AI理解世界的&amp;quot;通用底座&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;但更深刻的是，自监督学习给我们的启示：&lt;strong&gt;真正的智能，不需要被灌输知识，而是能从数据中自己发现规律&lt;/strong&gt;。人类的婴儿不需要看几百万张&amp;quot;这是猫&amp;quot;的照片才能认猫，是因为他们的大脑天生就具备&amp;quot;自监督&amp;quot;的能力——观察、比较、预测、验证，一步步构建对世界的理解。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI正在走的路，也许就是人类自己走过的路。只是这一次，我们既是先驱者，也是见证者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen, T., et al. (2020). A Simple Framework for Contrastive Learning of Visual Representations. &lt;em&gt;ICML 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He, K., et al. (2020). Momentum Contrast for Unsupervised Visual Representation Learning. &lt;em&gt;CVPR 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill, J. B., et al. (2020). Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Chen, X., &amp;amp; He, K. (2021). Exploring Simple Siamese Representation Learning. &lt;em&gt;CVPR 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2011.10566&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He, K., et al. (2022). Masked Autoencoders Are Scalable Vision Learners. &lt;em&gt;CVPR 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>当AI学会「看图说话」——CLIP如何让机器真正理解图片与文字</title>
				<link>https://lingyu7.com/posts/how-clip-teaches-ai-to-understand-images-and-text/</link>
				<pubDate>Mon, 10 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-clip-teaches-ai-to-understand-images-and-text/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过这样一个问题：AI在一张图片里到底&amp;quot;看&amp;quot;到了什么？&lt;/p&gt;&#xA;&lt;p&gt;你拍了一张照片发给AI，它说&amp;quot;这是一只柴犬在沙滩上奔跑，旁边有海浪拍打礁石&amp;quot;。听起来很平常，对吧？但仔细想想，这个过程其实非常神奇——AI看到的只是一个像素矩阵，它怎么知道那是&amp;quot;柴犬&amp;quot;而不是&amp;quot;金色的毛茸茸物体&amp;quot;？它怎么理解&amp;quot;奔跑&amp;quot;这个动态概念？它又是怎么把&amp;quot;沙滩&amp;quot;、&amp;ldquo;海浪&amp;rdquo;、&amp;ldquo;礁石&amp;quot;这些文字符号和画面中的像素联系起来的？&lt;/p&gt;&#xA;&lt;p&gt;很长一段时间里，计算机视觉和自然语言处理就像两个互不相识的邻居，各过各的日子。视觉模型只懂像素，语言模型只懂文字。直到2021年，OpenAI的一篇论文彻底改变了这一切。这篇论文叫CLIP，它的核心工作只有一句话——&lt;strong&gt;教会AI同时理解图片和文字，并且搞清楚它们之间的关系&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的视而不见与言不由衷&#34;&gt;第一章：AI的&amp;quot;视而不见&amp;quot;与&amp;quot;言不由衷&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;在CLIP出现之前，AI的世界里存在一个奇怪的&amp;quot;分裂&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;我们先看视觉模型。传统的图像分类模型是怎么工作的？以ImageNet（一个包含1400万张图片的数据库）为例，研究人员花了2.5万个人工，一张一张地给图片打标签——&amp;ldquo;这是一只猫&amp;rdquo;、&amp;ldquo;这是一条狗&amp;rdquo;、&amp;ldquo;这是一辆汽车&amp;rdquo;。然后AI看着这些标注好的图片，努力记住&amp;quot;猫长什么样&amp;quot;、&amp;ldquo;狗长什么样&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个方法的第一个问题是：&lt;strong&gt;成本高得离谱&lt;/strong&gt;。给1400万张图片打标签，需要2.5万个人工的工作量。而且就算你投入了这么多人力，最后得到的模型也只能识别它训练时见过的1000个类别。如果你给它看一张&amp;quot;斑马&amp;quot;——对不起，训练集里没有这个类别，模型只会说&amp;quot;不知道&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;再说语言模型。语言模型倒是很擅长理解文字，但问题是——&lt;strong&gt;它看不见图片&lt;/strong&gt;。你给它描述&amp;quot;一只柴犬在沙滩上奔跑&amp;quot;，它能理解这句话的意思，但它无法把这句话和实际的画面联系起来。它就像一个只能读书、不能看世界的学者，知识再丰富也仅限于书本。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;视而不见&amp;quot;和&amp;quot;言不由衷&amp;quot;——视觉模型看到画面却说不出来，语言模型能说会道却看不见。两个系统之间隔着一道无形的墙。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章clip的魔法时刻&#34;&gt;第二章：CLIP的&amp;quot;魔法时刻&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的灵感，其实来自一个非常简单的生活观察。&lt;/p&gt;&#xA;&lt;p&gt;想想看，互联网上最丰富的数据是什么？是一张图片和它周围的文字描述。一张旅游照片，下面写着&amp;quot;三亚的海滩，阳光正好&amp;quot;；一个商品展示图，旁边的文字是&amp;quot;新款运动鞋，透气轻便&amp;quot;；甚至一张表情包，上面写着&amp;quot;周一的我&amp;quot;。这些图文对——&lt;strong&gt;图片+文字的组合&lt;/strong&gt;——在互联网上以亿计的量级存在，而且完全免费。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的核心洞察就一句话：&lt;strong&gt;与其花大价钱请人给图片打标签，不如让AI自己去互联网上学&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体怎么做呢？CLIP设计了一个非常巧妙的训练方法。想象一下，你有一张图片和一段文字描述，比如一张柴犬的照片配文&amp;quot;一只可爱的柴犬&amp;quot;。CLIP会把这张图片编码成一个&amp;quot;特征向量&amp;quot;（你可以把它理解为一串数字密码），同时把这段文字也编码成另一个&amp;quot;特征向量&amp;quot;。然后，CLIP要做的事情是：&lt;strong&gt;让同一张图片和它对应的文字描述，在&amp;quot;语义空间&amp;quot;中的距离尽可能近；让不匹配的图片和文字，距离尽可能远&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个过程就像教一个孩子玩配对游戏。你拿出100张图片和100段文字描述，打乱顺序，让AI找出哪段文字对应哪张图片。AI一开始肯定是乱猜的，但做错的次数多了，它慢慢学会了&amp;quot;嗯，这张图片的纹理、颜色和形状，和这段文字里的&amp;rsquo;柴犬&amp;rsquo;、&amp;lsquo;奔跑&amp;rsquo;这些词是匹配的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的训练规模有多大？OpenAI从互联网上收集了4亿个图文对，用32个epoch训练了最大的模型。4亿——这个数字相当于把人类历史上所有电影截图都翻一遍还要多。在如此海量的数据面前，CLIP学会了在不同模态之间建立联系，打通了视觉和语言之间的桥梁。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章零样本的魔法为什么clip能猜出没见过的图片&#34;&gt;第三章：零样本的魔法——为什么CLIP能&amp;quot;猜&amp;quot;出没见过的图片&lt;/h2&gt;&#xA;&lt;p&gt;CLIP最令人惊叹的能力，是它的&lt;strong&gt;零样本迁移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;零样本&amp;quot;这个词听起来很专业，但它的意思其实很简单：CLIP能在没有接受过任何训练的情况下，识别出从未见过的图片类别。&lt;/p&gt;&#xA;&lt;p&gt;举个例子：假设你让CLIP判断一张图片是&amp;quot;斑马&amp;quot;还是&amp;quot;长颈鹿&amp;rdquo;。CLIP从来没有被专门训练过&amp;quot;斑马是什么&amp;quot;——它的训练数据里没有&amp;quot;一张斑马的图片，标签是斑马&amp;quot;这样的标注数据。但CLIP&amp;quot;读过&amp;quot;的4亿图文对里，包含大量提到斑马的文字描述，比如&amp;quot;斑马的黑白条纹在大草原上格外醒目&amp;quot;、&amp;ldquo;斑马和角马一起迁徙&amp;rdquo;。CLIP把&amp;quot;斑马&amp;quot;这个词对应的特征向量和图片的特征向量在语义空间中做了比对，发现&amp;quot;这张图片的特征向量，更接近&amp;rsquo;斑马&amp;rsquo;这个词的特征向量，而不是&amp;rsquo;长颈鹿&amp;rsquo;的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就是零样本的魔法——&lt;strong&gt;CLIP不是通过&amp;quot;记住&amp;quot;某个类别来识别，而是通过&amp;quot;理解&amp;quot;语言描述来推理&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;为了验证这个能力，研究人员在27个不同的视觉分类任务上测试了CLIP，包括ImageNet（通用物体识别）、CIFAR（小图分类）、OCR（文字识别）、动作识别（判断人在做什么）等等。结果令人震惊：CLIP在ImageNet上的零样本准确率达到76.2%，与一个经过完整监督训练的ResNet-50模型持平。要知道，ResNet-50可是在140万张标注图片上训练出来的，而CLIP一张标注图片都没看过。&lt;/p&gt;&#xA;&lt;p&gt;更令人意外的是，CLIP在OCR（光学文字识别）和动作识别等任务上的表现，甚至超过了那些专门为此训练过的模型。这意味着CLIP学到的不只是&amp;quot;视觉特征&amp;quot;，而是一种更通用的&amp;quot;理解能力&amp;quot;——它真的在试图理解图片中的内容，而不是简单地匹配像素模式。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章一张图片引发的ai革命&#34;&gt;第四章：一张图片引发的&amp;quot;AI革命&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的意义远不止于&amp;quot;看图说话&amp;quot;本身。它像一扇被推开的大门，开启了一个全新的AI时代。&lt;/p&gt;&#xA;&lt;p&gt;第一个冲进去的是DALL·E。同样是OpenAI的作品，DALL·E把CLIP的文本编码器拆下来，接上了一个图像生成器，实现了&amp;quot;你说什么，AI就画什么&amp;quot;的魔法。你输入&amp;quot;一个牛油果造型的沙发&amp;quot;，DALL·E就能生成一张看起来像模像样的图片。这个能力的核心，正是CLIP建立的图文语义桥梁——AI理解了&amp;quot;牛油果&amp;quot;和&amp;quot;沙发&amp;quot;这两个概念，然后把它们融合在一起。&lt;/p&gt;&#xA;&lt;p&gt;然后是Stable Diffusion。它把CLIP的文本编码器用作文本条件控制模块，让任何人都能通过文字生成高质量图片。你在网上看到的所有&amp;quot;AI绘画&amp;quot;作品，几乎都离不开CLIP的贡献。&lt;/p&gt;&#xA;&lt;p&gt;再往后，BLIP、BLIP-2、LLaVA等模型进一步扩展了CLIP的范式，让AI不仅能&amp;quot;看图说话&amp;quot;，还能&amp;quot;看图问答&amp;quot;、&amp;ldquo;看图推理&amp;rdquo;。你拍一张冰箱内部的照片，问AI&amp;quot;晚饭能做什么菜&amp;quot;，AI会分析冰箱里的食材，然后给出建议——这在以前是科幻电影里的场景，现在已经成为现实。&lt;/p&gt;&#xA;&lt;p&gt;CLIP创造了一个全新的范式：&lt;strong&gt;多模态学习&lt;/strong&gt;。它证明了不同模态的信息（图像、文字、声音、视频）可以被映射到同一个语义空间中，让AI在不同感官之间自由切换。这就像打通了AI的&amp;quot;任督二脉&amp;quot;——视觉和语言不再是两个独立的系统，而是同一个认知体系的两个维度。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的完整认知&#34;&gt;尾声：AI的&amp;quot;完整认知&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：AI在一张图片里到底&amp;quot;看&amp;quot;到了什么？&lt;/p&gt;&#xA;&lt;p&gt;在CLIP之前，AI看到的只是一堆像素的排列组合。在CLIP之后，AI看到的是一张图片和它背后的语义世界——&amp;ldquo;柴犬&amp;quot;代表一种特定品种的狗，&amp;ldquo;沙滩&amp;quot;代表一个特定的场景，&amp;ldquo;奔跑&amp;quot;代表一种动态的动作。AI不仅&amp;quot;看到&amp;quot;了这些元素，还&amp;quot;理解&amp;quot;了它们之间的关系。&lt;/p&gt;&#xA;&lt;p&gt;但CLIP并非完美。它在细粒度分类（比如区分不同品种的狗）和计数任务（比如数出图片里有几个人）上表现不佳。它对提示词非常敏感——换一个问法，答案可能完全不同。而且，CLIP的训练数据来自互联网，这意味着它不可避免地继承了互联网上的偏见和刻板印象。&lt;/p&gt;&#xA;&lt;p&gt;但无论如何，CLIP是一个里程碑。它第一次让AI真正理解了&amp;quot;图片&amp;quot;和&amp;quot;文字&amp;quot;之间的关系，不是通过死记硬背，而是通过建立语义连接。这背后隐藏着一个更深刻的启示：&lt;strong&gt;真正的智能，或许不在于某个单一能力的登峰造极，而在于不同能力之间的连接与融合&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;就像人类一样——我们之所以能理解这个世界，不是因为眼睛有多好、耳朵有多灵，而是因为视觉、听觉、语言、触觉、记忆这些不同的感知系统，在大脑中形成了一个统一的认知网络。&lt;strong&gt;AI的未来，或许也在于此&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Jia, C., et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.05918&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Alayrac, J. B., et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2204.14198&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ramesh, A., et al. (2021). Zero-Shot Text-to-Image Generation. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.12092&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>「猜你喜欢」的魔法背后——推荐系统如何读懂你</title>
				<link>https://lingyu7.com/posts/how-recommender-systems-read-your-mind/</link>
				<pubDate>Sun, 09 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-recommender-systems-read-your-mind/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历：打开淘宝，首页推荐的商品恰好是你昨晚跟朋友聊到的那款；打开抖音，刷到的视频一个比一个合你胃口。你可能会觉得手机在&amp;quot;偷听&amp;quot;你说话，但真相远比偷听更复杂，也更有趣。&lt;/p&gt;&#xA;&lt;p&gt;推荐系统，这个你每天都在接触却几乎感觉不到的AI技术，其实是现代互联网最核心的引擎之一。今天，我们就来聊聊这个&amp;quot;猜你喜欢&amp;quot;的魔法背后，到底藏着什么。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章最早的推荐买过这个的人也买了&#34;&gt;第一章：最早的推荐——&amp;ldquo;买过这个的人也买了……&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;推荐系统的故事，要从一个现在看起来很简单的问题开始：如何在海量商品中，帮用户找到他们可能喜欢的东西？&lt;/p&gt;&#xA;&lt;p&gt;2003年，亚马逊的工程师提出了一个堪称经典的思路——&lt;strong&gt;物品协同过滤&lt;/strong&gt;。它的核心逻辑非常朴素：如果你买了A商品，那么其他买了A商品的人也买了什么，就可能也是你想要的。&lt;/p&gt;&#xA;&lt;p&gt;想象一下这个场景：你去图书馆借书，管理员看了看你手里的《三体》，然后说：&amp;ldquo;借这本书的人，通常也会借《银河帝国》和《沙丘》。&amp;ldquo;你接过书，发现确实很有趣。这就是物品协同过滤的本质——&lt;strong&gt;通过分析用户群体的行为模式，找到物品之间的关联&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;亚马逊的这套方法之所以能成为经典，在于它解决了推荐系统最大的矛盾：&lt;strong&gt;既要算得快，又要推荐准&lt;/strong&gt;。它把&amp;quot;计算相似度&amp;quot;这个最耗时的操作放到后台离线完成，用户刷页面时只需要查表就能拿到结果，毫秒级响应。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;买过这个的人也买了……&amp;ldquo;这个土得掉渣的文案，背后是推荐系统领域最深邃的洞察之一。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章推荐系统的记忆和想象力&#34;&gt;第二章：推荐系统的&amp;quot;记忆&amp;quot;和&amp;quot;想象力&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;早期协同过滤虽然好用，但它有一个天生的短板：&lt;strong&gt;它只能推荐&amp;quot;已知的已知&amp;rdquo;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;什么意思？假设你是一个资深科幻迷，买了所有能买到的科幻小说。协同过滤能推荐给你的，永远只是其他科幻迷也喜欢的书。它无法理解&amp;quot;科幻&amp;quot;这个概念本身，也无法把&amp;quot;科幻&amp;quot;和&amp;quot;太空歌剧&amp;rdquo;、&amp;ldquo;硬科幻&amp;rdquo;、&amp;ldquo;赛博朋克&amp;quot;这些子类别联系起来。&lt;/p&gt;&#xA;&lt;p&gt;2016年，Google的工程师提出了一个革命性的思路——&lt;strong&gt;Wide &amp;amp; Deep模型&lt;/strong&gt;。这个名字取得很形象，它把推荐系统分成了两个部分：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;Wide（宽的部分）&lt;/strong&gt;：负责&amp;quot;记忆&amp;rdquo;。它像一台精密的关系数据库，牢牢记住那些频繁出现的特征组合——比如&amp;quot;喜欢《三体》的人，大概率也喜欢《银河帝国》&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Deep（深的部分）&lt;/strong&gt;：负责&amp;quot;泛化&amp;rdquo;。它像一个正在学习的孩子，通过大量数据学会&amp;quot;科幻&amp;quot;这个概念，然后举一反三——&amp;ldquo;既然你喜欢《三体》，那《阿西莫夫机器人短篇全集》你应该也会喜欢，虽然它们表面上看起来不太一样。&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用大白话说：&lt;strong&gt;Wide负责&amp;quot;记住经验&amp;quot;，Deep负责&amp;quot;发挥想象&amp;quot;&lt;/strong&gt;。两者结合，推荐系统既不会错过那些&amp;quot;老用户都懂&amp;quot;的经典关联，又能探索出你从未想过但确实喜欢的领域。&lt;/p&gt;&#xA;&lt;p&gt;这个模型在Google Play商店上线后，App购买率直接提升了3.9%。你可能觉得3.9%不多，但对于一个日活几十亿的系统来说，这意味着每天多出来上千万次的有效推荐。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章当推荐系统开始理解关系&#34;&gt;第三章：当推荐系统开始&amp;quot;理解&amp;quot;关系&lt;/h2&gt;&#xA;&lt;p&gt;如果说Wide &amp;amp; Deep模型让推荐系统学会了&amp;quot;联想&amp;quot;，那近几年图神经网络的应用，则让推荐系统真正开始&amp;quot;理解&amp;quot;关系。&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：什么是&amp;quot;图&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;在AI的世界里，&amp;ldquo;图&amp;quot;不是图片，而是由&lt;strong&gt;节点&lt;/strong&gt;和&lt;strong&gt;边&lt;/strong&gt;组成的关系网络。社交网络是图——每个人是一个节点，朋友关系是边。知识图谱是图——每个概念是一个节点，概念之间的联系是边。甚至你的购物行为也是图——你和商品都是节点，购买行为就是你与商品之间的边。&lt;/p&gt;&#xA;&lt;p&gt;2017年，图卷积网络（GCN）的提出，让AI第一次能够&amp;quot;看懂&amp;quot;这种复杂的关系网络。它的想法非常巧妙：&lt;strong&gt;一个节点的特征，应该由它邻居节点的特征共同决定&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;翻译成人话就是：要判断一个人喜欢什么，不仅要看他买了什么，还要看他的朋友买了什么、他关注的人买了什么、跟他品味相似的人买了什么。GCN就像一个擅长社交的侦探，通过&amp;quot;朋友的朋友&amp;quot;这条线索，把整个关系网的信息汇聚到一个人身上。&lt;/p&gt;&#xA;&lt;p&gt;现在，从淘宝到抖音，从Netflix到Spotify，主流推荐系统几乎都在用图神经网络来提升推荐质量。当你刷到一条&amp;quot;好像很懂你&amp;quot;的视频时，背后很可能就是GCN在分析你与这条视频之间错综复杂的关系链。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章推荐系统也有偏见&#34;&gt;第四章：推荐系统也有&amp;quot;偏见&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;讲到这里，你可能会觉得推荐系统简直是完美的&amp;quot;读心术&amp;quot;。但任何技术都有它的另一面。&lt;/p&gt;&#xA;&lt;p&gt;推荐系统天然存在一个困境：&lt;strong&gt;它越了解你，就越容易把你困在信息茧房里&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;算法发现你喜欢科幻，就会不断给你推科幻，其他类型的精彩内容就被你完美错过了。你不是不喜欢，而是&lt;strong&gt;根本不知道它们存在&lt;/strong&gt;。这就是所谓的&amp;quot;过滤气泡&amp;quot;——推荐系统在帮你节省时间的同时，也悄悄地剥夺了你的&amp;quot;意外发现&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;2016年，一项关于YouTube推荐系统的研究表明，推荐算法会逐渐引导用户走向更极端、更有争议的内容，因为这类内容更容易引发点击。这不是算法的恶意，而是&lt;strong&gt;优化目标偏差&lt;/strong&gt;——当推荐系统只关注&amp;quot;点击率&amp;quot;这个指标时，它自然会选择那些最能刺激你点击的内容，而不是那些对你真正有价值的内容。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声推荐系统到底在推荐什么&#34;&gt;尾声：推荐系统到底在推荐什么？&lt;/h2&gt;&#xA;&lt;p&gt;回看推荐系统的进化史，我们能看到一条清晰的脉络：从&amp;quot;记住谁买了什么&amp;quot;，到&amp;quot;理解用户喜欢什么&amp;quot;，再到&amp;quot;看懂人、物、兴趣之间的复杂关系网&amp;quot;——推荐系统越来越&amp;quot;聪明&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;但技术越进步，越需要思考一个根本问题：&lt;strong&gt;推荐系统到底在推荐什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它推荐的不只是商品、视频、文章，而是你注意力的流向，是你认知世界的边界。一个优秀的推荐系统，不应该只满足于&amp;quot;猜中你喜欢什么&amp;quot;，还应该敢于&amp;quot;推荐你可能不知道但会喜欢的东西&amp;quot;——在精准和多样性之间找到平衡，才是推荐系统真正的&amp;quot;智能&amp;quot;所在。&lt;/p&gt;&#xA;&lt;p&gt;你的每一次滑动、点击、停留，都在训练着算法。与其把推荐系统看作一个&amp;quot;猜你喜欢&amp;quot;的机器，不如把它看作一面镜子——你是什么样的人，它就推荐什么样的内容。&lt;strong&gt;想拥有更好的推荐，先成为更好的自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Linden, G., Smith, B., &amp;amp; York, J. (2003). Amazon.com Recommendations: Item-to-Item Collaborative Filtering. &lt;em&gt;IEEE Internet Computing&lt;/em&gt;. &lt;a href=&#34;http://www.cs.umd.edu/~samir/498/Amazon-Recommendations.pdf&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Cheng, H. T., et al. (2016). Wide &amp;amp; Deep Learning for Recommender Systems. &lt;em&gt;DLRS 2016&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1606.07792&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Kipf, T. N., &amp;amp; Welling, M. (2017). Semi-Supervised Classification with Graph Convolutional Networks. &lt;em&gt;ICLR 2017&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1609.02907&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Koren, Y., Bell, R., &amp;amp; Volinsky, C. (2009). Matrix Factorization Techniques for Recommender Systems. &lt;em&gt;IEEE Computer&lt;/em&gt;. &lt;a href=&#34;https://ieeexplore.ieee.org/document/5197422&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
	</channel>
</rss>
