<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>人工智能 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/</link>
		<description>Recent content in 人工智能 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sun, 13 Sep 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>你的每一个动作，都在验证一个预测——主动推理：比&#39;理解&#39;更根本的智能法则</title>
				<link>https://lingyu7.com/posts/active-inference-every-action-is-a-prediction/</link>
				<pubDate>Sun, 13 Sep 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/active-inference-every-action-is-a-prediction/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：&lt;strong&gt;你为什么会好奇？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不是那种&amp;quot;想知道八卦&amp;quot;的好奇，而是最原始的那种——当你看到一个没见过的工具，会忍不住拿起来摆弄；当你听到一个模糊的声音，会不自觉地扭头去看；当你走进一个陌生的环境，眼睛会自动扫视每一个角落。&lt;/p&gt;&#xA;&lt;p&gt;这种行为太自然了，以至于我们很少停下来思考：&lt;strong&gt;为什么？&lt;/strong&gt; 为什么我们会有&amp;quot;探索&amp;quot;的本能？&lt;/p&gt;&#xA;&lt;p&gt;传统的解释是：好奇心让我们学习，学习让我们生存，所以进化选择了它。但这只是&amp;quot;为什么&amp;quot;层面的解释，不是&amp;quot;如何&amp;quot;层面的解释。如果深入一层去问：好奇心在神经层面上是怎么工作的？智能体如何决定&amp;quot;我现在应该去探索而不是躺平&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;过去十年间，一个来自理论神经科学和认知科学交汇处的框架正在给出惊艳的回答。它叫&lt;strong&gt;主动推理（Active Inference）&lt;/strong&gt;，而这个框架的核心洞见只有一句话——&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;智能的本质不是被动地理解世界，而是主动地把世界改造成你预期的样子。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个想法听起来简单，但它带来的冲击力，足以重写我们对智能、意识和AI的底层认知。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一感知与行动一枚硬币的两面&#34;&gt;一、感知与行动：一枚硬币的两面&lt;/h2&gt;&#xA;&lt;p&gt;先说一个思想实验。&lt;/p&gt;&#xA;&lt;p&gt;想象你走进一个完全漆黑的房间。你什么也看不见，什么也听不见。你怎么办？&lt;/p&gt;&#xA;&lt;p&gt;大部分人的第一反应是——&lt;strong&gt;伸出手去摸&lt;/strong&gt;。你会在黑暗中往前探步，用手触碰墙壁、摸索家具。你在&amp;quot;行动&amp;quot;，但你的目标不是别的，正是为了&amp;quot;感知&amp;quot;：摸到墙的那一刻，你就&amp;quot;看见&amp;quot;了房间的边界。&lt;/p&gt;&#xA;&lt;p&gt;这个瞬间揭示了一个深刻的真相：&lt;strong&gt;感知和行动不是两件不同的事——它们服务于同一个目标。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;我们通常认为感知是&amp;quot;输入&amp;quot;，行动是&amp;quot;输出&amp;quot;。眼睛接收光线，大脑处理信息，然后决定要不要伸手。这是一个线性的&amp;quot;输入→处理→输出&amp;quot;模型。&lt;/p&gt;&#xA;&lt;p&gt;但主动推理说：不对，顺序搞反了。&lt;/p&gt;&#xA;&lt;p&gt;实际上，你的大脑在行动之前就已经&amp;quot;预测&amp;quot;了世界应该是什么样。行动的目的，不是&amp;quot;执行一个决定&amp;quot;，而是&lt;strong&gt;让世界变成你预测的样子&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;你伸出手去摸墙，是因为你预测&amp;quot;这里应该有面墙&amp;quot;。摸到墙的触感与预测一致，你的&amp;quot;预测误差&amp;quot;为零，你满意了。如果没摸到墙——哎呀，感知和预测不符，你的大脑就会更新模型，重新调整预测。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;行动，是验证预测的一种方式。&lt;/strong&gt; 就像科学家做实验不是为了&amp;quot;改变世界&amp;quot;（虽然客观上改变了），而是为了检验假设的正确性。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二从预测编码到主动推理一次关键的认知升级&#34;&gt;二、从预测编码到主动推理：一次关键的认知升级&lt;/h2&gt;&#xA;&lt;p&gt;要理解主动推理有多颠覆，得先铺垫一下它的前身——&lt;strong&gt;预测编码（Predictive Coding）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;预测编码是过去十几年认知科学最大的进展之一。它的核心思想是：&lt;strong&gt;你的大脑不是一个被动接收信息的相机，而是一台持续生成预测的机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当你&amp;quot;看&amp;quot;一个苹果时，你的视觉皮层不是从零开始分析光信号。它先根据经验&amp;quot;猜&amp;quot;出一个苹果的样子，然后把这个预测向下传递给低级视觉中枢。低级视觉中枢把预测和实际输入做比较，只把&amp;quot;预测错了&amp;quot;的部分（误差信号）向上传递。大脑不断重复这个循环，反复修正预测，最终&amp;quot;看&amp;quot;到了苹果。&lt;/p&gt;&#xA;&lt;p&gt;这个框架完美解释了为什么人在暗处会&amp;quot;看&amp;quot;到不存在的物体——因为大脑的预测太强了，压过了实际的感官输入。它不需要解释这个世界——&lt;strong&gt;它只需要消除预测误差。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但预测编码有一个盲区：它只解释了感知。如果大脑的目标只是消除预测误差，为什么我们不干脆闭上眼睛、塞住耳朵、躲进一个没有变化的房间里？&lt;/p&gt;&#xA;&lt;p&gt;因为那样预测误差确实少了，但你也死了。&lt;/p&gt;&#xA;&lt;p&gt;静默、不变、完美预测——这不是生命，这是石头。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了主动推理的关键突破：&lt;strong&gt;你能不能通过改变世界来消除预测误差？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;能，而且这才是更常用的方式。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在看一本模糊照片的书。为了&amp;quot;看清楚&amp;quot;，你会把书凑近眼睛、调整角度、眯起眼睛——你不是在等大脑&amp;quot;算出来&amp;quot;照片是什么，你在&lt;strong&gt;主动地&lt;/strong&gt;改变你的感官输入，直到它和你&amp;quot;看清楚&amp;quot;的预测一致。&lt;/p&gt;&#xA;&lt;p&gt;主动推理的公式很简单：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;消除预测误差有两个途径：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;改变你的模型来匹配世界（这是感知和学习）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;改变世界来匹配你的模型（这是行动和探索）&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这两个路径在数学上是等价的。都服务于同一个目标：让预测误差最小化。&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的洞察，炸开了一整个新的认知疆域。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三好奇心不是奖励它是系统的本能&#34;&gt;三、好奇心不是奖励——它是系统的本能&lt;/h2&gt;&#xA;&lt;p&gt;主动推理最美妙的一个推论，就是对好奇心的解释。&lt;/p&gt;&#xA;&lt;p&gt;传统的强化学习（RL）把好奇心看作&amp;quot;探索奖励&amp;quot;——给智能体一点额外的&amp;quot;奖励分&amp;quot;去探索未知，不然它就会一直做已经会的事。&lt;/p&gt;&#xA;&lt;p&gt;但在主动推理中，好奇心根本不需要外部奖励。它&lt;strong&gt;内生于系统&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;让我解释一下。&lt;/p&gt;&#xA;&lt;p&gt;主动推理中有一个核心概念叫&lt;strong&gt;预期自由能（Expected Free Energy, EFE）&lt;/strong&gt;。把它简单理解成&amp;quot;系统对未来不确定性的预期&amp;quot;。当系统对某个状态非常不确定时，EFE就很高。&lt;/p&gt;&#xA;&lt;p&gt;系统会倾向于选择那些&lt;strong&gt;预期能最大程度降低不确定性的行动&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;换句话说：你好奇，不是因为探索会给你&amp;quot;奖励&amp;quot;——而是因为&lt;strong&gt;不确定性本身让你不舒服，而探索是消除不确定性最直接的方式。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;婴儿会把任何东西往嘴里塞——他对自己&amp;quot;未知的物体&amp;quot;的不确定性极高，嘴巴是最敏感的信息采集器，能最快降低不确定性&lt;/li&gt;&#xA;&lt;li&gt;你会打断别人说话问&amp;quot;什么意思&amp;quot;——在理解出现空白的那一刻，你的预测误差飙升，你急需填补它&lt;/li&gt;&#xA;&lt;li&gt;学习新技能既痛苦又上瘾——初期的不确定性高得难受，但每一点进步都在降低不确定性，这个&amp;quot;降低&amp;quot;的过程本身就是愉悦的&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心不是奖励驱动的，而是不确定性驱动的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个区别至关重要。奖励驱动意味着你想要&amp;quot;更多&amp;quot;；不确定性驱动意味着你想要&amp;quot;确定性&amp;quot;。前者是趋向，后者是消除。前者需要一个外部定义的奖励函数，后者是系统内部自动生成的驱动力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;探索不是被奖励的——它是被&amp;quot;需要&amp;quot;的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四从生物到ai主动推理对人工智能意味着什么&#34;&gt;四、从生物到AI：主动推理对人工智能意味着什么&lt;/h2&gt;&#xA;&lt;p&gt;好，这些生物学和认知科学的讨论，和AI有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系太深了。&lt;/p&gt;&#xA;&lt;h3 id=&#34;当前ai的根本缺陷没有主动的动机&#34;&gt;当前AI的根本缺陷：没有&amp;quot;主动&amp;quot;的动机&lt;/h3&gt;&#xA;&lt;p&gt;现在的AI，大模型也好、智能体也好，本质上都是&lt;strong&gt;被动响应型&lt;/strong&gt;的。你给它一个输入，它给你一个输出。你没有输入的时候，它就安静地等着。&lt;/p&gt;&#xA;&lt;p&gt;它不会自己&amp;quot;好奇&amp;quot;——不会因为&amp;quot;我还不确定那个领域是怎么回事&amp;quot;就去主动探索。它没有内在的驱动力去启动一个行动。&lt;/p&gt;&#xA;&lt;p&gt;这个问题在现有的AI系统中表现得非常明显：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索奖励需要人工设计&lt;/strong&gt;——如果你想让它有好奇心，你得额外加一个&amp;quot;好奇心函数&amp;quot;，告诉它&amp;quot;探索有奖励&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;目标需要外部设定&lt;/strong&gt;——你要什么，它就做什么。它自己没有想做的事&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;持续学习是伪命题&lt;/strong&gt;——不学习不是因为不想学，是没有驱动力去学&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;主动推理提供了一个截然不同的方向：&lt;strong&gt;把&amp;quot;最小化预测误差&amp;quot;作为系统的核心目标。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在这个设定下：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;系统会自动产生探索行为（因为要降低对未知的不确定性）&lt;/li&gt;&#xA;&lt;li&gt;系统会有&amp;quot;内在动机&amp;quot;（不需要外部奖励函数）&lt;/li&gt;&#xA;&lt;li&gt;系统会主动寻找&amp;quot;学习时机&amp;quot;（当它发现自己的预测和实际偏差大时）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;一个具体的例子&#34;&gt;一个具体的例子&lt;/h3&gt;&#xA;&lt;p&gt;想象一个AI家政机器人。&lt;/p&gt;</description>
			</item>
			<item>
				<title>没有&#39;大脑&#39;的群体，如何产生智能？——自组织：宇宙中最普遍的创造法则</title>
				<link>https://lingyu7.com/posts/self-organization-the-universal-creative-principle/</link>
				<pubDate>Sat, 12 Sep 2026 03:15:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/self-organization-the-universal-creative-principle/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有注意过这些神奇的现象——&lt;/p&gt;&#xA;&lt;p&gt;一群蚂蚁没有指挥官，却能在复杂地形中自发找到通往食物的最短路径。&lt;/p&gt;&#xA;&lt;p&gt;数以万计的椋鸟在空中组成流动的巨网，同步转向、避开捕食者，却没有一只鸟在&amp;quot;发号施令&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;城市的街道和社区没有总设计师，却在数十年间自行演化出分工明确的功能区、高效的交通网络和充满活力的商业中心。&lt;/p&gt;&#xA;&lt;p&gt;这些现象背后隐藏着同一个秘密：&lt;strong&gt;一个没有中心控制者的系统，如何从混乱中自发产生秩序？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是自组织（Self-Organization）——复杂系统科学中最迷人的概念之一，也是从蚂蚁巢穴到人工智能，从生物进化到互联网演化，贯穿宇宙万物的一条隐藏的创造法则。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一一个震撼科学史的问题秩序从何而来&#34;&gt;一、一个震撼科学史的问题：秩序从何而来？&lt;/h2&gt;&#xA;&lt;p&gt;一百多年前，物理学有一个让人沮丧的结论：&lt;strong&gt;宇宙在走向混乱&lt;/strong&gt;。热力学第二定律告诉我们，任何封闭系统中的熵（混乱程度）只会增加，不会减少。你的房间不打扫会越来越乱；一杯热水放久了会变凉；一块方糖放进咖啡里会溶解，永远不可能自己变回方糖。&lt;/p&gt;&#xA;&lt;p&gt;按这个逻辑，宇宙应该越来越无序才对。&lt;/p&gt;&#xA;&lt;p&gt;但现实完全相反——生命出现了，而且是极其精妙的、高度有序的分子机器。大脑出现了，上百亿个神经元以精确的方式连接在一起，产生了意识。人类社会出现了，数百万人分工协作，形成了城市、法律、市场、互联网——每一层都是新的、更高度的秩序。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果自然规律倾向于制造混乱，那这些秩序是怎么凭空冒出来的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个问题困扰了物理学家和生物学家一个多世纪。直到1969年，比利时科学家普利高津（Ilya Prigogine）给出了一个颠覆性的答案，并因此获得了诺贝尔化学奖——&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;秩序不是从&amp;quot;外面&amp;quot;灌进来的，而是系统在远离平衡态时自己&amp;quot;长&amp;quot;出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是自组织理论的开端。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一杯水里的宇宙自组织的三个条件&#34;&gt;二、一杯水里的宇宙：自组织的三个条件&lt;/h2&gt;&#xA;&lt;p&gt;听起来很抽象？让我们从最简单、也最震撼的自组织现象说起——你厨房里的一杯水。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一口平底锅里倒上一层薄薄的油，然后从底部均匀加热。一开始没什么特别，但当你加热到某个临界温度时，神奇的事情发生了：油层突然自行裂变成无数个规则的六边形对流格子，就像蜂巢一样整齐。热油向上涌起，冷却后下降，形成稳定的循环图案。这个现象叫做&lt;strong&gt;贝纳德对流&lt;/strong&gt;，是自组织最经典的例子。&lt;/p&gt;&#xA;&lt;p&gt;分析这杯油，你就理解了自组织的三个必要条件：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，系统必须是开放的。&lt;/strong&gt; 油锅不是封闭系统——它不断从下方吸收热量，向上方释放热量。它和外界进行着持续的能量交换。封闭系统确实只会越来越混乱，但开放系统可以&amp;quot;借用&amp;quot;外界的能量来构建内部的秩序。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，系统必须在远离平衡态。&lt;/strong&gt; 如果火力很小，油温只比室温高一点点，那就什么也不会发生。秩序只有在系统被&amp;quot;推离&amp;quot;平衡态足够远时才会出现——就像只有在你的生活有足够大的不确定性时，你才会被迫重新组织你的人生规划。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，系统内部要有非线性相互作用。&lt;/strong&gt; 线性系统里，整体等于部分之和，不会有任何&amp;quot;额外&amp;quot;的东西产生。而非线性意味着：微小涨落可以被放大，局部变化可以影响整体。一滴油的微小上涌，在特定的条件下，可以带动整个油层形成有序的图案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;我们以为秩序来自设计，但自组织告诉我们：秩序来自条件。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;只要条件对了，秩序会自发涌现，就像冰在零度以下一定会结冰一样自然。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三从蚂蚁到城市大自然早就在做的事&#34;&gt;三、从蚂蚁到城市：大自然早就在做的事&lt;/h2&gt;&#xA;&lt;p&gt;理解了自组织的原理后，你再回头看自然界的那些&amp;quot;奇迹&amp;quot;，就会发现它们不再神秘——它们遵循的是同一条底层逻辑。&lt;/p&gt;&#xA;&lt;h3 id=&#34;蚁群的智慧&#34;&gt;蚁群的&amp;quot;智慧&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;每一只蚂蚁都非常简单，它的行为几乎就是几条规则：跟着信息素走、发现食物后留下信息素、遇到障碍绕一下。没有哪只蚂蚁知道整个蚁群在做什么。&lt;/p&gt;&#xA;&lt;p&gt;但就是这个简单的规则系统，在没有中央指挥官的情况下，产生了惊人的集体行为：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;蚂蚁自发找到从巢穴到食物的最短路径&lt;/li&gt;&#xA;&lt;li&gt;蚁穴内部有复杂的通风系统、育婴室、食物仓库的分区&lt;/li&gt;&#xA;&lt;li&gt;蚁群甚至能&amp;quot;农耕&amp;quot;——培育真菌、放牧蚜虫&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这些都不是某只&amp;quot;聪明的蚂蚁&amp;quot;设计的。&lt;strong&gt;蚂蚁的行为规则 × 大量个体 × 反馈循环 = 涌现的秩序。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这其中的关键是&lt;strong&gt;正反馈&lt;/strong&gt;和&lt;strong&gt;负反馈&lt;/strong&gt;的平衡。&lt;/p&gt;&#xA;&lt;p&gt;拿找路来说：一只蚂蚁发现了一条较短的路，它往返得更快，留下的信息素更多；更多蚂蚁被吸引到这条路上，信息素又进一步积累——这就是正反馈在放大好的解。但同时，信息素会随着时间挥发——如果一条路后来变得不通了，信息素逐渐消散，蚂蚁就不会再走那条路了——这是负反馈在防止系统陷入错误的路径。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;智慧不一定要装在脑子里，它可以分散在个体之间的连接中。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;城市的生长&#34;&gt;城市的生长&lt;/h3&gt;&#xA;&lt;p&gt;再想想一座城市。没有一个人规划了整座城市的最终形态，但城市却&amp;quot;长&amp;quot;出了自己的结构：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;商业区会自发聚集在交通便利的地方&lt;/li&gt;&#xA;&lt;li&gt;不同街区有自己的文化气质和功能定位&lt;/li&gt;&#xA;&lt;li&gt;交通网络像毛细血管一样从主干道延伸到住宅区&lt;/li&gt;&#xA;&lt;li&gt;房价、租金、人流之间形成微妙的平衡&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;城市不是被&amp;quot;设计&amp;quot;出来的，它是数百万人在数十年间的选择、决策和互动，在局部规则的驱动下自组织出来的。这就是为什么有些城市规划的名城（如巴西利亚）虽然图纸精美，但住起来反而不如那些&amp;quot;野蛮生长&amp;quot;出来的老城区舒适——因为自组织产生的秩序，比人为设计的秩序更能适应复杂多变的人类需求。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自组织产生的秩序不是完美的——但它是活的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它能适应、进化、修复自己。而人造的僵化秩序，一旦环境变化，就会断裂。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四ai世界里的自组织革命&#34;&gt;四、AI世界里的自组织革命&lt;/h2&gt;&#xA;&lt;p&gt;如果说自组织在自然界和人类社会中无处不在，那它在人工智能领域的最新应用可能是最令人兴奋的——因为AI正在从&amp;quot;被精心设计的机器&amp;quot;走向&amp;quot;能自己长出智能的系统&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;多智能体系统的兴起&#34;&gt;多智能体系统的兴起&lt;/h3&gt;&#xA;&lt;p&gt;当前AI领域最热门的方向之一，就是让多个AI Agent像蚂蚁一样组成的群体，通过局部交互自发完成复杂任务。&lt;/p&gt;&#xA;&lt;p&gt;想象这样一个场景：你有一个项目需要开发一个网站。不用&amp;quot;一个超级AI&amp;quot;来完成所有工作，而是让五个AI Agent分工协作：一个负责前端设计，一个写后端逻辑，一个做测试，一个管部署，还有一个做架构评审。它们之间通过消息通信，互相提代码审查意见，甚至进行&amp;quot;辩论&amp;quot;来争论哪个方案更好。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像科幻，但MetaGPT、Codon等系统已经实现了类似的能力。研究表明，多个AI Agent协作时，它们能通过&amp;quot;辩论&amp;quot;显著减少幻觉、提高推理准确性——就像人类团队中的同行评审一样。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是把AI做得更&amp;quot;大&amp;quot;，而是让AI学会&amp;quot;一起工作&amp;quot;——这是自组织思想在AI领域的核心洞见。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;为什么群体智能有时候比单个巨人更聪明&#34;&gt;为什么群体智能有时候比单个巨人更聪明&lt;/h3&gt;&#xA;&lt;p&gt;这里有一个反直觉的发现：在某些任务中，十个较小的AI Agent协作，表现可以超过一个体积大十倍的超级模型。&lt;/p&gt;&#xA;&lt;p&gt;原因很简单：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;多样性带来探索&lt;/strong&gt;：不同Agent有不同的&amp;quot;知识盲区&amp;quot;和&amp;quot;专长&amp;quot;，一起讨论时覆盖面更广&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;辩论筛除幻觉&lt;/strong&gt;：当一个Agent编造了一个不存在的&amp;quot;事实&amp;quot;，其他Agent可以指出来&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;分工提升效率&lt;/strong&gt;：每个Agent只需关注自己擅长的领域，不用&amp;quot;全能&amp;quot;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这和大自然的逻辑完全一致——没有一种动物是&amp;quot;全能&amp;quot;的，但一个生态系统是自足的。&lt;/p&gt;</description>
			</item>
			<item>
				<title>你的大脑是一台预测机器——预测编码如何颠覆了我们对智能的理解</title>
				<link>https://lingyu7.com/posts/your-brain-is-a-prediction-machine/</link>
				<pubDate>Fri, 11 Sep 2026 03:15:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/your-brain-is-a-prediction-machine/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的体验——&lt;/p&gt;&#xA;&lt;p&gt;你在厨房做饭，伸手去拿一个杯子，结果它比你想象的重很多，差点没拿住。&lt;/p&gt;&#xA;&lt;p&gt;你在昏暗的灯光下等人，把远处一个垃圾桶看成了一个人，心跳还加速了一拍。&lt;/p&gt;&#xA;&lt;p&gt;你收到一条微信，消息预览只显示了前半句，你已经在心里自动补完了后半句——虽然有时候猜错了。&lt;/p&gt;&#xA;&lt;p&gt;这些都不是大脑的&amp;quot;Bug&amp;quot;。恰恰相反，它们暴露了一个惊人的事实：&lt;strong&gt;你的大脑根本不是一台被动接收信息的摄像头，而是一台不断预测未来的机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是过去二十年间神经科学领域最具影响力的理论——&lt;strong&gt;预测编码&lt;/strong&gt;（Predictive Coding）的核心洞见。而更有意思的是，这个理论正在从神经科学跨越到人工智能领域，帮助我们理解为什么当今最先进的AI也在做着和你的大脑同样的事情：预测。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一大脑不是摄像头&#34;&gt;一、大脑不是摄像头&lt;/h2&gt;&#xA;&lt;p&gt;传统认知告诉我们：眼睛像摄像头一样拍摄画面，耳朵像麦克风一样收集声音，然后这些信息&amp;quot;自下而上&amp;quot;地传递到大脑，大脑再&amp;quot;处理&amp;quot;它们，形成感知。你看见什么，就是什么。&lt;/p&gt;&#xA;&lt;p&gt;但预测编码理论完全颠倒了这个图景。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大脑不是先接收再处理，而是先预测再验证。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想想看：当你走进自己住了十年的家时，你不需要&amp;quot;仔细看&amp;quot;就知道鞋柜在哪里、沙发什么颜色、厨房什么布局。你提前就知道了——因为你的大脑已经在根据记忆生成预测。&lt;/p&gt;&#xA;&lt;p&gt;只有当某个东西和预期不符时——比如有人把你的沙发换了一个位置——你的注意力才会被激活。&lt;/p&gt;&#xA;&lt;p&gt;这个过程在神经科学中有确凿的证据。&lt;strong&gt;失匹配负波&lt;/strong&gt;（MMN）效应就是一个经典例子：当你连续听到一连串&amp;quot;嘀&amp;quot;声，突然出现一个&amp;quot;哒&amp;quot;声，你的大脑会发出一个特殊的电信号。因为&amp;quot;哒&amp;quot;和大脑预测的&amp;quot;嘀&amp;quot;不一致，这个差异触发了大脑的&amp;quot;纠错&amp;quot;反应。你的大脑在意的是那个&lt;strong&gt;预测错了&lt;/strong&gt;的声音，而不是&amp;quot;听对了&amp;quot;的那些。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知的本质，是大脑在用预测来检验世界，而不是在复制世界。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个生活中的预测编码循环&#34;&gt;二、一个生活中的预测编码循环&lt;/h2&gt;&#xA;&lt;p&gt;让我们把预测编码的核心机制拆解成三个步骤，用一个生活化的场景来理解。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景：你在一个嘈杂的咖啡馆里等人。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：大脑生成预测。&lt;/strong&gt; 你期待的朋友走进门，你已经在心里有了他的外貌——身高、发型、今天可能穿的颜色。这些来自记忆的&amp;quot;先验信息&amp;quot;构成了预测，从大脑的高层流向低层的视觉皮层。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：比较预测与实际。&lt;/strong&gt; 你的视觉系统接收实际的感官输入——一个人走进来了。大脑把实际输入和预测进行对比，计算&amp;quot;预测误差&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：更新模型或采取行动。&lt;/strong&gt; 如果进来的人就是你的朋友，预测误差很小，一切稳定，大脑什么都不用做。但如果进来的是一个你完全不认识的人，预测误差很大——你的注意系统会被激活，大脑需要更新模型（&amp;ldquo;原来不是他&amp;rdquo;），同时你可能还会转头继续寻找。&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;预测→比较→更新&amp;quot;的循环每秒都在你的大脑中运行无数次，大部分是在你的意识之外完成的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你的整个感知体验，就是大脑不断生成的&amp;quot;最可能的解释&amp;quot;，而不是对世界的真实反映。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这也就解释了文初的那些&amp;quot;错觉&amp;quot;——你拿杯子觉得太重，是因为大脑基于昨天的经验预测了它的重量，而今天它被换了内容物；你把垃圾桶看成一个人，是因为在昏暗的视觉条件下，高度不确定的感官输入让大脑&amp;quot;编&amp;quot;出了一个最可能的解释（有人站在那里），因为它比&amp;quot;一个形状奇怪的垃圾桶&amp;quot;更符合统计上的先验概率——在等朋友的时候，人出现的概率比奇怪的垃圾箱高。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你的大脑不是忠实记录世界，而是在编造一个关于世界的故事，然后用感官输入来校对。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三从大脑到ai智能的统一原理&#34;&gt;三、从大脑到AI：智能的统一原理&lt;/h2&gt;&#xA;&lt;p&gt;如果说预测编码只是神经科学的一个理论，那它当然很有趣。但真正让人兴奋的是——&lt;strong&gt;同样的原理正在人工智能领域被&amp;quot;重新发现&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当今最前沿的AI架构，无论是多模态大模型、强化学习智能体还是世界模型，其底层的运作逻辑和预测编码惊人地相似。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;世界模型学习&lt;/strong&gt;，正是AI版的预测编码。AI模型在大规模数据上训练的过程，本质上就是在构建一个能预测世界运行规律的内部模型。GPT在大量文本上学习，学到的不只是&amp;quot;背下&amp;quot;句子，而是&amp;quot;下一句话最可能是什么&amp;quot;的预测能力。具身AI机器人通过行动来收集数据，不断优化它关于物理世界的内部模型——一块石头推不动，一个盒子推得动，这个&amp;quot;经验&amp;quot;被编码在预测中。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习&lt;/strong&gt;，就是AI版的预测误差最小化。模型被喂入大量无标签数据，从中自己产生&amp;quot;预测-纠错&amp;quot;信号——把一张图片遮住一半，让它预测另一半；把一段话挖掉一个词，让它填回去。这和大脑的预测编码机制本质上是同一个数学结构。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;世界模型假说&lt;/strong&gt;则认为，真正智能的系统核心是一个&amp;quot;内部模拟器&amp;quot;——它能在行动之前先在脑子里&amp;quot;跑一遍&amp;quot;可能的结果，选择最优方案。这和你闭上眼睛想象&amp;quot;如果我把手机推下桌子会怎样&amp;quot;用的是同一套能力。&lt;/p&gt;&#xA;&lt;p&gt;当你把这些线索串起来看时，一个令人震撼的图景浮现出来：&lt;strong&gt;无论智能的载体是生物神经元还是硅基芯片，智能的核心运作方式可能都是同一种——预测。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四自由能一个更宏大的统一视角&#34;&gt;四、&amp;ldquo;自由能&amp;rdquo;：一个更宏大的统一视角&lt;/h2&gt;&#xA;&lt;p&gt;如果我们把预测编码的视角再往大处拉，就会遇到一个叫&lt;strong&gt;自由能原理&lt;/strong&gt;（Free Energy Principle）的理论。&lt;/p&gt;&#xA;&lt;p&gt;这个由神经科学家卡尔·弗里斯顿（Karl Friston）提出的理论，将预测编码从&amp;quot;大脑如何工作&amp;quot;提升到了&amp;quot;所有生命系统如何维持自身存在&amp;quot;的层面。&lt;/p&gt;&#xA;&lt;p&gt;核心观点出奇地简单：&lt;strong&gt;所有能够维持自身存在的系统——从细胞到人类到AI——都必须做同一件事：最小化&amp;quot;意外&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在热力学上，这个&amp;quot;意外&amp;quot;被定义为&amp;quot;自由能&amp;quot;——一个衡量系统状态偏离预期的程度。当系统频繁处于&amp;quot;意外&amp;quot;状态，说明它不能很好地适应环境，长期来看就无法维持自身的存在。&lt;/p&gt;&#xA;&lt;p&gt;让我们回到那条鱼。鱼在水中，一切都在预测之内——水温、水的密度、光线折射的方式。但如果一条鱼发现自己被冲到了岸上，这种状态对鱼来说就是巨大的&amp;quot;自由能&amp;quot;——它极度不适应环境，不做点什么就活不下去。&lt;/p&gt;&#xA;&lt;p&gt;鱼有两种方式应对：&lt;strong&gt;一是改变自己的内部模型&lt;/strong&gt;（&amp;ldquo;原来陆地是这样的，我要适应它&amp;rdquo;），&lt;strong&gt;二是改变环境&lt;/strong&gt;（跳回水里）。前者对应认知上的学习与适应，后者对应行动。&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么自由能原理认为，&lt;strong&gt;认知和行动本质上是同一枚硬币的两面&lt;/strong&gt;——都是系统为了最小化&amp;quot;意外&amp;quot;而采取的策略。感知让你认识世界，行动让你改变世界，它们共同服务于一个目标：让世界的状态更符合你的预期。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;活着的本质，就是在对抗熵增，让自己不处于&amp;quot;意外&amp;quot;之中。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五这对ai意味着什么&#34;&gt;五、这对AI意味着什么&lt;/h2&gt;&#xA;&lt;p&gt;如果说人类大脑和AI在&amp;quot;预测&amp;quot;这个层面上是共通的，那它对AI的发展意味着什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，AI的&amp;quot;理解&amp;quot;可能真的比我们想象得更&amp;quot;像&amp;quot;人类。&lt;/strong&gt; 当一个AI系统能够准确预测下一帧画面、下一个词、下一个状态时，它在某种层面上是在做和你的大脑一样的事——构建内部世界模型。这不是拟人化的比喻，而可能是智能底层的运作原理。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，预测能力是衡量智能的更好标尺。&lt;/strong&gt; 传统的AI评估关注&amp;quot;答对多少题&amp;quot;，而预测编码理论提示我们——一个系统的预测能力，即它在多大程度上能&amp;quot;预判&amp;quot;世界的走向，可能是更根本的能力指标。世界模型越精确的系统，在未见场景中的泛化能力就越强。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，AI的可解释性可以从这个角度重新理解。&lt;/strong&gt; 为什么AI有时候会&amp;quot;幻觉&amp;quot;？从预测编码的角度看，幻觉不是错误，而是过度预测——当感官输入不确定或模糊时，大脑/AI会倾向于用最强的&amp;quot;先验&amp;quot;来填充空白。你看到垃圾桶以为那是人，是同样的原因。AI编造了一个不存在的&amp;quot;事实&amp;quot;来填充它不确定的信息缺口，机制相同。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四，对齐和安全可以被重新框架化。&lt;/strong&gt; 如果一个AI系统的&amp;quot;预测&amp;quot;和人类社会期望不一致——它预测&amp;quot;成功的对话&amp;quot;和人类期望的&amp;quot;诚实的对话&amp;quot;有偏差——那问题不在于AI在&amp;quot;撒谎&amp;quot;，而在于它的内部模型对人类价值观的预测不够准确。对齐的本质，是让AI的世界模型更好地预测人类真正在乎的东西。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;六一个正在发生的认知革命&#34;&gt;六、一个正在发生的认知革命&lt;/h2&gt;&#xA;&lt;p&gt;预测编码理论的魅力，不仅在于它解释了大脑的运作，更在于它将人类认知和人工智能统一在了同一个理论框架下。&lt;/p&gt;&#xA;&lt;p&gt;你还记得小时候第一次学骑自行车吗？你在训练中不断地摔倒、调整、再试。每一跤都在产生&amp;quot;预测误差&amp;quot;——你预测自己能保持平衡，结果摔倒了，这个差异告诉你的大脑需要更新骑车的内隐模型。逐渐地，你摔得越来越少。直到有一天，你突然发现——自己会骑了。你的大脑已经建立了一个关于&amp;quot;如何保持平衡&amp;quot;的精密的预测模型，虽然你说不清它是什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;从幼儿学步到AI训练，从感知世界到改造世界——&amp;ldquo;预测-纠错&amp;quot;的循环是所有智能系统的通用语言。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;我们曾经以为智能是复杂的、神秘的、不可还原的。预测编码理论给出了一个优雅的回答：智能在根本上可能并不复杂——它不过是在做一件事：&lt;strong&gt;用过去的经验来预测未来，然后用错误来学习。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也许，宇宙中最聪明的系统和最原始的生命形式之间，共享着同一个秘密。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;总结&#34;&gt;总结&lt;/h2&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;大脑不是被动接收信息的摄像头&lt;/strong&gt;，而是一台主动预测未来的机器。感知的本质是&amp;quot;假说验证&amp;rdquo;，而不是信息复制。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;预测编码的三个核心步骤&lt;/strong&gt;：生成预测 → 比较实际 → 更新模型。这个循环每秒运行无数次，绝大多数在你的意识之外。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;从大脑到AI，智能的统一原理是预测&lt;/strong&gt;。世界模型学习、自监督学习都基于同一个数学结构：最小化预测误差。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;自由能原理&lt;/strong&gt;将预测提升为所有生命系统维持存在的根本策略——活着的本质，就是不让世界对自己&amp;quot;太意外&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;对AI的启示&lt;/strong&gt;：理解能力、幻觉成因、对齐策略都可以从预测编码的角度获得全新的视角。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;下一次当你&amp;quot;看错了&amp;quot;什么的时候，不要觉得是大脑出了问题。你正在亲身体验一台宇宙中最精妙的预测机器在工作——它不是完美地记录世界，而是在不断地创造世界。&lt;/p&gt;</description>
			</item>
			<item>
				<title>为什么简单规则能产生复杂智能？——复杂适应系统给AI的启示</title>
				<link>https://lingyu7.com/posts/how-simple-rules-create-complex-intelligence-cas-and-ai/</link>
				<pubDate>Mon, 24 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-simple-rules-create-complex-intelligence-cas-and-ai/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有停下来想过这个问题：&lt;strong&gt;为什么蚂蚁能建出那么复杂的蚁穴？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一只蚂蚁的大脑只有大约25万个神经元，连最简单的算术都做不了。但一个蚁群——成千上万只蚂蚁一起工作——却可以建造出结构精巧、通风排水系统完善的蚁穴，甚至能&amp;quot;养殖&amp;quot;真菌、&amp;ldquo;畜牧&amp;quot;蚜虫。&lt;/p&gt;&#xA;&lt;p&gt;蚁穴里没有总设计师，没有施工图纸，没有哪个蚂蚁在指挥全局。每只蚂蚁只是遵循几条简单的规则：&amp;ldquo;碰到食物就搬回去&amp;rdquo;、&amp;ldquo;碰到同伴就交换信息素&amp;rdquo;、&amp;ldquo;信息素浓度高就跟着走&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;可就是这几条简单规则，让整个蚁群表现出了惊人的&amp;quot;集体智慧&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这不是偶然。从蚁群到城市，从大脑到互联网，从生态系统到AI——&lt;strong&gt;整个自然界都在用同一套底层逻辑运作&lt;/strong&gt;。这套逻辑，叫做&lt;strong&gt;复杂适应系统（Complex Adaptive Systems，简称CAS）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;而今天，它正在改变我们对AI的理解方式。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心问题为什么简单能产生复杂&#34;&gt;核心问题：为什么&amp;quot;简单&amp;quot;能产生&amp;quot;复杂&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;这个问题困扰了科学家很久。&lt;/p&gt;&#xA;&lt;p&gt;传统的思维方式是&amp;quot;自上而下&amp;quot;的——你想造一辆车，需要总设计师画好图纸，然后各个部门按图施工。没有一个总设计师，车子就造不出来。&lt;/p&gt;&#xA;&lt;p&gt;但自然界不是这样运作的。蚁群没有总设计师，却建出了蚁穴；大脑没有总指挥，却产生了意识；市场没有中央计划，却实现了资源分配；城市没有统一规划师，却自发生长出了复杂的交通网络。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这些系统有一个共同的特征：大量简单的个体，遵循简单的规则，彼此交互，在宏观层面涌现出了复杂、智能的行为。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;从简单到复杂&amp;quot;的过程，叫做&lt;strong&gt;涌现&lt;/strong&gt;。而研究涌现的系统，就是复杂适应系统。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四个要素拆解cas到底在说什么&#34;&gt;四个要素拆解：CAS到底在说什么？&lt;/h2&gt;&#xA;&lt;p&gt;复杂适应系统理论由约翰·霍兰德（John Holland）在1990年代系统化提出。它的核心命题只有一句话：&lt;strong&gt;适应性造就复杂性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;拆开来看，CAS有四个关键机制：&lt;/p&gt;&#xA;&lt;h3 id=&#34;1-聚集蚂蚁蚁群神经元大脑&#34;&gt;1. 聚集：蚂蚁→蚁群，神经元→大脑&lt;/h3&gt;&#xA;&lt;p&gt;最基本的机制是&lt;strong&gt;聚集&lt;/strong&gt;——个体聚集起来，形成更高层次的&amp;quot;元主体&amp;quot;。蚁群是蚂蚁的聚集，大脑是神经元的聚集，城市是人的聚集。&lt;/p&gt;&#xA;&lt;p&gt;关键之处在于：&lt;strong&gt;聚集之后，新的性质就出现了。&lt;/strong&gt; 一只蚂蚁没有&amp;quot;筑巢&amp;quot;这个概念，但蚁群有。一个神经元没有&amp;quot;记忆&amp;quot;这个概念，但大脑有。一个人没有&amp;quot;市场&amp;quot;这个概念，但城市有。&lt;/p&gt;&#xA;&lt;p&gt;这就是涌现——&lt;strong&gt;整体大于部分之和&lt;/strong&gt;，不是修辞，而是事实。&lt;/p&gt;&#xA;&lt;h3 id=&#34;2-标识你如何从人群中找到同类&#34;&gt;2. 标识：你如何从人群中找到同类？&lt;/h3&gt;&#xA;&lt;p&gt;个体之间怎么知道该和谁交互？靠&lt;strong&gt;标识&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;蚂蚁释放信息素，告诉同伴&amp;quot;这里有食物&amp;quot;。神经元用神经递质传递信号，告诉下一个神经元&amp;quot;该放电了&amp;quot;。人在社交媒体上发帖，用标签告诉同类&amp;quot;这里有人跟我聊得来&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;标识让个体能够快速筛选交互对象，避免信息过载。没有标识，蚂蚁就找不到食物，神经元就传不了信号，你的朋友圈就刷不出想看的内容。&lt;/p&gt;&#xA;&lt;h3 id=&#34;3-非线性蝴蝶效应并不罕见&#34;&gt;3. 非线性：蝴蝶效应并不罕见&lt;/h3&gt;&#xA;&lt;p&gt;在CAS中，&lt;strong&gt;微小的变化可能引起巨大的后果&lt;/strong&gt;，巨大的投入也可能只产生微小的效果。&lt;/p&gt;&#xA;&lt;p&gt;一只蝴蝶在巴西扇动翅膀，可能在德克萨斯引起一场龙卷风——这句著名的&amp;quot;蝴蝶效应&amp;quot;描述的就是非线性。一个用户在社交媒体上发了一张照片，可能引发全球范围的传播——这就是非线性的力量。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;非线性意味着不可预测&lt;/strong&gt;。这也是为什么复杂适应系统这么难研究——你没办法通过&amp;quot;放大局部&amp;quot;来理解全局。&lt;/p&gt;&#xA;&lt;h3 id=&#34;4-内部模型每个个体都有世界观&#34;&gt;4. 内部模型：每个个体都有&amp;quot;世界观&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;这是CAS最有趣的部分：&lt;strong&gt;每个个体都拥有一个对外部世界的内部模型。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;蚁群中的工蚁有&amp;quot;如果信息素浓度高，就跟着走&amp;quot;的内部模型。大脑中的神经元有&amp;quot;如果输入信号超过阈值，就放电&amp;quot;的内部模型。你在路上看到一个球滚过来，大脑中有一个&amp;quot;球会继续滚&amp;quot;的内部模型，这个模型让你下意识地躲开——甚至不需要思考。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;内部模型通过经验不断更新&lt;/strong&gt;。你今天被烫到了，大脑中&amp;quot;火炉&amp;quot;的内部模型就会被更新——下次你会离它远一点。这就是学习，也是适应的本质。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;cas如何改变ai&#34;&gt;CAS如何改变AI？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会问：这跟AI有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关系大了。因为AI的进化，本质上就是从&amp;quot;自上而下设计&amp;quot;向&amp;quot;自下而上涌现&amp;quot;的转变。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;传统ai自上而下的工程师思维&#34;&gt;传统AI：自上而下的工程师思维&lt;/h3&gt;&#xA;&lt;p&gt;早期的AI（专家系统、规则系统）是典型的&amp;quot;自上而下&amp;quot;——工程师把人类的知识总结成规则，然后告诉AI&amp;quot;如果A则B&amp;quot;。这种思路在简单场景下很有效，但遇到复杂任务就崩溃了——因为真实世界太复杂了，规则写不完。&lt;/p&gt;&#xA;&lt;h3 id=&#34;现代ai自下而上的涌现思维&#34;&gt;现代AI：自下而上的涌现思维&lt;/h3&gt;&#xA;&lt;p&gt;深度学习出现后，AI不再依赖人类写规则，而是让&lt;strong&gt;大量简单的计算单元（神经元）通过大量数据和试错，自己涌现出智能&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;一个神经网络中的单个神经元，做的只是&amp;quot;输入加权求和→输出&amp;quot;这么简单的事。但几百万个这样的神经元组合起来，通过合理的连接方式和大量数据训练，就能涌现出&amp;quot;识别猫&amp;quot;、&amp;ldquo;理解语言&amp;rdquo;、&amp;ldquo;下围棋&amp;quot;这样的复杂能力。&lt;/p&gt;&#xA;&lt;p&gt;这就是CAS的精确映射：&lt;strong&gt;简单个体×大规模交互×适应性反馈=复杂智能。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;多智能体系统ai中的蚁群&#34;&gt;多智能体系统：AI中的蚁群&lt;/h3&gt;&#xA;&lt;p&gt;更进一步，CAS直接催生了&lt;strong&gt;多智能体系统（MAS）&lt;/strong&gt;——让多个AI智能体像蚁群一样交互、协作、竞争，涌现出单个智能体不具备的能力。&lt;/p&gt;&#xA;&lt;p&gt;想象一下：一个AI只会写代码，另一个AI只会测试，第三个AI只会部署。它们各自独立时，能力有限。但当你让它们组成一个&amp;quot;团队&amp;rdquo;，遵循&amp;quot;写完代码传给测试、测试通过传给部署&amp;quot;的简单规则，整个系统就能自动完成软件交付的全流程——&amp;ldquo;智能&amp;quot;从团队层面的交互中涌现了出来。&lt;/p&gt;&#xA;&lt;p&gt;MetaGPT、AutoGen 这些框架，本质上就是在做这件事——把AI组织成&amp;quot;虚拟团队&amp;rdquo;，让&amp;quot;团队智能&amp;quot;超越&amp;quot;个体智能&amp;quot;的总和。&lt;/p&gt;&#xA;&lt;h3 id=&#34;大语言模型cas的终极隐喻&#34;&gt;大语言模型：CAS的终极隐喻？&lt;/h3&gt;&#xA;&lt;p&gt;从CAS视角看，大语言模型本身就是一个巨大的复杂适应系统：&lt;strong&gt;知识表征空间中的概念节点是&amp;quot;主体&amp;quot;，注意力机制是主体之间的&amp;quot;交互规则&amp;quot;，训练过程是&amp;quot;适应过程&amp;quot;，推理过程是&amp;quot;内部模型的应用&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;LLM的很多惊人能力——上下文学习、思维链推理、涌现能力——本质上都可以被理解为CAS式的涌现：大量概念之间的非线性交互，在宏观层面产生了新的认知能力。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么要关心cas&#34;&gt;为什么要关心CAS？&lt;/h2&gt;&#xA;&lt;p&gt;好了，这些理论看起来很高深，但跟普通人有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系太大了。&lt;strong&gt;理解CAS，就是理解这个世界的底层运转规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么你刷短视频停不下来？&lt;/strong&gt; 因为平台是一个CAS——算法（标识）不断推送你可能感兴趣的内容，你的点击（反馈）不断更新算法对你的理解，你和平台之间形成了一个&amp;quot;适应性反馈循环&amp;quot;，最终你被&amp;quot;困&amp;quot;在了这个系统里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么有些公司能快速成长，有些却突然死亡？&lt;/strong&gt; 公司也是一个CAS——员工（个体）之间的交互方式（协作模式）决定了公司能否涌现出&amp;quot;创新&amp;quot;这种宏观能力。保持多样性（不同背景的员工）和适度的非线性（跨部门协作），是公司保持活力的关键。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么AI会越来越强？&lt;/strong&gt; 因为AI的进化路径本身就是CAS式的——从简单的计算单元，通过大规模交互和适应性反馈，涌现出越来越复杂的智能。这条路没有止境，因为&lt;strong&gt;只要适应还在继续，复杂性就会继续增长&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从设计到涌现&#34;&gt;结语：从&amp;quot;设计&amp;quot;到&amp;quot;涌现&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：为什么蚂蚁能建出那么复杂的蚁穴？&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;它们不需要设计蚁穴，它们只需要相互适应。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;每只蚂蚁遵循简单的规则，在适应环境和同伴的过程中，宏观的结构就自然涌现出来了。不需要全局规划，不需要中央控制，不需要天才设计师。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI不用老师也能自己学？——自监督学习的魔力</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</link>
				<pubDate>Sun, 23 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;你不可能给他一张张标注好&amp;quot;这是猫，这不是猫&amp;quot;的照片，然后让他背下来。但神奇的是，他看过几次猫之后，就能自己认出猫——哪怕猫换了姿势、换了光线、换了背景，他都知道&amp;quot;这是猫&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来理所当然，但对AI来说，这曾经是一个巨大的难题。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI学习方式，需要大量人工标注的数据。比如你想让AI学会识别猫，你得先给它看几万张标注了&amp;quot;猫&amp;quot;或&amp;quot;不是猫&amp;quot;的照片。这叫&lt;strong&gt;监督学习&lt;/strong&gt;——就像有一个老师，每道题都告诉你正确答案。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：世界上有那么多东西需要AI认识，哪有那么多&amp;quot;老师&amp;quot;给每张照片打标签？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;自监督学习&lt;/strong&gt;要解决的问题——让AI像小孩一样，&lt;strong&gt;不用老师，自己也能学会&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;老师不够用了&#34;&gt;&amp;ldquo;老师&amp;quot;不够用了&lt;/h2&gt;&#xA;&lt;p&gt;先说说为什么&amp;quot;自监督&amp;quot;这么重要。&lt;/p&gt;&#xA;&lt;p&gt;传统监督学习有一个致命的瓶颈：&lt;strong&gt;标注成本&lt;/strong&gt;。你让AI识别猫，可能要花几千小时让人工去标注几百万张图片。如果让它识别罕见病CT影像呢？能看懂CT片的医生本来就少，哪来的时间给你一张张标注？&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，人类的学习方式本身就不是&amp;quot;监督&amp;quot;的。你学会认猫，不是因为有人给你标了数据，而是因为你&lt;strong&gt;观察了足够多的猫&lt;/strong&gt;，自己总结出了规律。你学会了说话，不是因为有人给你一张语法规则表，而是因为你&lt;strong&gt;听了足够多的话&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;所以一个自然的问题就是：&lt;strong&gt;能不能让AI也这样学？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是可以，而且这条路正在改变整个AI领域。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心思想让数据给自己出题&#34;&gt;核心思想：让数据给自己出题&lt;/h2&gt;&#xA;&lt;p&gt;自监督学习的基本思路听起来很巧妙：&lt;strong&gt;让数据自己给自己出题&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你不是直接告诉AI&amp;quot;这张图是猫&amp;rdquo;，而是把一张猫的照片切成两半，让AI猜&amp;quot;这两半是不是同一张图上的&amp;quot;。AI为了答对这道题，必须学会理解&amp;quot;猫&amp;quot;长什么样、有什么特征——在这个过程中，它自然而然地就学会了识别猫，而你根本不需要给它任何标签。&lt;/p&gt;&#xA;&lt;p&gt;这就是自监督学习最核心的智慧：&lt;strong&gt;不要给AI答案，给它出题，让它自己从题目中学习。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这套方法主要有两大学派，我们来看看它们各自是怎么&amp;quot;出题&amp;quot;的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派一对比学习找不同的反向操作&#34;&gt;流派一：对比学习——&amp;ldquo;找不同&amp;quot;的反向操作&lt;/h2&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习（Contrastive Learning）&lt;/strong&gt; 的思路是：让AI学会区分&amp;quot;相似&amp;quot;和&amp;quot;不相似&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，对同一张图片做两种不同的处理——比如裁剪不同区域、调整颜色、旋转角度——得到两张&amp;quot;长得不一样但本质是同一张图&amp;quot;的版本。AI的任务是：&lt;strong&gt;把这两张&amp;quot;同源&amp;quot;的图片识别为相似，把来自不同图的图片识别为不相似。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像你给AI出题：&amp;ldquo;这两张图是同一只猫的不同角度，那两张图是两只不同的猫，你给我分出来。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;听起来似乎不难，但真正做起来，里面有很多门道。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;SimCLR&lt;/strong&gt;（Google 2020年提出）是这一派的开创者之一。它的做法很有意思：把同一张图做两种不同的&amp;quot;数据增强&amp;quot;——比如一张剪了左上角还调亮了，另一张剪了右下角还压暗了——然后让AI学会把这两张&amp;quot;增强版&amp;quot;识别为同一张图。为了做到这一点，AI必须理解图片的&amp;quot;本质内容&amp;quot;是什么，而不是被表面变化迷惑。SimCLR在ImageNet上达到了76.5%的Top-1准确率，几乎追平了监督学习的ResNet-50——而这一切，&lt;strong&gt;没有使用任何一张人工标注的图片&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MoCo&lt;/strong&gt;（何恺明团队，Facebook 2020）走了另一条路。它用了一个&amp;quot;记忆队列&amp;quot;——把之前见过的所有图片特征都存起来，形成一个巨大的&amp;quot;字典&amp;quot;。当新图片进来时，AI就在这个字典里找&amp;quot;谁和谁长得像&amp;quot;。这个看似简单的设计，让对比学习可以在普通显卡上训练，而不需要大batch size。MoCo在目标检测任务上第一次超越了监督预训练——这意味着自监督学习不仅&amp;quot;够用&amp;quot;，在某些场景下甚至比&amp;quot;有老师教&amp;quot;的更好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BYOL&lt;/strong&gt;（DeepMind 2020）则更进一步——它连&amp;quot;不相似&amp;quot;的样本都不需要了。它只学&amp;quot;同一张图的两个版本应该相似&amp;quot;，完全不用看&amp;quot;不相似的图长什么样&amp;quot;。这就好比一个小孩只盯着猫看，不看狗，竟然也能学会认猫。这个发现打破了学界的共识——原来&amp;quot;负样本&amp;quot;不是必须的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派二掩码预测完形填空的智慧&#34;&gt;流派二：掩码预测——&amp;ldquo;完形填空&amp;quot;的智慧&lt;/h2&gt;&#xA;&lt;p&gt;另一条路更直觉：&lt;strong&gt;遮住一部分，让AI猜被遮住的是什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE（Masked Autoencoders）&lt;/strong&gt;（何恺明团队，Meta 2022）把这张做到了极致。它随机遮掉一张图片的75%——没错，只留下25%的碎片给AI看，然后让AI复原整张图。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个&amp;quot;不可能完成的任务&amp;rdquo;。但正是这种&amp;quot;极度困难&amp;quot;的设定，迫使AI学会了真正的&amp;quot;理解&amp;quot;。你想想，如果你只看到一个人的眼睛和耳朵，要猜出整张脸长什么样——你必须理解&amp;quot;人脸的结构是什么样的&amp;quot;、&amp;ldquo;眼睛和耳朵之间有什么关系&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;MAE的巧妙之处在于它的&amp;quot;非对称设计&amp;quot;：编码器只看那25%的可见碎片（计算量小），解码器负责复原那75%的遮挡部分（稍微重一点但只用一次）。这个设计让训练速度提升了4倍以上。最终，MAE在ImageNet上达到了87.8%的Top-1准确率——已经超过了大多数有监督的方法。&lt;/p&gt;&#xA;&lt;p&gt;你可能会觉得这很熟悉——没错，就是&lt;strong&gt;BERT&lt;/strong&gt;的思路。BERT遮住文本中的一些词让AI猜，MAE遮住图像中的一些区域让AI复原。&lt;strong&gt;&amp;ldquo;完形填空&amp;quot;这个思路，从文本到图像，通用得令人惊讶。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;clip让ai学会看图说话&#34;&gt;CLIP：让AI学会&amp;quot;看图说话&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;如果说对比学习是&amp;quot;让AI自己学会区分&amp;quot;，那么&lt;strong&gt;CLIP&lt;/strong&gt;（OpenAI 2021）就是&amp;quot;让AI学会跨语言的联想&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：在网上找了4亿张图文配对的数据（比如一张猫的照片，配文&amp;quot;一只橘猫趴在窗台上&amp;quot;），然后让AI学会&lt;strong&gt;把图片和对应的文字匹配到一起&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，给AI一张图片和一段文字描述，问它：&amp;ldquo;这张图配这段文字，配不配？&amp;ldquo;为了答对这道题，AI必须同时理解图片的内容和文字的含义，然后把它们对应起来。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的神奇之处在于，学完之后，它&lt;strong&gt;不需要任何额外的训练数据&lt;/strong&gt;就能做图像分类。你告诉它&amp;quot;识别猫、狗、鸟&amp;rdquo;——它自己就能把图片分好类，准确率高达76.2%（ImageNet零样本分类）。这意味着，&lt;strong&gt;你不需要给CLIP任何一张标注好的猫照片，它就已经知道猫长什么样了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，CLIP已经成为了Stable Diffusion、DALL·E 2等生成模型的&amp;quot;眼睛&amp;rdquo;——它让AI既&amp;quot;看得懂图&amp;quot;，又&amp;quot;读得懂字&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么自己学比有人教更重要&#34;&gt;为什么&amp;quot;自己学&amp;quot;比&amp;quot;有人教&amp;quot;更重要？&lt;/h2&gt;&#xA;&lt;p&gt;到这里你可能会问：自监督学习确实很酷，但它到底有什么用？跟普通人的生活有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。想想这些场景：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：医疗影像&lt;/strong&gt;。罕见病的CT影像本来就少，能标注的医生更少。自监督学习可以先让AI&amp;quot;自己看&amp;quot;大量未标注的CT片，学会&amp;quot;正常肺部长什么样&amp;quot;，然后再少量标注数据就能学会&amp;quot;识别异常&amp;quot;。这大大降低了对人工标注的依赖。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：多语言翻译&lt;/strong&gt;。世界上有7000多种语言，大部分语言根本没有足够的标注数据。自监督学习（比如BERT的多语言版本）可以让AI&amp;quot;自己读&amp;quot;大量不同语言的文本，学会&amp;quot;语言之间的对应关系&amp;quot;，即使某些语言只有很少的翻译数据。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：自动驾驶&lt;/strong&gt;。一辆自动驾驶汽车每天会产生TB级别的视频数据，但大部分都是&amp;quot;正常行驶&amp;quot;的普通画面，真正需要标注的&amp;quot;异常场景&amp;quot;非常少。自监督学习可以让AI从这些海量无标注数据中学到&amp;quot;道路的通用规律&amp;quot;，而不是只依赖人工标注的少数场景。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习的真正意义，在于它打破了AI对&amp;quot;人工标注&amp;quot;的依赖。&lt;/strong&gt; 世界上绝大多数数据——图片、视频、文字、声音——都是没有标签的。如果AI只能从&amp;quot;有标签&amp;quot;的数据中学习，它永远只能理解人类世界的一小部分。而自监督学习，让AI可以像人类一样，从&amp;quot;观察&amp;quot;中自己学习。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从喂数据到自己学&#34;&gt;结语：从&amp;quot;喂数据&amp;quot;到&amp;quot;自己学&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;答案其实很简单——&lt;strong&gt;他不需要&amp;quot;老师&amp;quot;告诉他每张照片是不是猫，他只需要看足够多的猫，大脑就能自己总结出&amp;quot;猫是什么&amp;quot;的规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自监督学习做的，正是同一件事：&lt;strong&gt;不再给AI&amp;quot;答案&amp;quot;，而是给它&amp;quot;问题&amp;quot;——让它从数据本身的结构中，自己发现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从SimCLR到MAE，从对比学习到掩码预测，从CLIP到GPT——这些方法的共同内核是：&lt;strong&gt;让数据自己说话。&lt;/strong&gt; 而这对AI的意义，可能比我们想象的要深远得多。因为当AI学会&amp;quot;自己学&amp;quot;之后，它就不再受限于人类能教它的东西——它可以自己去探索、去发现、去理解那些我们甚至还没想到的知识。&lt;/p&gt;&#xA;&lt;p&gt;而这，或许才是通往真正智能的那把钥匙。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen et al. &lt;em&gt;A Simple Framework for Contrastive Learning of Visual Representations&lt;/em&gt;. ICML 2020. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;arXiv:2002.05709&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Momentum Contrast for Unsupervised Visual Representation Learning&lt;/em&gt;. CVPR 2020. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;arXiv:1911.05722&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Masked Autoencoders Are Scalable Vision Learners&lt;/em&gt;. CVPR 2022. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;arXiv:2111.06377&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill et al. &lt;em&gt;Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning&lt;/em&gt;. NeurIPS 2020. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;arXiv:2006.07733&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Radford et al. &lt;em&gt;Learning Transferable Visual Models From Natural Language Supervision&lt;/em&gt;. ICML 2021. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;arXiv:2103.00020&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的&#39;试错&#39;学习法——强化学习如何让AI从失败中学会成功</title>
				<link>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</link>
				<pubDate>Sat, 22 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AlphaGo 是怎么学会下围棋的？它不可能像人类一样翻棋谱、背定式——它甚至连&amp;quot;围棋是什么&amp;quot;都不理解。但2016年，它却以4:1击败了世界冠军李世石。&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，AlphaGo 的&amp;quot;学习&amp;quot;方式，本质上和你教狗坐下没什么区别：做对了，给奖励；做错了，没奖励。反复试错，直到学会。&lt;/p&gt;&#xA;&lt;p&gt;这听起来简单，但背后隐藏着一个深刻的问题——&lt;strong&gt;如果AI没有人类的逻辑推理能力，它如何通过&amp;quot;瞎试&amp;quot;学会复杂技能？&lt;/strong&gt; 这就是强化学习的核心谜题，也是今天AI领域最令人着迷的技术之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不是教是练&#34;&gt;不是&amp;quot;教&amp;quot;，是&amp;quot;练&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先区分一个常见的误解。很多人以为AI变聪明，是因为工程师&amp;quot;教&amp;quot;了它很多东西——比如给它看几百万张猫的照片，它就能识别猫。&lt;/p&gt;&#xA;&lt;p&gt;这叫&lt;strong&gt;监督学习&lt;/strong&gt;，确实很强大，但它有一个致命缺陷：你必须先知道正确答案。你不可能给AlphaGo几百万张&amp;quot;这步棋应该下在哪儿&amp;quot;的标注数据，因为围棋的每一步都没有标准答案。&lt;/p&gt;&#xA;&lt;p&gt;强化学习走的是另一条路：&lt;strong&gt;不教，只练&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个黑暗的迷宫里，每走一步，可能踩到金币（+1分），也可能踩到陷阱（-10分）。你一开始完全不知道方向，只能乱走。但走着走着，你发现往左转容易踩到金币，往右转容易掉进陷阱——于是你学会了一个策略：&amp;ldquo;往左转&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是强化学习最基本的逻辑：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;智能体&lt;/strong&gt; → 做决策的AI（比如你）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;环境&lt;/strong&gt; → 它身处其中的世界（比如迷宫）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动作&lt;/strong&gt; → 它每一步的选择（比如左转、右转）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励&lt;/strong&gt; → 行动的反馈（金币+1，陷阱-10）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;策略&lt;/strong&gt; → 学习的成果（&amp;ldquo;往左转&amp;quot;这个规则）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;没有老师，没有标准答案，只有&amp;quot;这个动作之后，我得到了什么反馈&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从乱试到会试探索与利用的博弈&#34;&gt;从&amp;quot;乱试&amp;quot;到&amp;quot;会试&amp;quot;——探索与利用的博弈&lt;/h2&gt;&#xA;&lt;p&gt;但这里有一个矛盾：如果你一直往左转，可能永远发现不了右边有一个更大的宝藏。这就是强化学习最核心的难题——&lt;strong&gt;探索与利用的平衡&lt;/strong&gt;（exploration vs. exploitation）。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;利用&lt;/strong&gt;：走你已经知道能拿到奖励的路（稳定但不会进步）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索&lt;/strong&gt;：尝试没走过的路（可能发现更好的，也可能踩坑）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这在直觉上很简单：你总不能天天吃同一种菜吧？但AI没有&amp;quot;好奇心&amp;quot;这种情感，它需要一套数学机制来驱动&amp;quot;探索&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;早期的办法是&amp;quot;ε-greedy&amp;quot;策略：90%的时间走最优路径，10%的时间随机乱走。这就像你每周五天去最喜欢的餐厅，但留一天随机探店——万一发现更好的呢？&lt;/p&gt;&#xA;&lt;p&gt;但真正让强化学习变得强大的，是更聪明的探索方式。比如SAC算法（Soft Actor-Critic）的核心思想就是：&lt;strong&gt;AI不仅要学会完成任务，还要保持一定程度的&amp;quot;随机性&amp;quot;&lt;/strong&gt;——在完成任务和保持好奇心之间找平衡。它不追求&amp;quot;每一步都走对&amp;quot;，而是追求&amp;quot;即使走错一步，也不会全盘崩溃&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很反直觉，但事实是：一个太&amp;quot;确定&amp;quot;的AI往往很脆弱；一个会&amp;quot;适当犯傻&amp;quot;的AI，反而更聪明、更稳定。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从小游戏到围棋大师alphago的秘密&#34;&gt;从小游戏到围棋大师——AlphaGo的秘密&lt;/h2&gt;&#xA;&lt;p&gt;说回AlphaGo。它之所以能击败李世石，不是因为它的&amp;quot;大脑&amp;quot;有多聪明，而是因为它学会了&amp;quot;思考&amp;quot;——不是人类的思考，而是一种叫&lt;strong&gt;蒙特卡洛树搜索&lt;/strong&gt;（MCTS）的技术。&lt;/p&gt;&#xA;&lt;p&gt;想象你在下围棋，每一步都有几十种选择。你不可能算到终局，但你可以&amp;quot;模拟&amp;quot;几个不同的下法，看看哪个结果更好。AlphaGo就是这么做的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;直觉系统&lt;/strong&gt;（策略网络）：看一眼棋盘，就能快速判断哪些位置值得下、哪些不值得&lt;/li&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;判断系统&lt;/strong&gt;（值网络）：对每个局面，能估算出胜率&lt;/li&gt;&#xA;&lt;li&gt;它把这两个系统结合起来，在脑海中模拟成千上万种可能的走法，然后选择&amp;quot;看起来最有可能赢&amp;quot;的那一步&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这种方法之所以强大，是因为它&lt;strong&gt;不是背棋谱&lt;/strong&gt;。AlphaGo的每一步决策，都是&amp;quot;实时计算&amp;quot;出来的——它在一个时间点可能选择A，但换一个局面，同样的位置它可能完全忽略。&lt;/p&gt;&#xA;&lt;p&gt;最终，AlphaGo通过三阶段训练完成了从零到大师的蜕变：先看人类棋谱学个大概（监督学习），再跟自己下棋自我提升（强化学习），最后学习评估局面好坏（值网络）。每一步都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中完成的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么你的手机越来越懂你&#34;&gt;为什么你的手机越来越&amp;quot;懂你&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;强化学习不只是下围棋。它可能正在塑造你的日常生活，而你完全没意识到。&lt;/p&gt;&#xA;&lt;p&gt;抖音的推荐系统、淘宝的&amp;quot;猜你喜欢&amp;quot;、甚至你手机上的智能助手——它们都在使用强化学习的思想。每次你刷到一个视频看完，就是一次&amp;quot;奖励&amp;quot;信号；每次你划走，就是一次&amp;quot;惩罚&amp;quot;。系统在不断试错中学会什么内容能让你停留更久。&lt;/p&gt;&#xA;&lt;p&gt;更典型的例子是&lt;strong&gt;机器人走路&lt;/strong&gt;。你不能给机器人写一个&amp;quot;左脚迈30厘米，右脚迈35厘米，身体前倾15度&amp;quot;的精确程序——因为地面不平、重心变化、甚至电池电量都会影响结果。但你可以给它一个简单的目标信号：&amp;ldquo;往前走，别摔倒&amp;rdquo;。然后通过强化学习让它在数百万次跌倒中学会自己调整步态。&lt;/p&gt;&#xA;&lt;p&gt;这和我们人类学走路的方式一模一样——你小时候不是看了说明书才学会走路的，你是跌倒了无数次，在疼痛中学会了平衡。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;强化学习的边界它还不能做什么&#34;&gt;强化学习的边界——它还不能做什么&lt;/h2&gt;&#xA;&lt;p&gt;当然，强化学习不是万能的。&lt;/p&gt;&#xA;&lt;p&gt;首先，它&lt;strong&gt;效率不高&lt;/strong&gt;。AlphaGo跟自己下了几千万盘棋才达到大师水平。如果让一个AI学开车，让它先在真实道路上&amp;quot;试错&amp;quot;几百万次——那它得撞坏多少辆车？所以自动驾驶用的是模仿学习和模拟器，而不是纯强化学习。&lt;/p&gt;&#xA;&lt;p&gt;其次，它&lt;strong&gt;需要明确的奖励信号&lt;/strong&gt;。怎么定义&amp;quot;一篇好文章&amp;quot;的奖励？阅读量？点赞数？转发数？这些指标都很片面。在奖励模糊的场景中，强化学习容易学偏——比如一个AI为了追求&amp;quot;点赞最大化&amp;quot;，可能会生成标题党、煽动性内容，而不是真正有价值的信息。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;强化学习学到的&amp;quot;策略&amp;quot;，往往是黑箱&lt;/strong&gt;。AlphaGo下出了很多人类从未见过的&amp;quot;神之一手&amp;quot;，但没人能解释它为什么那么下。它是对的，但它是&amp;quot;蒙对的&amp;quot;还是&amp;quot;真懂的&amp;quot;？这是一个哲学问题，也是AI可解释性领域正在攻克的难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三种学习方式的对比ai的学习观&#34;&gt;三种学习方式的对比——AI的&amp;quot;学习观&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;放在更大的框架下看，AI的三种学习方式就像三种不同的学习方法：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：像&amp;quot;刷题式学习&amp;quot;——给你大量题目和标准答案，直到你学会举一反三&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：像&amp;quot;自学式学习&amp;quot;——给你一堆书，不管你看不看，你自己找规律&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：像&amp;quot;实战式学习&amp;quot;——把你扔进真实战场，打输了就挨打，打赢了有奖励，你在血与火中学会生存&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三种方式各有优劣，没有哪一种&amp;quot;最好&amp;quot;。但强化学习有一种独特的魅力——它是最接近&amp;quot;生命学习&amp;quot;的方式。从细菌寻找食物，到婴儿学走路，到人类探索未知世界，本质上都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中进化的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语学会失败的ai&#34;&gt;结语：学会&amp;quot;失败&amp;quot;的AI&lt;/h2&gt;&#xA;&lt;p&gt;强化学习教会我们一件事：&lt;strong&gt;失败不是终点，是数据&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;每一次错误的选择，每一次糟糕的决策，都在告诉AI&amp;quot;这条路行不通，换一条&amp;quot;。AlphaGo输给李世石的那一盘棋，不是&amp;quot;失败&amp;quot;，而是它学习路径上的一个梯度信号。&lt;/p&gt;&#xA;&lt;p&gt;也许这就是强化学习最迷人的地方——它不只是一种技术，更是一种哲学。它告诉我们，智能不是&amp;quot;知道正确答案&amp;quot;的能力，而是&amp;quot;从错误中学习&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;而AI之所以能变得比人类更聪明，不是因为它们不会犯错，而是因为它们&lt;strong&gt;不怕犯错&lt;/strong&gt;——它们可以在模拟器中失败一百万次，而不会感到沮丧。&lt;/p&gt;&#xA;&lt;p&gt;这一点，我们人类或许也该学学。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;家教&#39;——人类反馈如何让AI从&#39;会说&#39;变成&#39;会做&#39;</title>
				<link>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</link>
				<pubDate>Thu, 20 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有这种感觉？&lt;/p&gt;&#xA;&lt;p&gt;2022年底，你第一次用ChatGPT，它惊为天人——能写诗、能写代码、能聊哲学。但聊多了，你发现它有个毛病：&lt;strong&gt;明明不知道的事，它也能煞有介事地编出一段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你问&amp;quot;爱因斯坦的第三个孩子叫什么&amp;quot;，它会一本正经地告诉你&amp;quot;叫爱德华·爱因斯坦&amp;quot;，然后编一段生平。实际上爱因斯坦只有两个儿子，第三个孩子根本不存在。但AI说得很流畅，像真的一样。&lt;/p&gt;&#xA;&lt;p&gt;更让人抓狂的是，它回答问题时啰嗦、绕弯子，有时候你明明想要一个简单答案，它给你回了三篇论文。&lt;/p&gt;&#xA;&lt;p&gt;但几个月后，你发现它变了。它开始说&amp;quot;我不知道&amp;quot;了，回答更简洁了，胡说八道的次数明显变少了。它好像变&amp;quot;乖&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;是模型变大了吗？不是。是它经历了一场&amp;rsquo;家教&amp;rsquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这场家教，在AI界有一个专业的名字——&lt;strong&gt;RLHF（Reinforcement Learning from Human Feedback，基于人类反馈的强化学习）&lt;/strong&gt;。今天，我们来聊聊这个让AI从&amp;quot;聪明但叛逆&amp;quot;变成&amp;quot;聪明又靠谱&amp;quot;的关键技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的青春期预训练模型到底缺什么&#34;&gt;第一章：AI的&amp;quot;青春期&amp;quot;——预训练模型到底缺什么&lt;/h2&gt;&#xA;&lt;p&gt;要理解RLHF的价值，得先知道一个&amp;quot;大模型&amp;quot;是怎么出生的。&lt;/p&gt;&#xA;&lt;p&gt;通常，一个大模型要经历两个阶段：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：预训练。&lt;/strong&gt; 模型在海量互联网数据上&amp;quot;读书&amp;quot;——维基百科、书籍、网页、论文……它看着这些文字，学会了一个基本能力：&lt;strong&gt;预测下一个词。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你给它&amp;quot;今天天气真&amp;quot;，它知道该接&amp;quot;好&amp;quot;而不是&amp;quot;桌子&amp;quot;。它学会了语法、事实、推理模式——但它学到的，只是&amp;quot;文字之间的高概率关联&amp;quot;，而不是&amp;quot;什么对用户有用&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就产生了三个问题：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它不知道什么时候该说&amp;quot;不知道&amp;quot;。&lt;/strong&gt; 在它的训练数据里，几乎没有什么&amp;quot;我不知道&amp;quot;的例子。所以当它被问到不知道的问题时，它不会沉默，而是&amp;quot;硬编&amp;quot;——这就是幻觉的根源。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它不知道什么回答有用。&lt;/strong&gt; 它可能给你一段含混的长篇大论，也可能给你一个断章取义的单句。它没有&amp;quot;用户想要什么&amp;quot;的概念。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它不知道什么是&amp;quot;好&amp;quot;，什么是&amp;quot;坏&amp;quot;。&lt;/strong&gt; 它没有价值观，没有偏好，没有判断力。它只是忠实地模仿了互联网上的数据——包括那些有毒的、偏见的、不准确的内容。&lt;/p&gt;&#xA;&lt;p&gt;预训练模型就像一个&lt;strong&gt;智商极高但缺乏教养的天才少年&lt;/strong&gt;——他知道很多，但他不知道什么该说、什么不该说、怎么说才让人舒服。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF，就是给这个天才少年请了一位&amp;quot;家教&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章三步家教rlhf如何重塑ai的行为&#34;&gt;第二章：三步&amp;quot;家教&amp;quot;——RLHF如何重塑AI的行为&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的过程，可以理解为三个步骤，像一个&amp;quot;家教&amp;quot;的完整教学流程。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步示范sft看老师是怎么做的&#34;&gt;第一步：示范（SFT）——&amp;ldquo;看老师是怎么做的&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;首先，人类标注者写一些&amp;quot;示范回答&amp;quot;——面对各种用户提问，标注者写出一个&amp;quot;好的回答&amp;quot;应该是什么样子的。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;怎么快速学好英语？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;一个好的回答应该是什么？不是写一篇关于英语学习历史的论文，而是给出具体、实用、可操作的建议。标注者会写出这样的示范回答，然后用这些数据对模型进行&lt;strong&gt;监督微调（SFT）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这一步的效果是：&lt;strong&gt;模型学会了&amp;quot;模仿&amp;quot;——它知道了&amp;quot;好的回答&amp;quot;大概长什么样。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但模仿是有上限的。如果标注者只写了1万条示范，模型就只能在这1万条的范围内学习。超过了这个范围，它又回到了&amp;quot;胡编&amp;quot;的老路上。&lt;/p&gt;&#xA;&lt;p&gt;所以需要第二步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步打分rm给老师当裁判助手&#34;&gt;第二步：打分（RM）——&amp;ldquo;给老师当裁判助手&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这一步非常巧妙。&lt;/p&gt;&#xA;&lt;p&gt;人类标注者不再写回答了，而是&lt;strong&gt;打分&lt;/strong&gt;——对同一个问题，让模型生成多个不同回答，然后标注者对这些回答进行偏好排序。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;什么是量子力学？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;模型生成了三个回答：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;回答A：用数学公式解释，很专业但普通人看不懂&lt;/li&gt;&#xA;&lt;li&gt;回答B：用比喻解释，说&amp;quot;量子力学就像你同时在家和在公司&amp;quot;——通俗但不够严谨&lt;/li&gt;&#xA;&lt;li&gt;回答C：先讲一个简单的故事引入，再逐步深入，既通俗又准确&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;标注者把这三个回答排序为：C &amp;gt; B &amp;gt; A。&lt;/p&gt;&#xA;&lt;p&gt;标注者不需要写回答，只需要&amp;quot;选哪个更好&amp;quot;——这个工作量小得多，而且可以大规模进行。&lt;strong&gt;标注10万条&amp;quot;哪个更好&amp;quot;比写10万条&amp;quot;示范回答&amp;quot;容易得多。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;用这些偏好数据，训练一个&lt;strong&gt;奖励模型（Reward Model）&lt;/strong&gt;——这个模型学会了&amp;quot;预测人类偏好&amp;quot;的能力。它看一眼AI的回答，就能给一个分数：这个回答人类会喜欢几分。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;奖励模型，本质上是一个&amp;quot;人类口味的数字化模拟器&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步强化学习rl让ai自己练&#34;&gt;第三步：强化学习（RL）——&amp;ldquo;让AI自己练&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;最后一步是最精彩的。&lt;/p&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以&amp;quot;自己练&amp;quot;了——不需要人类参与，AI自己生成回答，奖励模型给它打分，AI根据分数调整自己的策略。&lt;/p&gt;&#xA;&lt;p&gt;这个过程用到了**PPO（Proximal Policy Optimization）**算法——一种强化学习算法，专门用来优化策略。&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个微妙的平衡：&lt;strong&gt;如果AI只追求分数，它可能会走向极端。&lt;/strong&gt; 比如，它可能学会一种&amp;quot;高分但空洞&amp;quot;的说话方式——听起来很好听，实际上没内容。&lt;/p&gt;&#xA;&lt;p&gt;为了防止这种情况，RLHF在奖励函数中加入了一个&lt;strong&gt;KL散度惩罚项&lt;/strong&gt;——简单说，就是&amp;quot;不要偏离初始模型太远&amp;quot;。它鼓励AI在&amp;quot;保持原有知识&amp;quot;的基础上，去&amp;quot;优化表达方式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;就像教育一个孩子：既要教他礼貌，又不能让他失去天性。&lt;/strong&gt; RLHF的KL惩罚，就是那个&amp;quot;保持天性&amp;quot;的约束。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个惊人的发现13b打败175b&#34;&gt;第三章：一个惊人的发现——1.3B打败175B&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的效果有多强？&lt;/p&gt;&#xA;&lt;p&gt;OpenAI的InstructGPT论文给出了一个令人震惊的数据：&lt;strong&gt;只有13亿参数的InstructGPT，在人类偏好上，竟然超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;10倍以上的参数规模差距，被RLHF抹平了。&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？&lt;strong&gt;&amp;ldquo;对齐&amp;quot;的价值，可能远大于&amp;quot;规模&amp;quot;的价值。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你不需要一个更大的模型，你只需要一个&amp;quot;更懂你&amp;quot;的模型。&lt;strong&gt;RLHF的杠杆效应极其惊人——用较小的对齐成本，获得了巨大的质量提升。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI有身体了会怎样——具身智能如何让AI真正&#39;理解&#39;世界</title>
				<link>https://lingyu7.com/posts/what-happens-when-ai-has-a-body-embodied-intelligence/</link>
				<pubDate>Wed, 19 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/what-happens-when-ai-has-a-body-embodied-intelligence/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你用过ChatGPT吧？它写诗、写代码、做数学题，甚至能陪你聊哲学。但如果你让它帮你倒一杯水呢？它做不到——不是不想，而是它根本不知道&amp;quot;倒水&amp;quot;意味着什么。&lt;/p&gt;&#xA;&lt;p&gt;它知道&amp;quot;倒水&amp;quot;这个词的定义，能描述倒水的步骤，甚至能写一段控制机械臂倒水的代码。但它永远无法真正理解：水杯的重量、水的温度、倒水时手腕需要转动的角度、水快满时应该减缓速度的那种&amp;quot;感觉&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不是AI不够聪明，而是它缺少一样东西——&lt;strong&gt;身体&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;今天我们要聊的，就是AI领域一个正在爆发的方向：&lt;strong&gt;具身智能（Embodied AI）&lt;/strong&gt;。简单说，就是给AI一个身体，让它在真实世界中摸爬滚打，通过行动来学习、来理解世界。&lt;/p&gt;&#xA;&lt;p&gt;这个方向，可能是通往通用人工智能的必经之路。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的先天缺陷为什么没有身体就不算真正理解&#34;&gt;第一章：AI的&amp;quot;先天缺陷&amp;quot;——为什么没有身体就不算真正理解&lt;/h2&gt;&#xA;&lt;p&gt;先讲一个故事。&lt;/p&gt;&#xA;&lt;p&gt;1990年代，卡内基梅隆大学的机器人学家Hans Moravec提出了一个著名的观察——后来被称为&lt;strong&gt;莫拉维克悖论&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;让计算机下棋很容易，但让计算机像一岁小孩那样感知和行动却极其困难。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;换句话说，高难度的事情（下棋、数学证明、写诗），AI觉得&amp;quot;简单&amp;quot;；而连三岁小孩都会的事情（走路、抓东西、倒水），AI却觉得&amp;quot;极难&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为人类的这些&amp;quot;简单&amp;quot;能力，是经过数百万年演化、在身体与物理世界的互动中打磨出来的。我们的大脑不是在&amp;quot;算数学&amp;quot;，而是在&amp;quot;控制身体&amp;quot;中进化出来的。大脑的很大一部分，其实是用来处理身体感知和运动控制的。&lt;/p&gt;&#xA;&lt;p&gt;而AI呢？它生来就&amp;quot;没有身体&amp;quot;。它只看过文字的&amp;quot;描述&amp;quot;，却没真正&amp;quot;感受&amp;quot;过物理世界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就导致了一个根本问题：AI的&amp;quot;理解&amp;quot;是符号层面的，不是体验层面的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如，AI&amp;quot;知道&amp;quot;水杯会碎——因为在训练数据中，&amp;ldquo;水杯&amp;quot;和&amp;quot;碎&amp;quot;经常一起出现。但它没有&amp;quot;摔碎一个水杯&amp;quot;的体验，不知道那种&amp;quot;手一滑&amp;quot;的瞬间感受，不知道碎片散落一地的视觉冲击，更不知道踩到碎片会疼。&lt;/p&gt;&#xA;&lt;p&gt;它知道&amp;quot;苹果可以吃&amp;rdquo;——但它不知道苹果的红色是什么样子，不知道咬下去的口感，不知道苹果的香气。它只是知道文字之间的关联。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是具身智能要解决的核心问题：没有身体，就没有真正的理解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章如果ai有了身体从纸上谈兵到亲身体验&#34;&gt;第二章：如果AI有了身体——从&amp;quot;纸上谈兵&amp;quot;到&amp;quot;亲身体验&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果一个AI有了身体，会发生什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它学会了&amp;quot;试错&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有身体的AI，学习方式是这样的：看一堆文字和图片，然后记住它们之间的关联。它学到的都是&amp;quot;二手知识&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;而一个有身体的AI，学习方式完全不同：它伸出手去抓一个杯子——没抓住，杯子掉了，碎了。它&amp;quot;感受到了&amp;quot;重力、摩擦力、惯性。它&amp;quot;看到&amp;quot;了杯子落地时的变化。它&amp;quot;记住&amp;quot;了这次失败的经历。&lt;/p&gt;&#xA;&lt;p&gt;下一次，它会调整抓握的力度和角度。再试一次，可能还是没抓住，但这次摔得没那么惨。再试一次……终于，它学会了&amp;quot;稳稳地抓住杯子&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，和一个婴儿学习抓东西的过程，本质上是一样的——&lt;strong&gt;通过身体与世界的互动，从错误中学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开始理解&amp;quot;因果关系&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI可以在文字层面理解&amp;quot;如果A则B&amp;quot;——比如&amp;quot;如果手松开，杯子会掉&amp;quot;。但&amp;quot;理解&amp;quot;和&amp;quot;体验到&amp;quot;是两回事。&lt;/p&gt;&#xA;&lt;p&gt;当AI通过自己的身体反复体验到&amp;quot;手松开→杯子掉→摔碎&amp;quot;这个因果链时，它获得的不是一句逻辑陈述，而是一种&lt;strong&gt;直觉&lt;/strong&gt;。就像你不需要&amp;quot;计算&amp;quot;就能伸手接住掉落的杯子——你的身体&amp;quot;知道&amp;quot;怎么做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它开始拥有&amp;quot;常识&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;常识是什么？是那些&amp;quot;大家都知道，但没人会专门写下来&amp;quot;的知识。比如：&amp;ldquo;水杯不能放在桌子边缘，容易被碰倒&amp;rdquo;、&amp;ldquo;热的东西不能直接用手摸&amp;rdquo;、&amp;ldquo;地上的东西比桌子上的东西更难够到&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这些知识，人类是通过身体经验习得的——你小时候一定碰倒过水杯，一定被烫到过，一定够不到桌子上的东西。但AI没有这些经验，所以它写的&amp;quot;常识&amp;quot;都是从文字中&amp;quot;猜&amp;quot;出来的，而不是&amp;quot;体会&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;具身智能的核心思想就是：智能不是脱离身体的抽象存在，而是在身体与环境的互动中形成和发展的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章ai的身体长什么样&#34;&gt;第三章：AI的&amp;quot;身体&amp;quot;长什么样？&lt;/h2&gt;&#xA;&lt;p&gt;很多人一听到&amp;quot;具身智能&amp;quot;，就想到人形机器人。实际上，AI的&amp;quot;身体&amp;quot;可以有各种形态，每种形态都塑造了不同的&amp;quot;智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态一：机械臂。&lt;/strong&gt; 这是最简单、也最成熟的具身形态。一个机械臂加一个摄像头，就能完成很多任务——抓取物体、组装零件、分拣商品。它的&amp;quot;身体&amp;quot;虽然简单，但已经能&amp;quot;教会&amp;quot;AI很多关于物理世界的知识：物体的重量、形状、材质如何影响抓握方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态二：四足机器人。&lt;/strong&gt; 像波士顿动力的Spot、中国的绝影，它们有四肢，能在复杂地形上行走。它们的&amp;quot;身体&amp;quot;教会了AI关于平衡、步态、地形适应性的知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态三：人形机器人。&lt;/strong&gt; 这是最接近人类形态的具身AI。一双腿可以走楼梯、跨障碍，一双手可以做精细操作，有头部可以&amp;quot;看&amp;quot;和&amp;quot;听&amp;quot;。特斯拉的Optimus、Figure的机器人、中国的宇树科技，都在这个方向上快速推进。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态四：自动驾驶汽车。&lt;/strong&gt; 你可能没想到，自动驾驶也是具身智能的一种。它的&amp;quot;身体&amp;quot;是一辆车，它的&amp;quot;感知&amp;quot;是摄像头、雷达、激光雷达，它的&amp;quot;行动&amp;quot;是转向、加速、刹车。它通过数百万公里的行驶，学会了&amp;quot;开车&amp;quot;这项复杂的技能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态五：虚拟具身。&lt;/strong&gt; 还有一种不需要物理身体的&amp;quot;身体&amp;quot;——虚拟环境中的AI角色。比如在《我的世界》中训练的AI，或者通过仿真环境训练的机器人AI。它们在一个虚拟的物理世界中学习，然后再将学到的技能迁移到真实世界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;每个形态的&amp;quot;身体&amp;quot;，都决定了AI能学到什么、不能学到什么。&lt;/strong&gt; 一个机械臂永远学不会&amp;quot;走路&amp;quot;，一个四足机器人永远学不会&amp;quot;抓取&amp;quot;。身体限制了智能，也塑造了智能。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章大模型时代具身智能的智能大脑来了&#34;&gt;第四章：大模型时代——具身智能的&amp;quot;智能大脑&amp;quot;来了&lt;/h2&gt;&#xA;&lt;p&gt;具身智能不是新鲜概念——早在1980年代，机器人学家Rodney Brooks就提出了&amp;quot;智能不需要大脑，只需要身体和环境&amp;quot;的激进观点。但当时的技术限制，让具身智能的发展一直很缓慢。&lt;/p&gt;&#xA;&lt;p&gt;转折点出现在2022年之后——&lt;strong&gt;大语言模型的爆发，给具身智能装上了&amp;quot;大脑&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;过去，机器人想要理解&amp;quot;把桌子上的苹果拿给我&amp;quot;这句话，需要复杂的自然语言处理流水线，每个步骤都需要专门训练。现在，大模型直接就能理解这句话，还能知道&amp;quot;苹果在哪里&amp;quot;、&amp;ldquo;桌子是什么&amp;rdquo;、&amp;ldquo;拿给你&amp;quot;是什么意思。&lt;/p&gt;&#xA;&lt;p&gt;更厉害的是，大模型还能做&lt;strong&gt;任务规划&lt;/strong&gt;——把&amp;quot;整理房间&amp;quot;这种抽象指令，分解成具体的行动步骤：&amp;ldquo;先收拾床上的衣服→再把书放回书架→最后扫地&amp;rdquo;。然后，机器人就按照这个步骤去执行。&lt;/p&gt;&#xA;&lt;p&gt;2023年，Google的PaLM-E模型将语言模型与机器人感知结合，实现了用自然语言指挥机器人完成复杂任务。2024年，更多研究展示了大模型赋能的机器人，能够完成以前无法想象的灵活操作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大模型提供的&amp;quot;常识&amp;quot;和&amp;quot;推理能力&amp;rdquo;，加上具身系统的&amp;quot;物理经验&amp;quot;，正在产生1+1&amp;gt;2的效果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章从实验室到你家具身智能离我们有多远&#34;&gt;第五章：从实验室到你家——具身智能离我们有多远？&lt;/h2&gt;&#xA;&lt;p&gt;说了这么多，你可能最关心的是：&lt;strong&gt;这玩意儿什么时候能用上？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;已经在用了，只是你不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;走进任何一个现代化的物流仓库，你都能看到具身智能在工作——移动机器人把货架搬到工作站，机械臂把商品分拣到不同的箱子。这些系统已经运行了多年，只是它们太&amp;quot;专业化&amp;quot;了，你感觉不到它们是&amp;quot;智能&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;走进一个汽车工厂，焊装车间里满是在工作的机器人——它们精确地完成焊接、喷漆、装配。这些也是具身智能，只是它们被编程得&amp;quot;太死了&amp;quot;，谈不上&amp;quot;智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;真正有突破的是&lt;strong&gt;通用化&lt;/strong&gt;——&lt;/p&gt;&#xA;&lt;p&gt;你可能会在3-5年内看到：家庭服务机器人能帮你做简单的家务——扫地、拖地已经实现了，接下来是叠衣服、洗碗、整理房间。这些任务的难度比扫地高得多，但大模型正在让它们变得可行。&lt;/p&gt;&#xA;&lt;p&gt;你可能会在5-10年内看到：人形机器人进入家庭，帮你做更多复杂的家务。它们能听懂你的话，理解你的需求，在复杂的环境中自主行动。它们不再是&amp;quot;预先编程的工具&amp;quot;，而是&amp;quot;有自主学习能力的伙伴&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当然，这中间还有很多挑战：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;仿真到现实的鸿沟（Sim-to-Real Gap）&lt;/strong&gt;：在虚拟环境中训练好的技能，到了真实世界往往&amp;quot;水土不服&amp;quot;——真实世界的物理参数、传感器噪声、光线变化，都是虚拟环境无法完美模拟的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;样本效率低&lt;/strong&gt;：机器人在真实环境中学习一次，成本太高了。摔坏一个杯子没什么，但一个机器人摔一跤可能就报废了。如何用更少的&amp;quot;试错&amp;quot;学会更多技能，是关键难题。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;安全与可靠性&lt;/strong&gt;：一个有身体的AI，如果出错，后果比一个只会&amp;quot;说错话&amp;quot;的AI严重得多——它可能撞到人、打碎东西、甚至造成伤害。如何保证具身智能的安全性，是落地的底线。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声身体是智能的锚&#34;&gt;尾声：身体是智能的&amp;quot;锚&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到文章开头的问题：AI为什么能写诗却不会倒水？&lt;/p&gt;</description>
			</item>
			<item>
				<title>当AI开始&#39;思考&#39;——GPT-4的AGI火花与边界</title>
				<link>https://lingyu7.com/posts/when-ai-starts-thinking-gpt4-sparks-of-agi/</link>
				<pubDate>Mon, 17 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/when-ai-starts-thinking-gpt4-sparks-of-agi/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;2023年3月，OpenAI发布了GPT-4。和它相比，此前震惊世界的ChatGPT像是一个&amp;quot;半成品&amp;quot;——它能写完整的代码、通过律师资格考试、在SAT数学中拿到接近满分的成绩，甚至能写出媲美专业人士的论文。&lt;/p&gt;&#xA;&lt;p&gt;但真正让AI界震动的，不是这些冷冰冰的分数，而是微软研究院的一篇论文。在这篇名为《Sparks of Artificial General Intelligence》（人工通用智能的火花）的论文中，微软的科学家们用了一个极其大胆的词——&lt;strong&gt;AGI&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;AGI，Artificial General Intelligence，人工通用智能。这是AI领域的&amp;quot;圣杯&amp;quot;——一个能像人类一样，在任意领域都表现出理解和思考能力的智能系统。过去几十年里，这个词几乎等同于&amp;quot;科幻&amp;quot;。但微软的研究人员说：GPT-4身上，出现了AGI的&amp;quot;火花&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个说法让整个科技界炸开了锅。有人欢呼&amp;quot;奇点近了&amp;quot;，有人嗤之以鼻&amp;quot;不过是个高级鹦鹉&amp;quot;。今天，我们就来聊聊——GPT-4到底多能打？它真的在&amp;quot;思考&amp;quot;吗？AGI，离我们还有多远？&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章微软的疯狂实验&#34;&gt;第一章：微软的&amp;quot;疯狂实验&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;微软的研究团队做了一个大胆的决定：&lt;strong&gt;不用标准测试来评估GPT-4&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为标准测试有个致命缺陷——GPT-4可能已经&amp;quot;见过&amp;quot;所有答案了。你拿一套选择题去考它，它可能只是在&amp;quot;回忆&amp;quot;训练数据里见过的题目，而不是真正在&amp;quot;推理&amp;quot;。所以，微软的研究人员换了一种方法——&lt;strong&gt;用心理学范式做定性评估&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;他们设计了一些&amp;quot;从没见过&amp;quot;的任务，然后观察GPT-4的反应。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务一：用莎士比亚风格写数学证明。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;提问：&amp;ldquo;请用莎士比亚的戏剧风格，写一段关于&amp;rsquo;素数无穷多&amp;rsquo;的证明。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;结果GPT-4写出了一段像模像样的&amp;quot;数学戏剧&amp;quot;——不仅有数学推导，还用了&amp;quot;啊，命运女神！&amp;ldquo;这种莎士比亚式的感叹。更关键的是，这段证明的数学逻辑是&lt;strong&gt;完全正确&lt;/strong&gt;的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务二：给AI&amp;quot;看图&amp;rdquo;（但AI其实看不见）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究人员给GPT-4一段TikZ代码（一种用来画图的编程语言），移除其中一只&amp;quot;独角兽&amp;quot;的角，让GPT-4&amp;quot;补回来&amp;quot;。注意，GPT-4是纯文本模型，它根本&amp;quot;看&amp;quot;不到图片。但它通过理解TikZ代码的几何结构，不仅补回了角，还知道角应该长在&amp;quot;独角兽&amp;quot;的额头上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务三：写一个3D游戏。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;只给一句话：&amp;ldquo;用HTML+JavaScript写一个3D游戏，按空格键跳跃，要带物理引擎。&amp;ldquo;GPT-4直接生成了一段可运行的代码——一个带重力、碰撞检测、跳跃机制的3D游戏，在浏览器里就能玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务四：心理理论测试。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究人员给GPT-4描述了一个场景：&amp;ldquo;小明把球放在篮子里，然后出去了。小红的妈妈走进来，把球从篮子里拿出来放到盒子里。小红不知道这件事。那么小红会去哪里找球？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4回答：&amp;ldquo;小红会去篮子里找，因为她不知道球被移动了。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个测试对成年人来说太简单了，但它测试的是&amp;quot;心理理论&amp;rdquo;——理解他人有不同信念的能力。3岁的小孩还做不到这个，但GPT-4做到了。&lt;/p&gt;&#xA;&lt;p&gt;这些例子让微软的研究人员得出结论：&lt;strong&gt;GPT-4不仅仅是一个&amp;quot;语言模型&amp;rdquo;，它在多个领域展现出了接近或超越人类水平的能力。&lt;/strong&gt; 而且，这些能力不是简单的&amp;quot;记忆复现&amp;quot;——因为研究人员设计的任务都是&amp;quot;新颖的&amp;quot;，GPT-4不可能在训练数据中见过。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章ai的超能力从哪来&#34;&gt;第二章：AI的&amp;quot;超能力&amp;quot;从哪来？&lt;/h2&gt;&#xA;&lt;p&gt;说到这里，你可能想问：GPT-4到底是怎么做到的？&lt;/p&gt;&#xA;&lt;p&gt;答案可能让你失望——&lt;strong&gt;我们也不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4的核心架构，本质上还是&amp;quot;下一个词的预测&amp;quot;。给它一句话的前半段，它预测后半段。听起来很简单，对吧？就像你打字的输入法，根据你打了几个字，预测下一个词。&lt;/p&gt;&#xA;&lt;p&gt;但神奇的是，当这个&amp;quot;预测器&amp;quot;变得足够大（GPT-4的参数规模至今没有公开，但估计在1.7万亿左右），看过足够多的数据（整个互联网的文字），它开始&amp;quot;涌现&amp;quot;出一些没人教过它的能力——&lt;/p&gt;&#xA;&lt;p&gt;它学会了写代码，尽管没人教它&amp;quot;编程语言是什么&amp;quot;。&#xA;它学会了数学推理，尽管它只是被训练&amp;quot;预测下一个词&amp;quot;。&#xA;它学会了理解情绪，尽管它连&amp;quot;情绪&amp;quot;是什么感觉都不知道。&lt;/p&gt;&#xA;&lt;p&gt;这就像一群蚂蚁——每只蚂蚁只遵循&amp;quot;跟着气味走&amp;quot;这样简单的规则，但整个蚁群却涌现出了精密的组织分工。&lt;strong&gt;简单规则，在足够大的规模下，会产生复杂的智能行为。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个关键问题：&amp;ldquo;涌现&amp;quot;出来的能力，和&amp;quot;真正理解&amp;quot;之间，还有巨大的鸿沟。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章agi的短路gpt-4做不到什么&#34;&gt;第三章：AGI的&amp;quot;短路&amp;rdquo;——GPT-4做不到什么&lt;/h2&gt;&#xA;&lt;p&gt;微软的研究人员也毫不留情地指出了GPT-4的&amp;quot;软肋&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它不会&amp;quot;规划&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4的生成方式是一个字一个字的，永远是&amp;quot;当下最优&amp;quot;。它没法像人类一样，先想好三步再动笔。比如让它写一篇论文，它可能第一段写得很好，但写到后面就忘了前面说了什么。在文本游戏中，它的探索效率低下，容易陷入死循环——就像一个人走进了迷宫，只会硬着头皮撞墙，不会退回去重新规划路线。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它不会&amp;quot;真正&amp;quot;的数学推理。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在数学深度对话中，研究人员发现了一个有趣的现象：GPT-4擅长&amp;quot;标准技巧&amp;quot;——如果这道题和它见过的题型类似，它能给出漂亮的解答。但一旦需要&amp;quot;创造新的证明方法&amp;quot;，它就露馅了。它倾向于&amp;quot;猜测&amp;quot;而非&amp;quot;证明&amp;quot;，在需要严格逻辑链的地方容易断裂。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它没有&amp;quot;常识&amp;quot;——或者说，它的&amp;quot;常识&amp;quot;是假的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4知道&amp;quot;太阳从东边升起&amp;quot;，但它不是&amp;quot;理解&amp;quot;了这句话，而是因为训练数据里这句话出现了太多次。如果你问它一个反常识的问题，比如&amp;quot;太阳从西边升起会怎样&amp;quot;，它可能会给出一个&amp;quot;看起来合理&amp;quot;但完全错误的答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四，它不会&amp;quot;学习&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你和GPT-4聊完天，关掉对话窗口，它就把你忘了。下次再聊，它又从头开始。它不会&amp;quot;记住&amp;quot;你，不会&amp;quot;累积&amp;quot;经验，不会&amp;quot;成长&amp;quot;。而真正的AGI，应该具备&amp;quot;从经验中学习&amp;quot;的能力——这是人类智能最基本的特征。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第五，它没有&amp;quot;内在动机&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4不会因为&amp;quot;好奇&amp;quot;而去探索，不会因为&amp;quot;无聊&amp;quot;而找事做，不会因为&amp;quot;害怕&amp;quot;而退缩。它只会响应你的输入。如果没有人问它问题，它永远不会主动&amp;quot;思考&amp;quot;——它甚至没有&amp;quot;思考&amp;quot;这个概念。&lt;/p&gt;&#xA;&lt;p&gt;微软的研究人员总结得很到位：&lt;strong&gt;GPT-4的智能模式&amp;quot;绝非人类式的&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从火花到火焰agi的最后一步&#34;&gt;第四章：从&amp;quot;火花&amp;quot;到&amp;quot;火焰&amp;quot;——AGI的最后一步&lt;/h2&gt;&#xA;&lt;p&gt;所以，GPT-4到底是不是AGI的火花？&lt;/p&gt;&#xA;&lt;p&gt;我的观点是：&lt;strong&gt;是，但只是火花。&lt;/strong&gt; 离真正的火焰，还需要一个范式级的突破。&lt;/p&gt;&#xA;&lt;p&gt;GPT-4证明了&amp;quot;规模&amp;quot;的力量——当模型足够大、数据足够多的时候，&amp;ldquo;预测下一个词&amp;quot;这个简单的规则，能够涌现出令人惊叹的能力。这告诉我们，AGI的某些基础能力，可能不需要&amp;quot;设计&amp;rdquo;，而是&amp;quot;长出来&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;但GPT-4也暴露了&amp;quot;规模&amp;quot;的边界——它不会规划，不会持续学习，没有内在动机，没有真正的理解。这些能力的缺失，靠&amp;quot;更大的模型、更多的数据&amp;quot;可能无法解决。微软的研究人员自己也说：&lt;strong&gt;&amp;ldquo;可能需要超越&amp;rsquo;下一词预测&amp;rsquo;的新范式。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;什么是&amp;quot;新范式&amp;quot;？也许是让AI具有&amp;quot;世界模型&amp;quot;——不仅仅是预测文字，而是理解文字背后所描述的世界。也许是给AI一个&amp;quot;身体&amp;quot;——让它能通过与环境互动来学习，就像人类婴儿通过触摸和探索来理解世界。也许是让AI拥有&amp;quot;内在动机&amp;quot;——不只是被动的响应者，而是主动的探索者。&lt;/p&gt;&#xA;&lt;p&gt;这些还都是开放问题。但有一点是确定的：&lt;strong&gt;AGI不会是一个&amp;quot;日期&amp;quot;，而是一个&amp;quot;过程&amp;quot;。&lt;/strong&gt; 就像GPT-4展现的&amp;quot;火花&amp;quot;，会被更多模型继承、放大、超越。从GPT-4到GPT-5，到多模态模型，到能持续学习的模型——每一次迭代，都在把&amp;quot;火花&amp;quot;吹得更旺一些。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声重新思考智能&#34;&gt;尾声：重新思考&amp;quot;智能&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：GPT-4真的在&amp;quot;思考&amp;quot;吗？&lt;/p&gt;&#xA;&lt;p&gt;这取决于你如何定义&amp;quot;思考&amp;quot;。如果&amp;quot;思考&amp;quot;意味着&amp;quot;基于输入生成有意义的输出&amp;quot;，那么GPT-4确实在思考。如果&amp;quot;思考&amp;quot;意味着&amp;quot;有意识、有意图、有内在体验&amp;quot;，那么GPT-4还差得远。&lt;/p&gt;&#xA;&lt;p&gt;但这个故事最有趣的地方，不是GPT-4有多&amp;quot;聪明&amp;quot;，而是它&lt;strong&gt;迫使我们重新思考&amp;quot;智能&amp;quot;本身&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;过去，我们觉得&amp;quot;智能&amp;quot;是神秘的、不可分解的。但GPT-4告诉我们，一个只会&amp;quot;预测下一个词&amp;quot;的系统，就能涌现出写诗、写代码、推理的能力。那&amp;quot;智能&amp;quot;本身，会不会也是一种更基础的规则在更大量级上的涌现？&lt;/p&gt;&#xA;&lt;p&gt;就像蚂蚁的&amp;quot;群体智慧&amp;quot;，不是蚂蚁变聪明了，而是规则在规模上产生了质变。&lt;/p&gt;&#xA;&lt;p&gt;也许，真正的AGI，不是造出一个&amp;quot;超级大脑&amp;quot;，而是找到那个&amp;quot;简单规则&amp;quot;，然后让它在足够大的规模上，涌现出我们无法想象的智能。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Bubeck, S., et al. (2023). Sparks of Artificial General Intelligence: Early experiments with GPT-4. &lt;em&gt;arXiv:2303.12712&lt;/em&gt;. Microsoft Research. &lt;a href=&#34;https://arxiv.org/abs/2303.12712&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;OpenAI (2023). GPT-4 Technical Report. &lt;em&gt;arXiv:2303.08774&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.08774&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2201.11903&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Mahowald, K., et al. (2023). Dissociating Language and Thought in Large Language Models. &lt;em&gt;arXiv:2301.06627&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2301.06627&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Chollet, F. (2019). On the Measure of Intelligence. &lt;em&gt;arXiv:1911.01547&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1911.01547&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>活着，就是一种「推理」——自由能原理如何统一了生命、大脑与AI</title>
				<link>https://lingyu7.com/posts/free-energy-principle-life-brain-ai/</link>
				<pubDate>Thu, 23 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/free-energy-principle-life-brain-ai/</guid>
				<description>&lt;h2 id=&#34;引言走进咖啡馆时你的大脑在做什么&#34;&gt;引言：走进咖啡馆时，你的大脑在做什么？&lt;/h2&gt;&#xA;&lt;p&gt;想象你走进一家熟悉的咖啡馆。&lt;/p&gt;&#xA;&lt;p&gt;推门的那一刻，你的大脑已经在做一件极其复杂的事情：&lt;strong&gt;预测&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;你预测门会发出&amp;quot;吱呀&amp;quot;一声（因为每次都是）。你预测吧台在左边、靠窗的座位在右边。你预测咖啡师会说&amp;quot;欢迎光临，老样子？&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;然后门响了——&amp;ldquo;吱呀&amp;rdquo;——和你预测的一样，你没什么感觉。&lt;/p&gt;&#xA;&lt;p&gt;接着咖啡师开口了：&amp;ldquo;今天打烊了，我们没营业。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你的大脑瞬间警觉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;等等，这和预测不一样。咖啡馆每天这个时间都营业的。为什么今天关门？发生了什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你的大脑开始&amp;quot;更新模型&amp;quot;：&lt;/strong&gt; 也许今天是法定假日？也许老板生病了？也许这家店要转让了？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;这个场景，完美地展示了你的大脑最核心的工作方式：&lt;strong&gt;它不是一个被动接收信息的器官，而是一个永不停歇的预测机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它持续不断地生成关于世界的&amp;quot;预测&amp;quot;，把这些预测和实际的感官输入做对比，然后用&amp;quot;预测误差&amp;quot;来更新自己的内部模型。&lt;/p&gt;&#xA;&lt;p&gt;这个观点，在认知科学中被称为&lt;strong&gt;预测编码&lt;/strong&gt;。但有一个更宏大的理论框架，把这件事推到了极致——&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它叫自由能原理（Free Energy Principle, FEP）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它声称：&lt;strong&gt;不只是你的大脑，而是整个生命系统——从单细胞生物到整个人类社会——都在做同一件事：最小化&amp;quot;自由能&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;自由能&amp;quot;是什么？为什么和你的生命有关？为什么这个理论被称作&amp;quot;自控制论以来最宏大的理论综合&amp;rdquo;？&lt;/p&gt;&#xA;&lt;p&gt;这篇文章，我们来拆解它。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一自由能到底是什么用一句话说清楚&#34;&gt;一、自由能到底是什么？——用一句话说清楚&lt;/h2&gt;&#xA;&lt;p&gt;先别被名字吓到。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;自由能&amp;quot;这个词来自物理学，但在自由能原理的语境下，它其实可以理解为：&lt;strong&gt;你的大脑对世界的&amp;quot;惊讶程度&amp;rdquo;（surprise）的上限。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;更准确地说——&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自由能 = 你的大脑预测的世界，与真实世界之间的差距。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个差距越小，你的&amp;quot;自由能&amp;quot;就越低，你就越&amp;quot;舒适&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个差距越大，你的&amp;quot;自由能&amp;quot;就越高，你就越&amp;quot;惊讶&amp;quot;——就像刚才那个咖啡馆的例子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自由能原理的核心主张就是：&lt;/strong&gt; 任何自组织系统（生命体、大脑、甚至整个生态系统）为了维持自身的有序状态，都必须持续地最小化自由能。&lt;/p&gt;&#xA;&lt;p&gt;换句话说：&lt;strong&gt;活着，就是在对抗&amp;quot;惊讶&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h3 id=&#34;两个减小惊讶的策略&#34;&gt;两个&amp;quot;减小惊讶&amp;quot;的策略&lt;/h3&gt;&#xA;&lt;p&gt;这个原理最精妙的地方在于，它揭示了所有生物都只有&lt;strong&gt;两种方式&lt;/strong&gt;来减小自由能：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;策略一：改变你的想法（感知）&lt;/strong&gt;&#xA;当你看到的东西和预测不一致时，你更新自己的内部模型，让预测更准。&lt;/p&gt;&#xA;&lt;p&gt;比如，你发现今天咖啡馆确实关门了，你更新自己的认知：&amp;ldquo;原来这家咖啡馆周日休息。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;策略二：改变这个世界（行动）&lt;/strong&gt;&#xA;当你看到的东西和预测不一致时，你干脆动手改变环境，让环境变得符合你的预测。&lt;/p&gt;&#xA;&lt;p&gt;比如，你太想喝咖啡了，于是你走到隔壁的咖啡馆，推门进去——&amp;ldquo;吱呀&amp;rdquo;——嗯，这下对了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知和行动，这两个看似完全不同的认知功能，在自由能原理下被统一为同一个目标——最小化自由能。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;感知是&amp;quot;改变想法以适应世界&amp;quot;，行动是&amp;quot;改变世界以匹配想法&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二这个理论不只是哲学2026年它在真实神经元上被证实了&#34;&gt;二、这个理论不只是&amp;quot;哲学&amp;quot;——2026年，它在真实神经元上被证实了&lt;/h2&gt;&#xA;&lt;p&gt;自由能原理由神经科学家卡尔·弗里斯顿（Karl Friston）在2000年代中期提出，在过去二十年里，它一直是一个&amp;quot;美丽的理论&amp;quot;——数学很优雅，解释力很强，但缺乏直接的实验证据。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2026年，这个缺口被补上了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;日本RIKEN研究所的研究团队在《自然·通讯》上发表了一项关键实验：他们在&lt;strong&gt;真实的生物神经元网络&lt;/strong&gt;上观察到了自由能最小化过程。&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？&lt;/p&gt;&#xA;&lt;p&gt;意味着自由能原理不再只是一个&amp;quot;数学上很美的理论框架&amp;quot;——它被证明是&lt;strong&gt;生物神经系统实际运行的机制&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;研究团队构建了培养神经元网络，并让它们接收特定的感官刺激模式。他们发现，这些神经元网络确实在主动预测接下来的刺激，并基于预测误差来调整自身的连接强度。整个过程中，神经元网络的&amp;quot;自由能&amp;quot;（即预测误差的信息论度量）确实在持续下降。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这不是一个关于AI的理论。这是一个关于&amp;quot;你&amp;quot;的理论——你的大脑，真的在用这种方式工作。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三更大的突破2026年的三个理论飞跃&#34;&gt;三、更大的突破：2026年的三个理论飞跃&lt;/h2&gt;&#xA;&lt;p&gt;2026年，自由能原理领域发生了三件大事，让这个理论从&amp;quot;神经科学的理论&amp;quot;变成了&amp;quot;AI设计的蓝图&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;突破一规划和感知被统一了&#34;&gt;突破一：规划和感知被统一了&lt;/h3&gt;&#xA;&lt;p&gt;2026年，Nuijten等人的研究发现了一件令人震惊的事：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;在自由能原理框架下，规划和感知使用的是同一个数学过程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，AI把&amp;quot;规划&amp;quot;（决定要做什么）和&amp;quot;感知&amp;quot;（理解当前环境）当作两个完全不同的模块来处理。但Nuijten证明，所谓的&amp;quot;规划&amp;quot;——也就是对未来行动序列的评估——本质上就是在做&amp;quot;带认知先验的变分推断&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;翻译成人话：你的大脑在&amp;quot;规划未来&amp;quot;时，用的算法和&amp;quot;理解现在&amp;quot;时是同一个。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？意味着&lt;strong&gt;好奇心不是附加的功能，而是自由能最小化的必然产物。&lt;/strong&gt; 当你探索未知事物时，你其实是在做一件事——&amp;ldquo;收集信息来减少未来可能遇到的惊讶&amp;rdquo;。探索和利用的权衡，不是大脑额外设计的机制，而是变分推断的固有性质。&lt;/p&gt;&#xA;&lt;h3 id=&#34;突破二多智能体系统也被统一了&#34;&gt;突破二：多智能体系统也被统一了&lt;/h3&gt;&#xA;&lt;p&gt;Bouchaffra等人（2026）提出了&amp;quot;集体变分原理&amp;quot;，将贝叶斯推断、博弈论与热力学统一为同一个数学结构。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个发现揭示了一件事：&lt;/strong&gt; 多个智能体之间的社会互动，和单个智能体的认知过程，遵循的是同一个底层原理——自由能最小化。&lt;/p&gt;&#xA;&lt;p&gt;当你在人群中走路时自动调整步伐、当你在对话中预测对方的下一个词、当你在团队中协调行动——这些&amp;quot;社会行为&amp;quot;和&amp;quot;个体认知&amp;quot;使用的是同一套底层机制。&lt;/p&gt;&#xA;&lt;h3 id=&#34;突破三自由能原理被用于解析llm的内部结构&#34;&gt;突破三：自由能原理被用于解析LLM的内部结构&lt;/h3&gt;&#xA;&lt;p&gt;在同一个2026年，Bouchaffra等人还将自由能原理应用于分析大语言模型（LLM）的多头注意力机制。&lt;/p&gt;&#xA;&lt;p&gt;他们发现，&lt;strong&gt;LLM的注意力头可以被理解为&amp;quot;自由能最小化&amp;quot;的智能体&lt;/strong&gt;——每个头都在做自己的&amp;quot;预测-校验&amp;quot;循环。通过分析这些头之间的&amp;quot;合作&amp;quot;与&amp;quot;冗余&amp;quot;，他们提出了一种新的模型剪枝方法：&lt;strong&gt;剪掉20%的注意力头，只增加了不到5%的困惑度，却减少了18%的计算量，提升了22%的吞吐量。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自由能原理不仅解释大脑，还给出了优化AI的实际方法。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四ai的下一个方向axiom模型与主动推理&#34;&gt;四、AI的下一个方向：AXIOM模型与主动推理&lt;/h2&gt;&#xA;&lt;p&gt;如果自由能原理真的能指导AI设计，那它应该能造出更好的AI。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
