<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>神经网络本质 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C%E6%9C%AC%E8%B4%A8/</link>
		<description>Recent content in 神经网络本质 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sun, 26 Jul 2026 02:29:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C%E6%9C%AC%E8%B4%A8/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的「视觉错觉」——为什么一张贴纸就能骗过世界上最聪明的AI</title>
				<link>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</link>
				<pubDate>Sun, 26 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</guid>
				<description>&lt;h2 id=&#34;引言一张贴纸让最聪明的ai变成了盲人&#34;&gt;引言：一张贴纸，让最聪明的AI变成了&amp;quot;盲人&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2017年，一群研究人员做了一个实验。&lt;/p&gt;&#xA;&lt;p&gt;他们在路边放了一个&amp;quot;停止&amp;quot;标志牌——红底白字，八边形，全世界的司机都认识。然后，他们在上面贴了几张小小的黑白贴纸，贴的位置看起来毫无规律。&lt;/p&gt;&#xA;&lt;p&gt;接着，他们让一辆搭载了最先进AI识别系统的测试车驶过这个标志牌。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;结果令人震惊：AI把&amp;quot;停止牌&amp;quot;认成了&amp;quot;限速牌&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;贴纸的位置和图案是精心设计的——对人类来说，它们只是毫无意义的涂鸦，不影响我们认出&amp;quot;停止牌&amp;quot;。但AI的&amp;quot;眼睛&amp;quot;被这些贴纸彻底欺骗了。它看到了一个和&amp;quot;停止牌&amp;quot;完全不同的东西。&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻电影的情节。这是真实发生的实验。这种能让AI&amp;quot;看错&amp;quot;的特殊图案，有一个名字：&lt;strong&gt;对抗样本（Adversarial Examples）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它们被称为&amp;quot;AI的视觉错觉&amp;quot;——就像人类会被&amp;quot;视觉错觉图&amp;quot;骗到一样，AI也有自己的&amp;quot;视觉错觉&amp;quot;。但和人类视觉错觉不同的是，&lt;strong&gt;AI的&amp;quot;错觉&amp;quot;可以被精确地设计和制造，而且几乎无法通过&amp;quot;多看两眼&amp;quot;来纠正。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一对抗样本是什么一个差之毫厘谬以千里的故事&#34;&gt;一、对抗样本是什么？——一个&amp;quot;差之毫厘，谬以千里&amp;quot;的故事&lt;/h2&gt;&#xA;&lt;p&gt;先来看一个更经典的例子。&lt;/p&gt;&#xA;&lt;p&gt;2015年，Goodfellow和他的团队做了一个实验：&lt;/p&gt;&#xA;&lt;p&gt;他们给AI看一张熊猫的照片。AI以99.9%的置信度判断：&amp;ldquo;这是一只熊猫&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，他们在原始图片上叠加了一层肉眼几乎看不见的&amp;quot;噪声&amp;quot;——就像电视信号不好时画面上的雪花点。&lt;strong&gt;这层噪声极淡，淡到人眼根本无法察觉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但AI再看这张图时，它说：&amp;ldquo;这是一只长臂猿&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;原始图片 vs 加了噪声的图片——人眼看几乎一模一样，AI眼里却天差地别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是对抗样本的&amp;quot;核心魔法&amp;quot;：&lt;strong&gt;在人类无法察觉的微小变化上，AI的判断可以发生180度大转弯。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;对抗样本的正式定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;对原始输入（一张图片、一段音频、一段文字）施加一个&lt;strong&gt;人类无法察觉的微小扰动&lt;/strong&gt;，使得AI模型的输出&lt;strong&gt;发生显著错误&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这个扰动不是随机的，而是&lt;strong&gt;精心设计的&lt;/strong&gt;——它针对的是AI模型的&amp;quot;弱点&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么ai会被骗因为ai的看和你的看不一样&#34;&gt;二、为什么AI会被骗？——因为AI的&amp;quot;看&amp;quot;和你的&amp;quot;看&amp;quot;不一样&lt;/h2&gt;&#xA;&lt;p&gt;要理解这件事，你需要先理解一个关键的区别：&lt;strong&gt;AI的&amp;quot;眼睛&amp;quot;和你的眼睛，工作原理完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类怎么看&#34;&gt;人类怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;你看到&amp;quot;停止牌&amp;quot;的时候，大脑做的是&lt;strong&gt;语义理解&lt;/strong&gt;——你看到的是&amp;quot;一个红色的八边形，上面写着&amp;rsquo;停&amp;rsquo;这个字&amp;quot;。你提取了它的&lt;strong&gt;意义&lt;/strong&gt;，而不是它的&lt;strong&gt;像素值&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;即使停止牌上沾了点泥巴、被风吹歪了30度、或者上面贴了几张贴纸——你依然能认出它。因为你的大脑在做&amp;quot;概念匹配&amp;quot;：不管细节怎么变，只要核心特征（红色、八边形、中间有字）在，就是&amp;quot;停止牌&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai怎么看&#34;&gt;AI怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;AI看到一张图片时，它看到的不是&amp;quot;概念&amp;quot;，而是&lt;strong&gt;数字&lt;/strong&gt;。一张图片在AI眼里，就是一个巨大的数字矩阵——每个像素点有三个数字（红、绿、蓝的亮度值），范围从0到255。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;停止牌&amp;quot;对于AI来说，就是&amp;quot;R=200, G=25, B=25&amp;rdquo;（红色区域）和&amp;quot;R=255, G=255, B=255&amp;quot;（白色文字区域）的特定排列组合。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;识别&amp;quot;过程，本质上是在做&amp;quot;数字模式匹配&amp;quot;——它从海量的训练数据中学习到：&amp;ldquo;当这些数字以某种方式排列时，它应该输出&amp;rsquo;停止牌&amp;rsquo;&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;关键差异ai对微小变化的极度敏感&#34;&gt;关键差异：AI对&amp;quot;微小变化&amp;quot;的极度敏感&lt;/h3&gt;&#xA;&lt;p&gt;人类大脑处理的是&amp;quot;语义层级&amp;rdquo;——你看到的是&amp;quot;概念&amp;quot;和&amp;quot;意义&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI处理的是&amp;quot;数字层级&amp;quot;——它看到的是&amp;quot;数值&amp;quot;和&amp;quot;模式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;对人类来说微不足道的数值变化，对AI来说可能是天翻地覆的模式变化。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的数字矩阵中做微调：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;把&amp;quot;停止牌&amp;quot;图片中某个像素的红色值从200调到210&lt;/li&gt;&#xA;&lt;li&gt;把另一个像素的蓝色值从50调到55&lt;/li&gt;&#xA;&lt;li&gt;重复1000次这样的微调&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;对人类来说，这些变化无法察觉。&lt;/strong&gt; 因为&amp;quot;红色&amp;quot;仍然是&amp;quot;红色&amp;quot;，&amp;ldquo;八边形&amp;quot;仍然是&amp;quot;八边形&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但对AI来说，这些变化的累积效果，可能让它看到的&amp;quot;数字模式&amp;quot;完全变成了另一个东西。&lt;/strong&gt; 就像你在一个密码锁上，把每个数字都拨动了一点点——组合起来，密码就完全变了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三对抗样本是怎么造出来的问aiai就会告诉你&#34;&gt;三、对抗样本是怎么造出来的？——&amp;ldquo;问AI，AI就会告诉你&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2015年，Goodfellow提出了一个极简的对抗样本生成方法，叫&lt;strong&gt;FGSM（快速梯度符号法）&lt;/strong&gt;。它的原理简单到令人惊讶：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：把图片输入AI，让AI执行正常的识别流程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;前向传播&amp;quot;——图片通过神经网络的每一层，最终得到一个输出：&amp;ldquo;这只熊猫的概率是99.9%&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：问AI一个问题——&amp;ldquo;如果要让输出变成&amp;rsquo;长臂猿&amp;rsquo;，图片应该怎么改？&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;反向传播&amp;rdquo;——计算梯度。梯度告诉我们：如果改变这个像素的值，AI的输出会往哪个方向变化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：在所有像素上，沿着&amp;quot;让输出变成&amp;rsquo;长臂猿&amp;rsquo;&amp;ldquo;的方向，都走一小步。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一步产生的&amp;quot;噪声&amp;rdquo;，就是对抗样本的核心。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：这个过程只需要一次&amp;quot;前向传播&amp;quot;和一次&amp;quot;反向传播&amp;quot;。&lt;/strong&gt; 也就是说，你只需要问AI一次&amp;quot;怎么改你才会犯错&amp;quot;，AI就会告诉你答案。&lt;/p&gt;&#xA;&lt;p&gt;这就像你问一个密码锁：&amp;ldquo;我的密码是0000，但我想打开它。告诉我，每个数字应该怎么调？&amp;ldquo;密码锁回答说：&amp;ldquo;第一位+3，第二位-1，第三位+2，第四位-5。&amp;quot;——然后你就知道了正确的密码。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI对对抗样本的&amp;quot;脆弱性&amp;rdquo;，不是它的漏洞，而是它的特性。&lt;/strong&gt; 因为AI的决策过程是&amp;quot;可微分的&amp;rdquo;——你可以通过数学求导，找出&amp;quot;让AI犯错的最短路径&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四对抗样本告诉我们什么ai的理解是脆弱的&#34;&gt;四、对抗样本告诉我们什么？——AI的&amp;quot;理解&amp;quot;是脆弱的&lt;/h2&gt;&#xA;&lt;p&gt;对抗样本的存在，揭示了AI&amp;quot;理解&amp;quot;世界的三个深层真相。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相一ai看到的不是语义是表面特征&#34;&gt;真相一：AI看到的不是&amp;quot;语义&amp;quot;，是&amp;quot;表面特征&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;AI在训练时，学到的不是&amp;quot;猫的概念&amp;quot;——它学到的是一组&amp;quot;猫图片的统计特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着，如果你在猫的图片上叠加一层精心设计的噪声，让AI的&amp;quot;猫特征统计&amp;quot;变成&amp;quot;狗特征统计&amp;quot;，AI就会把猫认成狗。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是统计性的，不是语义性的。&lt;/strong&gt; 它知道&amp;quot;猫&amp;quot;和&amp;quot;毛茸茸&amp;quot;、&amp;ldquo;有耳朵&amp;quot;经常一起出现，但它不知道&amp;quot;猫&amp;quot;是一个有生命的、会呼吸的、和人类有情感联系的动物。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相二ai的决策边界和人类的概念边界不重合&#34;&gt;真相二：AI的&amp;quot;决策边界&amp;quot;和人类的&amp;quot;概念边界&amp;quot;不重合&lt;/h3&gt;&#xA;&lt;p&gt;人类的概念有&amp;quot;鲁棒性&amp;rdquo;——&amp;ldquo;猫&amp;quot;的概念边界很宽，不管猫是黑是白、是胖是瘦、是坐是躺，你都能认出来。&lt;/p&gt;&#xA;&lt;p&gt;AI的决策边界是&amp;quot;精确但不鲁棒&amp;quot;的——它在训练数据覆盖的区域内表现很好，但在训练数据覆盖的边缘地带，可能突然崩溃。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「遗忘」艺术——为什么学会丢掉信息，才是真正的智能</title>
				<link>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</link>
				<pubDate>Sat, 25 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</guid>
				<description>&lt;h2 id=&#34;引言你的大脑是一个遗忘大师&#34;&gt;引言：你的大脑，是一个&amp;quot;遗忘大师&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;我们来做一个小实验。&lt;/p&gt;&#xA;&lt;p&gt;回想一下，上周三的午饭你吃了什么？如果你能立刻回答出来，那你属于少数人。大多数人需要想一会儿，甚至根本想不起来。&lt;/p&gt;&#xA;&lt;p&gt;但这不是问题——&lt;strong&gt;这是优点。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你每天摄入海量的信息：看到的、听到的、闻到的、触摸到的、思考到的。如果全部记住，你的大脑会迅速被撑爆。所以你的大脑做了一个极其聪明的选择：&lt;strong&gt;只保留&amp;quot;可能有用&amp;quot;的信息，扔掉其余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以准确说出自己家的地址，但记不住昨天路过的那家便利店门口垃圾桶的颜色。&lt;/p&gt;&#xA;&lt;p&gt;你可以认出朋友的脸，但记不住他上周三穿的是什么颜色的袜子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你之所以智能，不是因为你会记住，而是因为你学会了遗忘。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的道理，其实是AI领域最深刻的理论之一。它有一个名字，叫&lt;strong&gt;信息瓶颈（Information Bottleneck）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一信息瓶颈是什么一个抄笔记的隐喻&#34;&gt;一、信息瓶颈是什么？——一个&amp;quot;抄笔记&amp;quot;的隐喻&lt;/h2&gt;&#xA;&lt;p&gt;想象你在上数学课。&lt;/p&gt;&#xA;&lt;p&gt;老师讲了一道很复杂的微积分题，你需要在有限的时间内记笔记。&lt;/p&gt;&#xA;&lt;p&gt;你有两种记法：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：逐字逐句地记。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;老师说的每一个字你都记下来——&amp;ldquo;好，我们来看这道题，第一步，先求导……&amp;ldquo;你连老师的语气词都没放过。下课后，你的笔记本比老师的教案还厚。&lt;/p&gt;&#xA;&lt;p&gt;但问题是，你记了这么多，&lt;strong&gt;真正有用的信息被淹没在大量废话里了。&lt;/strong&gt; 考试的时候，你根本找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：只记关键步骤。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你快速判断：这道题的核心是&amp;quot;链式法则&amp;rdquo;。你只记下关键公式和两个关键步骤，其他的都忽略。笔记只有三行，但每一行都是精华。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论要回答的，就是这个问题：如何找到&amp;quot;最优的笔记&amp;rdquo;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它正式的定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;给定输入X（老师讲的全部内容）和输出Y（考试要考的知识点），找到一个压缩表示Z（你的笔记），使得：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Z尽可能小（压缩率高，笔记简洁）&lt;/li&gt;&#xA;&lt;li&gt;Z尽可能保留关于Y的信息（预测能力强，考试能拿分）&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;这两个目标相互矛盾。&lt;/strong&gt; 笔记越简洁，丢失的信息越多，预测能力可能下降；笔记越详细，预测能力越强，但压缩率差。&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论的核心贡献是：&lt;strong&gt;它给出了这个权衡的数学最优解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个公式道尽智能的本质&#34;&gt;二、一个公式，道尽智能的本质&lt;/h2&gt;&#xA;&lt;p&gt;信息瓶颈的核心公式，其实只有一行：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最小化：I(X;Z) — β × I(Z;Y)&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不要被公式吓到——它表达的是一种我们每天都在做的直觉判断。&lt;/p&gt;&#xA;&lt;p&gt;让我们拆解一下：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(X;Z)&lt;/strong&gt;：你的笔记（Z）包含的原始信息（X）的量。这个值越小，说明你的笔记越&amp;quot;压缩&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(Z;Y)&lt;/strong&gt;：你的笔记（Z）能预测考试内容（Y）的能力。这个值越大，说明你的笔记越&amp;quot;有用&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;β&lt;/strong&gt;：一个调节旋钮，控制你更看重&amp;quot;简洁&amp;quot;还是&amp;quot;准确&amp;quot;。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个公式的哲学是：最优的智能，不是&amp;quot;记住最多信息&amp;quot;，而是&amp;quot;用最少的信息，保留最多的价值&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;β=0时，你只关心压缩，笔记只有一行&amp;quot;今天上了数学课&amp;quot;——考试肯定挂。&lt;/p&gt;&#xA;&lt;p&gt;β=很大时，你只关心预测，笔记有几万字——信息过载，考试时找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;β=最优值时，你的笔记刚好记下关键点——考试时思路清晰，效率最高。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;最优值&amp;quot;对应的笔记，就是信息瓶颈理论所说的&amp;quot;最优表征&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三深度学习本质上就在做这件事&#34;&gt;三、深度学习，本质上就在做这件事&lt;/h2&gt;&#xA;&lt;p&gt;2015年，信息论专家纳夫塔利·蒂什比（Naftali Tishby）提出了一个大胆的观点：&lt;strong&gt;深度神经网络训练的过程，本质上就是在解信息瓶颈问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他做了一个实验，让一个神经网络在手写数字识别任务上训练，然后观察每一层神经元在训练过程中的变化。&lt;/p&gt;&#xA;&lt;p&gt;结果非常有趣：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：拟合（Fitting）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;刚开始训练时，网络在&amp;quot;记住&amp;quot;训练数据。每一层的神经元都在努力获取关于输入X的信息——I(X;Z)迅速上升。&lt;/p&gt;&#xA;&lt;p&gt;这就像你刚开始听课时的状态——拼命记笔记，生怕漏掉一个字。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：压缩（Compression）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;训练到一定阶段后，网络开始&amp;quot;遗忘&amp;quot;。它不再关注输入中的无关细节，而是只保留对分类有用的特征。&lt;/p&gt;&#xA;&lt;p&gt;I(X;Z)下降，但I(Z;Y)保持不变甚至上升——&lt;strong&gt;你丢掉了废话，留下了精华。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是深度学习成功的秘密：它不是在学习&amp;quot;记住所有东西&amp;quot;，而是在学习&amp;quot;忘记不重要的东西&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有经过充分训练的AI，就像那个逐字逐句记笔记的学生——它记住了训练数据的每一个细节，但换一个场景就不知所措了（这就是我们说的&amp;quot;过拟合&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;一个训练充分的AI，就像那个只记关键点的学生——它抓住了问题的本质，即使面对新情况也能灵活应对（这就是&amp;quot;泛化能力&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论告诉我们：泛化能力，本质上就是压缩能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么忘记比记住更难&#34;&gt;四、为什么&amp;quot;忘记&amp;quot;比&amp;quot;记住&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然压缩这么重要，那让AI使劲压缩不就行了？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;没那么简单。因为压缩的前提是：你知道什么该保留，什么该丢弃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个刚出生的婴儿，分不清&amp;quot;妈妈的脸&amp;quot;和&amp;quot;天花板的颜色&amp;quot;哪个更重要。他需要大量的学习和经验，才能建立起&amp;quot;哪些信息值得保留&amp;quot;的判断力。&lt;/p&gt;&#xA;&lt;p&gt;同样，AI在训练初期也不知道什么特征重要。它需要反复试错，才能学会&amp;quot;压缩&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么深度学习需要海量数据——不是为了让AI记住更多，而是为了让AI学会该忘记什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论揭示了另一个惊人的事实：&lt;strong&gt;最优的压缩，会自然地出现在神经网络的不同层之间。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果你把神经网络看成一个流水线：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第一层：处理最原始的信息（像素级别的颜色、边缘）&lt;/li&gt;&#xA;&lt;li&gt;中间层：开始提取有意义的模式（形状、纹理）&lt;/li&gt;&#xA;&lt;li&gt;最后一层：只保留最&amp;quot;有用&amp;quot;的特征（&amp;ldquo;这是一只猫&amp;quot;的判断）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;每一层都在做一次信息瓶颈——压缩输入，保留对下一层有用的信息。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
