<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>表征学习 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E8%A1%A8%E5%BE%81%E5%AD%A6%E4%B9%A0/</link>
		<description>Recent content in 表征学习 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 25 Jul 2026 02:29:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E8%A1%A8%E5%BE%81%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的「遗忘」艺术——为什么学会丢掉信息，才是真正的智能</title>
				<link>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</link>
				<pubDate>Sat, 25 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</guid>
				<description>&lt;h2 id=&#34;引言你的大脑是一个遗忘大师&#34;&gt;引言：你的大脑，是一个&amp;quot;遗忘大师&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;我们来做一个小实验。&lt;/p&gt;&#xA;&lt;p&gt;回想一下，上周三的午饭你吃了什么？如果你能立刻回答出来，那你属于少数人。大多数人需要想一会儿，甚至根本想不起来。&lt;/p&gt;&#xA;&lt;p&gt;但这不是问题——&lt;strong&gt;这是优点。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你每天摄入海量的信息：看到的、听到的、闻到的、触摸到的、思考到的。如果全部记住，你的大脑会迅速被撑爆。所以你的大脑做了一个极其聪明的选择：&lt;strong&gt;只保留&amp;quot;可能有用&amp;quot;的信息，扔掉其余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以准确说出自己家的地址，但记不住昨天路过的那家便利店门口垃圾桶的颜色。&lt;/p&gt;&#xA;&lt;p&gt;你可以认出朋友的脸，但记不住他上周三穿的是什么颜色的袜子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你之所以智能，不是因为你会记住，而是因为你学会了遗忘。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的道理，其实是AI领域最深刻的理论之一。它有一个名字，叫&lt;strong&gt;信息瓶颈（Information Bottleneck）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一信息瓶颈是什么一个抄笔记的隐喻&#34;&gt;一、信息瓶颈是什么？——一个&amp;quot;抄笔记&amp;quot;的隐喻&lt;/h2&gt;&#xA;&lt;p&gt;想象你在上数学课。&lt;/p&gt;&#xA;&lt;p&gt;老师讲了一道很复杂的微积分题，你需要在有限的时间内记笔记。&lt;/p&gt;&#xA;&lt;p&gt;你有两种记法：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：逐字逐句地记。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;老师说的每一个字你都记下来——&amp;ldquo;好，我们来看这道题，第一步，先求导……&amp;ldquo;你连老师的语气词都没放过。下课后，你的笔记本比老师的教案还厚。&lt;/p&gt;&#xA;&lt;p&gt;但问题是，你记了这么多，&lt;strong&gt;真正有用的信息被淹没在大量废话里了。&lt;/strong&gt; 考试的时候，你根本找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：只记关键步骤。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你快速判断：这道题的核心是&amp;quot;链式法则&amp;rdquo;。你只记下关键公式和两个关键步骤，其他的都忽略。笔记只有三行，但每一行都是精华。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论要回答的，就是这个问题：如何找到&amp;quot;最优的笔记&amp;rdquo;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它正式的定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;给定输入X（老师讲的全部内容）和输出Y（考试要考的知识点），找到一个压缩表示Z（你的笔记），使得：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Z尽可能小（压缩率高，笔记简洁）&lt;/li&gt;&#xA;&lt;li&gt;Z尽可能保留关于Y的信息（预测能力强，考试能拿分）&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;这两个目标相互矛盾。&lt;/strong&gt; 笔记越简洁，丢失的信息越多，预测能力可能下降；笔记越详细，预测能力越强，但压缩率差。&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论的核心贡献是：&lt;strong&gt;它给出了这个权衡的数学最优解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个公式道尽智能的本质&#34;&gt;二、一个公式，道尽智能的本质&lt;/h2&gt;&#xA;&lt;p&gt;信息瓶颈的核心公式，其实只有一行：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最小化：I(X;Z) — β × I(Z;Y)&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不要被公式吓到——它表达的是一种我们每天都在做的直觉判断。&lt;/p&gt;&#xA;&lt;p&gt;让我们拆解一下：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(X;Z)&lt;/strong&gt;：你的笔记（Z）包含的原始信息（X）的量。这个值越小，说明你的笔记越&amp;quot;压缩&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(Z;Y)&lt;/strong&gt;：你的笔记（Z）能预测考试内容（Y）的能力。这个值越大，说明你的笔记越&amp;quot;有用&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;β&lt;/strong&gt;：一个调节旋钮，控制你更看重&amp;quot;简洁&amp;quot;还是&amp;quot;准确&amp;quot;。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个公式的哲学是：最优的智能，不是&amp;quot;记住最多信息&amp;quot;，而是&amp;quot;用最少的信息，保留最多的价值&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;β=0时，你只关心压缩，笔记只有一行&amp;quot;今天上了数学课&amp;quot;——考试肯定挂。&lt;/p&gt;&#xA;&lt;p&gt;β=很大时，你只关心预测，笔记有几万字——信息过载，考试时找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;β=最优值时，你的笔记刚好记下关键点——考试时思路清晰，效率最高。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;最优值&amp;quot;对应的笔记，就是信息瓶颈理论所说的&amp;quot;最优表征&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三深度学习本质上就在做这件事&#34;&gt;三、深度学习，本质上就在做这件事&lt;/h2&gt;&#xA;&lt;p&gt;2015年，信息论专家纳夫塔利·蒂什比（Naftali Tishby）提出了一个大胆的观点：&lt;strong&gt;深度神经网络训练的过程，本质上就是在解信息瓶颈问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他做了一个实验，让一个神经网络在手写数字识别任务上训练，然后观察每一层神经元在训练过程中的变化。&lt;/p&gt;&#xA;&lt;p&gt;结果非常有趣：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：拟合（Fitting）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;刚开始训练时，网络在&amp;quot;记住&amp;quot;训练数据。每一层的神经元都在努力获取关于输入X的信息——I(X;Z)迅速上升。&lt;/p&gt;&#xA;&lt;p&gt;这就像你刚开始听课时的状态——拼命记笔记，生怕漏掉一个字。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：压缩（Compression）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;训练到一定阶段后，网络开始&amp;quot;遗忘&amp;quot;。它不再关注输入中的无关细节，而是只保留对分类有用的特征。&lt;/p&gt;&#xA;&lt;p&gt;I(X;Z)下降，但I(Z;Y)保持不变甚至上升——&lt;strong&gt;你丢掉了废话，留下了精华。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是深度学习成功的秘密：它不是在学习&amp;quot;记住所有东西&amp;quot;，而是在学习&amp;quot;忘记不重要的东西&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有经过充分训练的AI，就像那个逐字逐句记笔记的学生——它记住了训练数据的每一个细节，但换一个场景就不知所措了（这就是我们说的&amp;quot;过拟合&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;一个训练充分的AI，就像那个只记关键点的学生——它抓住了问题的本质，即使面对新情况也能灵活应对（这就是&amp;quot;泛化能力&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论告诉我们：泛化能力，本质上就是压缩能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么忘记比记住更难&#34;&gt;四、为什么&amp;quot;忘记&amp;quot;比&amp;quot;记住&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然压缩这么重要，那让AI使劲压缩不就行了？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;没那么简单。因为压缩的前提是：你知道什么该保留，什么该丢弃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个刚出生的婴儿，分不清&amp;quot;妈妈的脸&amp;quot;和&amp;quot;天花板的颜色&amp;quot;哪个更重要。他需要大量的学习和经验，才能建立起&amp;quot;哪些信息值得保留&amp;quot;的判断力。&lt;/p&gt;&#xA;&lt;p&gt;同样，AI在训练初期也不知道什么特征重要。它需要反复试错，才能学会&amp;quot;压缩&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么深度学习需要海量数据——不是为了让AI记住更多，而是为了让AI学会该忘记什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论揭示了另一个惊人的事实：&lt;strong&gt;最优的压缩，会自然地出现在神经网络的不同层之间。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果你把神经网络看成一个流水线：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第一层：处理最原始的信息（像素级别的颜色、边缘）&lt;/li&gt;&#xA;&lt;li&gt;中间层：开始提取有意义的模式（形状、纹理）&lt;/li&gt;&#xA;&lt;li&gt;最后一层：只保留最&amp;quot;有用&amp;quot;的特征（&amp;ldquo;这是一只猫&amp;quot;的判断）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;每一层都在做一次信息瓶颈——压缩输入，保留对下一层有用的信息。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>自学成才的AI——没有老师，它是怎么学会「看懂」世界的？</title>
				<link>https://lingyu7.com/posts/self-supervised-learning-ai-sees-without-teacher/</link>
				<pubDate>Tue, 21 Jul 2026 02:31:20 +0800</pubDate>
				<guid>https://lingyu7.com/posts/self-supervised-learning-ai-sees-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言你给ai看了一亿张图但没告诉它任何一张是什么&#34;&gt;引言：你给AI看了一亿张图，但没告诉它任何一张是什么&lt;/h2&gt;&#xA;&lt;p&gt;想象你是一个刚出生的婴儿，被扔进一个充满图片的世界。&lt;/p&gt;&#xA;&lt;p&gt;没有人指着猫说&amp;quot;这是猫&amp;quot;，没有人告诉你&amp;quot;这是红色&amp;quot;、&amp;ldquo;那是圆形&amp;rdquo;。你只能自己看、自己比较、自己找规律。&lt;/p&gt;&#xA;&lt;p&gt;你会怎么学习？&lt;/p&gt;&#xA;&lt;p&gt;这个问题的答案，指向了AI领域过去几年最深层的变革之一——&lt;strong&gt;自监督学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI训练方式很&amp;quot;娇气&amp;quot;：需要人类一张一张地标注数据。&amp;ldquo;这张图是猫，那张图是狗，这张是车……&amp;rdquo; 标注一亿张图需要的人力成本，够一个中型公司破产好几次。&lt;/p&gt;&#xA;&lt;p&gt;但现实世界的数据是没有标签的——互联网上每天产生数亿张图片，没人在上面写&amp;quot;这是风景&amp;quot;或&amp;quot;这是美食&amp;quot;。如果AI只能从有标签的数据中学习，它的&amp;quot;视野&amp;quot;就永远被人类标注的边界所限制。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习改变了这一切。&lt;/strong&gt; 它让AI在没有人类老师的情况下，自己从海量无标签数据中学习。&lt;/p&gt;&#xA;&lt;p&gt;但问题是：&lt;strong&gt;AI真的&amp;quot;学会&amp;quot;了吗？还是只是在玩一场自己设计规则的、精妙的游戏？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一策略一找不同这两张图是同一个东西吗&#34;&gt;一、策略一：找不同——&amp;ldquo;这两张图是同一个东西吗？&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第一种自监督学习策略，叫&lt;strong&gt;对比学习&lt;/strong&gt;。它的思路简单到令人发指：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;给AI看两张图，问它：这两张是同一个东西的&amp;quot;变体&amp;quot;，还是完全不同的东西？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;以SimCLR（2020年Google提出）为代表，这套方法的玩法是这样的：&lt;/p&gt;&#xA;&lt;p&gt;第一步：从一张猫的图片出发，做两次不同的&amp;quot;整容&amp;quot;——一次把它旋转+裁剪，一次给它调色+模糊。这两张&amp;quot;整容后&amp;quot;的图片，就是&amp;quot;正样本对&amp;quot;——它们是同一个东西的不同版本。&lt;/p&gt;&#xA;&lt;p&gt;第二步：再从同一个训练批次里，随机抓一堆其他图片（狗、车、树……），作为&amp;quot;负样本&amp;quot;——这些是&amp;quot;不同东西&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;第三步：让AI把所有图片映射到一个&amp;quot;嵌入空间&amp;quot;里——一个高维的&amp;quot;特征地图&amp;quot;。要求是：&lt;strong&gt;正样本对在空间里靠得近，负样本对在空间里离得远&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;就这么简单？差不多。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的派对上，所有人戴着面具。你的任务是：找到你的双胞胎兄弟。&lt;/p&gt;&#xA;&lt;p&gt;你只有一次机会——你可以在人群中任意选两个人，问：&amp;ldquo;他们是不是同一个人的不同造型？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;每问一次，你就学到一点特征：哦，原来我兄弟的&lt;strong&gt;身形轮廓&lt;/strong&gt;是稳定的，但&lt;strong&gt;衣服颜色&lt;/strong&gt;可以变；原来他的&lt;strong&gt;身高&lt;/strong&gt;是特征，但&lt;strong&gt;站姿&lt;/strong&gt;不是。&lt;/p&gt;&#xA;&lt;p&gt;SimCLR做的就是这件事——只不过它问了上亿次。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果如何？&lt;/strong&gt; 惊人地好。SimCLR在ImageNet上的分类准确率达到了76.5%，接近甚至超过了当时许多有监督学习方法。而且它学到的&amp;quot;视觉特征&amp;quot;非常通用——不仅在分类任务上表现好，在目标检测、语义分割等其他任务上也能迁移使用。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但问题来了：它真的&amp;quot;理解&amp;quot;猫是什么了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;仔细想想SimCLR实际在做的事：它只是被训练去&amp;quot;让同一张图片的两个增强版本靠近，让不同图片的版本远离&amp;quot;。它从来没有被告知&amp;quot;猫&amp;quot;这个概念，也不知道&amp;quot;猫&amp;quot;和&amp;quot;狗&amp;quot;的边界在哪里。&lt;/p&gt;&#xA;&lt;p&gt;它能区分猫和狗，是因为&lt;strong&gt;猫和狗在自然图像中的底层结构差异足够大&lt;/strong&gt;——它们占据的&amp;quot;像素空间&amp;quot;区域天然不同，经过增强后仍然不同。SimCLR的&amp;quot;靠近/远离&amp;quot;操作，恰好利用了这种天然差异。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;也就是说：SimCLR不是在&amp;quot;理解语义&amp;quot;，而是在&amp;quot;利用数据的统计结构&amp;quot;。&lt;/strong&gt; 它发现了一个&amp;quot;好用的区分方式&amp;quot;，但这个方式恰好与人类的语义类别对齐了。&lt;/p&gt;&#xA;&lt;p&gt;这不是坏事——实际上，这种&amp;quot;对齐&amp;quot;正是自监督学习的核心价值。但认识到这一点很重要：&lt;strong&gt;AI的&amp;quot;聪明&amp;quot;和人类的&amp;quot;理解&amp;quot;，底层逻辑可能完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二策略二填空遮住大部分猜出少部分&#34;&gt;二、策略二：填空——&amp;ldquo;遮住大部分，猜出少部分&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第二种策略，来自一个更直观的想法：&lt;strong&gt;如果你能完美地猜出被遮住的部分，说明你真的理解了整体。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是MAE（Masked Autoencoder，掩码自编码器，2021年Meta提出）的核心思路。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;玩法是这样的：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;第一步：把一张猫的图片切成196个16x16的小块，然后&lt;strong&gt;随机遮住其中75%——只留49个小块可见&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第二步：把剩下的49个可见小块输入编码器，让编码器&amp;quot;看&amp;quot;这49个碎片。&lt;/p&gt;&#xA;&lt;p&gt;第三步：用一个轻量解码器，从这49个碎片中&lt;strong&gt;重建出全部的196个小块&lt;/strong&gt;——包括被遮住的那147个。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：&lt;/strong&gt; 编码器只看25%的碎片，解码器必须重建100%的图像。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么遮住75%这么极端？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;因为如果只遮住10%，AI可以靠&amp;quot;邻接像素的颜色渐变&amp;quot;来填充——就像你在Photoshop里用&amp;quot;内容感知填充&amp;quot;一样。但遮住75%后，邻接信息几乎没有了，AI必须真正理解&amp;quot;这张图里有一只猫在草地上&amp;quot;才能猜出猫耳朵的位置、草地的纹理。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;给你看一张拼图的25块碎片，要你猜出整幅拼图的内容——包括你完全没看到的那些碎片。&lt;/p&gt;&#xA;&lt;p&gt;如果你猜对了，那说明你真的从这些碎片中&amp;quot;推导&amp;quot;出了整幅图的结构——而不是简单地&amp;quot;填补&amp;quot;了空白。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE的效果更是惊人：&lt;/strong&gt; 在ImageNet上达到了87.8%的Top-1准确率，并且展现出极强的规模扩展性——模型越大，效果越好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但它真的&amp;quot;理解&amp;quot;了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从Ω-CFI框架来看，MAE的本质是一个&lt;strong&gt;高维空间中的条件生成模型&lt;/strong&gt;：给定稀疏的观测（25%的可见块），在隐空间中构建一个&amp;quot;低秩流形&amp;quot;，让缺失部分在这个流形上的投影误差最小。&lt;/p&gt;&#xA;&lt;p&gt;说人话就是：&lt;strong&gt;MAE不是在&amp;quot;理解语义&amp;quot;，而是在&amp;quot;找到自然图像在数学空间中的低维结构&amp;quot;&lt;/strong&gt;。因为自然图像——无论是猫、狗、还是风景——本质上都存在于一个低维流形上（即&amp;quot;真实世界图像&amp;quot;只占所有可能像素组合的极小一部分）。MAE通过高掩码率，迫使模型找到这个流形。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这里的微妙之处：&lt;/strong&gt; 这个&amp;quot;低维流形&amp;quot;恰好与人类语义结构高度重合。不是因为MAE理解了&amp;quot;猫&amp;quot;是什么，而是因为&amp;quot;猫&amp;quot;这个语义概念在像素空间中也对应着一个低维结构。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以MAE的&amp;quot;理解&amp;quot;是一种数学上的巧合，还是真正的认知？&lt;/strong&gt; 这个问题，比它看起来要深得多。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三策略三自举我猜我猜我猜猜猜&#34;&gt;三、策略三：自举——&amp;ldquo;我猜我猜我猜猜猜&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第三种策略，也是最反直觉的一个——BYOL（Bootstrap Your Own Latent，自举潜在表征，2020年DeepMind提出）。&lt;/p&gt;&#xA;&lt;p&gt;它的思路是：&lt;strong&gt;让AI自己给自己当老师。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;玩法：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;同时训练两个网络——一个&amp;quot;学生&amp;quot;（在线网络）和一个&amp;quot;老师&amp;quot;（目标网络）。&lt;/p&gt;&#xA;&lt;p&gt;第一步：对同一张猫的图片做两种不同的增强，分别喂给学生和老师。&lt;/p&gt;&#xA;&lt;p&gt;第二步：学生试着&lt;strong&gt;预测老师会给出什么表征&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第三步：学生的参数更新，老师的参数&lt;strong&gt;缓慢地向学生靠拢&lt;/strong&gt;（通过EMA——指数移动平均）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最关键的是：BYOL不使用任何负样本。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;等等，没有负样本？那它不会&amp;quot;学偏&amp;quot;吗？&lt;/p&gt;&#xA;&lt;p&gt;想象一下，如果AI只需要&amp;quot;靠近&amp;quot;而不需要&amp;quot;远离&amp;quot;，它最后会怎样？——所有图片的表征会坍缩到同一个点，因为&amp;quot;全都靠近&amp;quot;比&amp;quot;有选择地靠近&amp;quot;容易得多。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
