<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>MAE on 灵语AI</title>
		<link>https://lingyu7.com/tags/mae/</link>
		<description>Recent content in MAE on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sun, 23 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/mae/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI不用老师也能自己学？——自监督学习的魔力</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</link>
				<pubDate>Sun, 23 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;你不可能给他一张张标注好&amp;quot;这是猫，这不是猫&amp;quot;的照片，然后让他背下来。但神奇的是，他看过几次猫之后，就能自己认出猫——哪怕猫换了姿势、换了光线、换了背景，他都知道&amp;quot;这是猫&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来理所当然，但对AI来说，这曾经是一个巨大的难题。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI学习方式，需要大量人工标注的数据。比如你想让AI学会识别猫，你得先给它看几万张标注了&amp;quot;猫&amp;quot;或&amp;quot;不是猫&amp;quot;的照片。这叫&lt;strong&gt;监督学习&lt;/strong&gt;——就像有一个老师，每道题都告诉你正确答案。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：世界上有那么多东西需要AI认识，哪有那么多&amp;quot;老师&amp;quot;给每张照片打标签？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;自监督学习&lt;/strong&gt;要解决的问题——让AI像小孩一样，&lt;strong&gt;不用老师，自己也能学会&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;老师不够用了&#34;&gt;&amp;ldquo;老师&amp;quot;不够用了&lt;/h2&gt;&#xA;&lt;p&gt;先说说为什么&amp;quot;自监督&amp;quot;这么重要。&lt;/p&gt;&#xA;&lt;p&gt;传统监督学习有一个致命的瓶颈：&lt;strong&gt;标注成本&lt;/strong&gt;。你让AI识别猫，可能要花几千小时让人工去标注几百万张图片。如果让它识别罕见病CT影像呢？能看懂CT片的医生本来就少，哪来的时间给你一张张标注？&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，人类的学习方式本身就不是&amp;quot;监督&amp;quot;的。你学会认猫，不是因为有人给你标了数据，而是因为你&lt;strong&gt;观察了足够多的猫&lt;/strong&gt;，自己总结出了规律。你学会了说话，不是因为有人给你一张语法规则表，而是因为你&lt;strong&gt;听了足够多的话&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;所以一个自然的问题就是：&lt;strong&gt;能不能让AI也这样学？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是可以，而且这条路正在改变整个AI领域。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心思想让数据给自己出题&#34;&gt;核心思想：让数据给自己出题&lt;/h2&gt;&#xA;&lt;p&gt;自监督学习的基本思路听起来很巧妙：&lt;strong&gt;让数据自己给自己出题&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你不是直接告诉AI&amp;quot;这张图是猫&amp;rdquo;，而是把一张猫的照片切成两半，让AI猜&amp;quot;这两半是不是同一张图上的&amp;quot;。AI为了答对这道题，必须学会理解&amp;quot;猫&amp;quot;长什么样、有什么特征——在这个过程中，它自然而然地就学会了识别猫，而你根本不需要给它任何标签。&lt;/p&gt;&#xA;&lt;p&gt;这就是自监督学习最核心的智慧：&lt;strong&gt;不要给AI答案，给它出题，让它自己从题目中学习。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这套方法主要有两大学派，我们来看看它们各自是怎么&amp;quot;出题&amp;quot;的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派一对比学习找不同的反向操作&#34;&gt;流派一：对比学习——&amp;ldquo;找不同&amp;quot;的反向操作&lt;/h2&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习（Contrastive Learning）&lt;/strong&gt; 的思路是：让AI学会区分&amp;quot;相似&amp;quot;和&amp;quot;不相似&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，对同一张图片做两种不同的处理——比如裁剪不同区域、调整颜色、旋转角度——得到两张&amp;quot;长得不一样但本质是同一张图&amp;quot;的版本。AI的任务是：&lt;strong&gt;把这两张&amp;quot;同源&amp;quot;的图片识别为相似，把来自不同图的图片识别为不相似。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像你给AI出题：&amp;ldquo;这两张图是同一只猫的不同角度，那两张图是两只不同的猫，你给我分出来。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;听起来似乎不难，但真正做起来，里面有很多门道。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;SimCLR&lt;/strong&gt;（Google 2020年提出）是这一派的开创者之一。它的做法很有意思：把同一张图做两种不同的&amp;quot;数据增强&amp;quot;——比如一张剪了左上角还调亮了，另一张剪了右下角还压暗了——然后让AI学会把这两张&amp;quot;增强版&amp;quot;识别为同一张图。为了做到这一点，AI必须理解图片的&amp;quot;本质内容&amp;quot;是什么，而不是被表面变化迷惑。SimCLR在ImageNet上达到了76.5%的Top-1准确率，几乎追平了监督学习的ResNet-50——而这一切，&lt;strong&gt;没有使用任何一张人工标注的图片&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MoCo&lt;/strong&gt;（何恺明团队，Facebook 2020）走了另一条路。它用了一个&amp;quot;记忆队列&amp;quot;——把之前见过的所有图片特征都存起来，形成一个巨大的&amp;quot;字典&amp;quot;。当新图片进来时，AI就在这个字典里找&amp;quot;谁和谁长得像&amp;quot;。这个看似简单的设计，让对比学习可以在普通显卡上训练，而不需要大batch size。MoCo在目标检测任务上第一次超越了监督预训练——这意味着自监督学习不仅&amp;quot;够用&amp;quot;，在某些场景下甚至比&amp;quot;有老师教&amp;quot;的更好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BYOL&lt;/strong&gt;（DeepMind 2020）则更进一步——它连&amp;quot;不相似&amp;quot;的样本都不需要了。它只学&amp;quot;同一张图的两个版本应该相似&amp;quot;，完全不用看&amp;quot;不相似的图长什么样&amp;quot;。这就好比一个小孩只盯着猫看，不看狗，竟然也能学会认猫。这个发现打破了学界的共识——原来&amp;quot;负样本&amp;quot;不是必须的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派二掩码预测完形填空的智慧&#34;&gt;流派二：掩码预测——&amp;ldquo;完形填空&amp;quot;的智慧&lt;/h2&gt;&#xA;&lt;p&gt;另一条路更直觉：&lt;strong&gt;遮住一部分，让AI猜被遮住的是什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE（Masked Autoencoders）&lt;/strong&gt;（何恺明团队，Meta 2022）把这张做到了极致。它随机遮掉一张图片的75%——没错，只留下25%的碎片给AI看，然后让AI复原整张图。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个&amp;quot;不可能完成的任务&amp;rdquo;。但正是这种&amp;quot;极度困难&amp;quot;的设定，迫使AI学会了真正的&amp;quot;理解&amp;quot;。你想想，如果你只看到一个人的眼睛和耳朵，要猜出整张脸长什么样——你必须理解&amp;quot;人脸的结构是什么样的&amp;quot;、&amp;ldquo;眼睛和耳朵之间有什么关系&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;MAE的巧妙之处在于它的&amp;quot;非对称设计&amp;quot;：编码器只看那25%的可见碎片（计算量小），解码器负责复原那75%的遮挡部分（稍微重一点但只用一次）。这个设计让训练速度提升了4倍以上。最终，MAE在ImageNet上达到了87.8%的Top-1准确率——已经超过了大多数有监督的方法。&lt;/p&gt;&#xA;&lt;p&gt;你可能会觉得这很熟悉——没错，就是&lt;strong&gt;BERT&lt;/strong&gt;的思路。BERT遮住文本中的一些词让AI猜，MAE遮住图像中的一些区域让AI复原。&lt;strong&gt;&amp;ldquo;完形填空&amp;quot;这个思路，从文本到图像，通用得令人惊讶。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;clip让ai学会看图说话&#34;&gt;CLIP：让AI学会&amp;quot;看图说话&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;如果说对比学习是&amp;quot;让AI自己学会区分&amp;quot;，那么&lt;strong&gt;CLIP&lt;/strong&gt;（OpenAI 2021）就是&amp;quot;让AI学会跨语言的联想&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：在网上找了4亿张图文配对的数据（比如一张猫的照片，配文&amp;quot;一只橘猫趴在窗台上&amp;quot;），然后让AI学会&lt;strong&gt;把图片和对应的文字匹配到一起&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，给AI一张图片和一段文字描述，问它：&amp;ldquo;这张图配这段文字，配不配？&amp;ldquo;为了答对这道题，AI必须同时理解图片的内容和文字的含义，然后把它们对应起来。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的神奇之处在于，学完之后，它&lt;strong&gt;不需要任何额外的训练数据&lt;/strong&gt;就能做图像分类。你告诉它&amp;quot;识别猫、狗、鸟&amp;rdquo;——它自己就能把图片分好类，准确率高达76.2%（ImageNet零样本分类）。这意味着，&lt;strong&gt;你不需要给CLIP任何一张标注好的猫照片，它就已经知道猫长什么样了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，CLIP已经成为了Stable Diffusion、DALL·E 2等生成模型的&amp;quot;眼睛&amp;rdquo;——它让AI既&amp;quot;看得懂图&amp;quot;，又&amp;quot;读得懂字&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么自己学比有人教更重要&#34;&gt;为什么&amp;quot;自己学&amp;quot;比&amp;quot;有人教&amp;quot;更重要？&lt;/h2&gt;&#xA;&lt;p&gt;到这里你可能会问：自监督学习确实很酷，但它到底有什么用？跟普通人的生活有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。想想这些场景：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：医疗影像&lt;/strong&gt;。罕见病的CT影像本来就少，能标注的医生更少。自监督学习可以先让AI&amp;quot;自己看&amp;quot;大量未标注的CT片，学会&amp;quot;正常肺部长什么样&amp;quot;，然后再少量标注数据就能学会&amp;quot;识别异常&amp;quot;。这大大降低了对人工标注的依赖。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：多语言翻译&lt;/strong&gt;。世界上有7000多种语言，大部分语言根本没有足够的标注数据。自监督学习（比如BERT的多语言版本）可以让AI&amp;quot;自己读&amp;quot;大量不同语言的文本，学会&amp;quot;语言之间的对应关系&amp;quot;，即使某些语言只有很少的翻译数据。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：自动驾驶&lt;/strong&gt;。一辆自动驾驶汽车每天会产生TB级别的视频数据，但大部分都是&amp;quot;正常行驶&amp;quot;的普通画面，真正需要标注的&amp;quot;异常场景&amp;quot;非常少。自监督学习可以让AI从这些海量无标注数据中学到&amp;quot;道路的通用规律&amp;quot;，而不是只依赖人工标注的少数场景。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习的真正意义，在于它打破了AI对&amp;quot;人工标注&amp;quot;的依赖。&lt;/strong&gt; 世界上绝大多数数据——图片、视频、文字、声音——都是没有标签的。如果AI只能从&amp;quot;有标签&amp;quot;的数据中学习，它永远只能理解人类世界的一小部分。而自监督学习，让AI可以像人类一样，从&amp;quot;观察&amp;quot;中自己学习。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从喂数据到自己学&#34;&gt;结语：从&amp;quot;喂数据&amp;quot;到&amp;quot;自己学&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;答案其实很简单——&lt;strong&gt;他不需要&amp;quot;老师&amp;quot;告诉他每张照片是不是猫，他只需要看足够多的猫，大脑就能自己总结出&amp;quot;猫是什么&amp;quot;的规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自监督学习做的，正是同一件事：&lt;strong&gt;不再给AI&amp;quot;答案&amp;quot;，而是给它&amp;quot;问题&amp;quot;——让它从数据本身的结构中，自己发现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从SimCLR到MAE，从对比学习到掩码预测，从CLIP到GPT——这些方法的共同内核是：&lt;strong&gt;让数据自己说话。&lt;/strong&gt; 而这对AI的意义，可能比我们想象的要深远得多。因为当AI学会&amp;quot;自己学&amp;quot;之后，它就不再受限于人类能教它的东西——它可以自己去探索、去发现、去理解那些我们甚至还没想到的知识。&lt;/p&gt;&#xA;&lt;p&gt;而这，或许才是通往真正智能的那把钥匙。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen et al. &lt;em&gt;A Simple Framework for Contrastive Learning of Visual Representations&lt;/em&gt;. ICML 2020. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;arXiv:2002.05709&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Momentum Contrast for Unsupervised Visual Representation Learning&lt;/em&gt;. CVPR 2020. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;arXiv:1911.05722&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Masked Autoencoders Are Scalable Vision Learners&lt;/em&gt;. CVPR 2022. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;arXiv:2111.06377&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill et al. &lt;em&gt;Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning&lt;/em&gt;. NeurIPS 2020. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;arXiv:2006.07733&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Radford et al. &lt;em&gt;Learning Transferable Visual Models From Natural Language Supervision&lt;/em&gt;. ICML 2021. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;arXiv:2103.00020&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI如何自学成才——自监督学习让机器学会自己教自己</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-teaches-itself/</link>
				<pubDate>Wed, 12 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-teaches-itself/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过，AI是怎么学会&amp;quot;认出&amp;quot;一只猫的？&lt;/p&gt;&#xA;&lt;p&gt;传统的方法是：给AI看几百万张标注好的猫的照片——&amp;ldquo;这是猫&amp;rdquo;、&amp;ldquo;这也是猫&amp;rdquo;、&amp;ldquo;这个不是猫&amp;rdquo;。标注这些照片的人，工作量相当于给一个城市的人每人发一本书，然后让他们一页一页地标记。&lt;/p&gt;&#xA;&lt;p&gt;但你有想过吗？一个婴儿学会&amp;quot;猫&amp;quot;这个词，只需要看几次猫，听到大人说&amp;quot;这是猫&amp;quot;，就记住了。婴儿不需要看几百万张标注好的照片。那么问题来了：&lt;strong&gt;为什么AI需要标注数据，而人类不需要？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个问题，引出了过去几年AI领域最激动人心的进展之一——&lt;strong&gt;自监督学习&lt;/strong&gt;。它是让AI能够&amp;quot;自己教自己&amp;quot;的技术，是AI从&amp;quot;需要喂食&amp;quot;到&amp;quot;自己觅食&amp;quot;的转变。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的饥饿问题&#34;&gt;第一章：AI的&amp;quot;饥饿问题&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;传统AI的&amp;quot;学习&amp;quot;，本质上是一种&amp;quot;被监督&amp;quot;的过程。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你是一个老师，要教一个学生认识世界上的所有动物。你准备了一套标准教材——每页一张动物照片，下面写着动物的名字。学生翻开教材，一张一张地看，一遍一遍地记，最后考了一个高分。但问题是，这套教材需要有人来编写——每一张照片都需要有人去拍照、去标注名字。这就是&amp;quot;监督学习&amp;quot;的困境。&lt;/p&gt;&#xA;&lt;p&gt;ImageNet数据集，这个在2010年代推动AI革命的&amp;quot;教材&amp;quot;，包含了1400万张图片，由2.5万个人工花了几个月的时间才标注完成。你想想，1400万张——这个概念相当于把YouTube上所有热门视频的封面图都翻一遍，然后一张一张地写上&amp;quot;这是猫&amp;quot;、&amp;ldquo;这是狗&amp;rdquo;、&amp;ldquo;这是汽车&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;饥饿问题&amp;quot;：&lt;strong&gt;它需要海量的人工标注数据才能学会一个简单的任务&lt;/strong&gt;。而且，一旦你想让它学会一个新东西，比如识别&amp;quot;斑马&amp;quot;，你又要重新标注几万张斑马的照片给它看。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章ai的自学实验&#34;&gt;第二章：AI的&amp;quot;自学&amp;quot;实验&lt;/h2&gt;&#xA;&lt;p&gt;2019年到2020年，一场关于AI能否&amp;quot;自学&amp;quot;的实验，在几个顶级实验室之间悄然展开。&lt;/p&gt;&#xA;&lt;p&gt;这场实验的核心问题很简单：&lt;strong&gt;能否让AI自己从互联网上那些没有标注的图片中学习，不需要任何人告诉它&amp;quot;这是什么&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;可以，而且效果惊人&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第一个突破来自Google Research的SimCLR。它的思路非常巧妙。想象一下，你有一张猫的照片。你把这张照片做两个不同的处理——一个调亮一点，一个旋转一点。然后你告诉AI：&amp;ldquo;这两张其实是一张图，你看出来了吗？&amp;ldquo;AI一开始当然看不出来，但经过成百上千万次的这种&amp;quot;配对训练&amp;rdquo;，它慢慢学会了：&amp;ldquo;哦，原来一只猫不管是从左边看还是从右边看、调亮还是调暗，它都是一只猫。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;SimCLR的核心洞察是：&lt;strong&gt;让AI自己和自己玩&amp;quot;找相同&amp;quot;的游戏&lt;/strong&gt;。同一张图片的不同&amp;quot;变体&amp;quot;是正样本，其他所有图片都是负样本。AI需要把正样本拉近，把负样本推远。这个过程不需要任何人工标注，AI自己就能从海量图片中学习到&amp;quot;什么是相同的&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;但SimCLR有一个问题：它追求&amp;quot;找相同&amp;quot;的时候，需要大量负样本——也就是&amp;quot;不相同的图片&amp;quot;。为了获得足够多的负样本，它需要一次看很多张图片（比如4096张），这对GPU的要求非常高，普通实验室根本跑不起来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个记忆的革命&#34;&gt;第三章：一个&amp;quot;记忆&amp;quot;的革命&lt;/h2&gt;&#xA;&lt;p&gt;与此同时，Facebook AI Research（FAIR）的团队走了另一条路。&lt;/p&gt;&#xA;&lt;p&gt;何恺明团队提出的MoCo（动量对比学习），解决了一个关键问题：&lt;strong&gt;AI需要一本&amp;quot;记忆手册&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你让AI认人。它看到一个新人，就在自己的记忆手册里记下这个人的特征。下次再看到这个人，它翻翻手册：&amp;ldquo;嗯，特征对上了，是同一个人。&amp;ldquo;但如果手册里只有最近见过的几个人，它就很容易忘掉之前见过的人。&lt;/p&gt;&#xA;&lt;p&gt;MoCo的解决方案是：&lt;strong&gt;维护一个&amp;quot;队列&amp;quot;式的记忆库&lt;/strong&gt;。它把过去见过的所有图片特征都保存在一个巨大的队列里——默认保存65536张。新图片进来，把最旧的挤出去。这样，AI总能从足够多的历史样本中学习和对比。&lt;/p&gt;&#xA;&lt;p&gt;更巧妙的是，MoCo还设计了一个&amp;quot;动量编码器&amp;rdquo;——一个缓慢更新的影子网络。这个影子网络的作用是，让记忆库中的特征保持一致。就像你认人，如果今天看这个人的特征和你昨天看的特征不一样，那你肯定认不出来。动量编码器确保记忆库中的特征不会因为模型更新而剧烈变化。&lt;/p&gt;&#xA;&lt;p&gt;MoCo的突破在于：&lt;strong&gt;它把字典大小和批次大小解耦了&lt;/strong&gt;。SimCLR需要一次看4096张图片，MoCo只需要256张，因为它可以&amp;quot;记住&amp;quot;之前看过的几万张图片。这让所有实验室，即使是只有几张GPU的小团队，也能做自监督学习。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章ai的自我博弈&#34;&gt;第四章：AI的&amp;quot;自我博弈&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2020年，DeepMind扔出了一颗&amp;quot;炸弹&amp;quot;——BYOL。&lt;/p&gt;&#xA;&lt;p&gt;BYOL的诞生，源于一个朴素的问题：&lt;strong&gt;如果不使用负样本，AI还能自学吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：当然不行，没有负样本，AI不就&amp;quot;我全都要&amp;quot;了吗？确实，对比学习依赖&amp;quot;拉近正样本、推远负样本&amp;quot;这个机制，如果没有负样本，模型很容易陷入&amp;quot;对所有输入都输出相同的结果&amp;quot;——这就是所谓的&amp;quot;坍塌&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但BYOL偏偏做到了。它的方法非常有趣：&lt;strong&gt;让AI和自己玩&amp;quot;猜谜游戏&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;BYOL由两个网络组成——在线网络和目标网络。在线网络负责&amp;quot;猜&amp;quot;，目标网络提供&amp;quot;答案&amp;quot;。对同一张图片做两个不同的增强，分别输入两个网络，然后让在线网络试图预测目标网络的输出。目标网络不直接学习，而是通过在线网络参数的&amp;quot;滑动平均&amp;quot;缓慢更新。&lt;/p&gt;&#xA;&lt;p&gt;这个设计的关键在于：&lt;strong&gt;预测头（predictor）的存在&lt;/strong&gt;。它像是给AI装了一个&amp;quot;好奇的引擎&amp;quot;——让AI不断尝试去预测另一个视角下的自己，而不是简单地复制粘贴。再加上动量编码器，模型就稳定了。&lt;/p&gt;&#xA;&lt;p&gt;BYOL之所以令人震惊，是因为它打破了&amp;quot;对比学习必须依赖负样本&amp;quot;这个共识。它证明了一个更深刻的道理：&lt;strong&gt;AI的&amp;quot;自学&amp;quot;能力，本质上是在寻找不同视角下的一致性，而不是在&amp;quot;区别&amp;quot;事物&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章大道至简&#34;&gt;第五章：大道至简&lt;/h2&gt;&#xA;&lt;p&gt;2021年，FAIR的SimSiam又往前迈了一步。&lt;/p&gt;&#xA;&lt;p&gt;SimSiam的研究者问了一个更尖锐的问题：&lt;strong&gt;BYOL、MoCo、SimCLR、SwAV这些方法，到底哪些组件是真正必要的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他们把BYOL的动量编码器去掉，把SimCLR的负样本去掉，把SwAV的在线聚类去掉，最终只剩下一个最简单的结构——两个共享权重的孪生网络，一个预测头，一个stop-gradient操作。&lt;/p&gt;&#xA;&lt;p&gt;最令人震惊的是：&lt;strong&gt;这个最简单的结构，效果和所有复杂方法一样好&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;SimSiam的发现揭示了一个深刻的洞察：&lt;strong&gt;stop-gradient（停止梯度）是防止坍塌的关键&lt;/strong&gt;。为什么？研究者提出了一个EM算法假设——两个网络分支实际上在做&amp;quot;交替优化&amp;quot;。一个分支负责&amp;quot;编码&amp;quot;，另一个分支在&amp;quot;求解&amp;quot;；stop-gradient就是在告诉模型&amp;quot;别动这一边，专注于优化另一边&amp;quot;。这种交替优化，天然地防止了坍塌。&lt;/p&gt;&#xA;&lt;p&gt;这就像两个人在合作拼图——一个人拼左边的部分，另一个人拼右边的部分。如果两个人都只在调整自己的部分，永远不会看向对方，那肯定拼不到一起去。但如果一个人先拼好，另一个人去匹配——这就是stop-gradient的精髓。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第六章ai的填空游戏&#34;&gt;第六章：AI的&amp;quot;填空&amp;quot;游戏&lt;/h2&gt;&#xA;&lt;p&gt;2022年，何恺明团队再次出手，带来了MAE（掩码自编码器）。&lt;/p&gt;&#xA;&lt;p&gt;MAE的思路，听起来简单得不可思议：&lt;strong&gt;把一张图片的大部分遮住，让AI猜被遮住的部分是什么&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你看到一张猫的照片，但猫的身体被遮住了75%，只露出了头和尾巴。你能猜出这是一只猫吗？当然能。因为你的大脑知道&amp;quot;猫&amp;quot;的形状，能够根据露出的部分推断出被遮住的部分。&lt;/p&gt;&#xA;&lt;p&gt;MAE就是这么做的。它把一张图片随机遮住75%的像素块，让AI去&amp;quot;填空&amp;quot;。AI的编码器只看可见的25%像素，解码器负责重建被遮住的75%。这个&amp;quot;非对称&amp;quot;设计非常巧妙——编码器只处理一小部分数据，速度提升了3倍以上。&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：遮住75%，AI能学到什么？答案恰恰相反——&lt;strong&gt;正是因为遮住了75%，AI才被迫去理解&amp;quot;整体&amp;quot;&lt;/strong&gt;。如果只遮住10%，AI可以通过相邻像素的连续性来&amp;quot;蒙混过关&amp;quot;，根本不需要理解画面内容。但遮住75%后，AI必须真正理解&amp;quot;这是一只猫，所以被遮住的部分应该是猫的身体&amp;quot;——它学到的不是像素，而是语义。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的自学启示&#34;&gt;尾声：AI的&amp;quot;自学&amp;quot;启示&lt;/h2&gt;&#xA;&lt;p&gt;回顾自监督学习的发展史，我们能看到一条清晰的脉络：从SimCLR的&amp;quot;找相同&amp;quot;游戏，到MoCo的&amp;quot;记忆革命&amp;quot;，到BYOL的&amp;quot;自我博弈&amp;quot;，到SimSiam的&amp;quot;大道至简&amp;quot;，再到MAE的&amp;quot;填空游戏&amp;quot;——每一步都在推动AI走向&amp;quot;不依赖人工标注&amp;quot;的自学之路。&lt;/p&gt;&#xA;&lt;p&gt;现在，自监督学习已经成为AI领域的标配。GPT系列用自监督学习理解语言，CLIP用自监督学习理解图文关系，DINO用自监督学习理解视觉特征。&lt;strong&gt;自监督学习，正在成为AI理解世界的&amp;quot;通用底座&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;但更深刻的是，自监督学习给我们的启示：&lt;strong&gt;真正的智能，不需要被灌输知识，而是能从数据中自己发现规律&lt;/strong&gt;。人类的婴儿不需要看几百万张&amp;quot;这是猫&amp;quot;的照片才能认猫，是因为他们的大脑天生就具备&amp;quot;自监督&amp;quot;的能力——观察、比较、预测、验证，一步步构建对世界的理解。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI正在走的路，也许就是人类自己走过的路。只是这一次，我们既是先驱者，也是见证者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen, T., et al. (2020). A Simple Framework for Contrastive Learning of Visual Representations. &lt;em&gt;ICML 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He, K., et al. (2020). Momentum Contrast for Unsupervised Visual Representation Learning. &lt;em&gt;CVPR 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill, J. B., et al. (2020). Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Chen, X., &amp;amp; He, K. (2021). Exploring Simple Siamese Representation Learning. &lt;em&gt;CVPR 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2011.10566&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He, K., et al. (2022). Masked Autoencoders Are Scalable Vision Learners. &lt;em&gt;CVPR 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>自学成才的AI——没有老师，它是怎么学会「看懂」世界的？</title>
				<link>https://lingyu7.com/posts/self-supervised-learning-ai-sees-without-teacher/</link>
				<pubDate>Tue, 21 Jul 2026 02:31:20 +0800</pubDate>
				<guid>https://lingyu7.com/posts/self-supervised-learning-ai-sees-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言你给ai看了一亿张图但没告诉它任何一张是什么&#34;&gt;引言：你给AI看了一亿张图，但没告诉它任何一张是什么&lt;/h2&gt;&#xA;&lt;p&gt;想象你是一个刚出生的婴儿，被扔进一个充满图片的世界。&lt;/p&gt;&#xA;&lt;p&gt;没有人指着猫说&amp;quot;这是猫&amp;quot;，没有人告诉你&amp;quot;这是红色&amp;quot;、&amp;ldquo;那是圆形&amp;rdquo;。你只能自己看、自己比较、自己找规律。&lt;/p&gt;&#xA;&lt;p&gt;你会怎么学习？&lt;/p&gt;&#xA;&lt;p&gt;这个问题的答案，指向了AI领域过去几年最深层的变革之一——&lt;strong&gt;自监督学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI训练方式很&amp;quot;娇气&amp;quot;：需要人类一张一张地标注数据。&amp;ldquo;这张图是猫，那张图是狗，这张是车……&amp;rdquo; 标注一亿张图需要的人力成本，够一个中型公司破产好几次。&lt;/p&gt;&#xA;&lt;p&gt;但现实世界的数据是没有标签的——互联网上每天产生数亿张图片，没人在上面写&amp;quot;这是风景&amp;quot;或&amp;quot;这是美食&amp;quot;。如果AI只能从有标签的数据中学习，它的&amp;quot;视野&amp;quot;就永远被人类标注的边界所限制。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习改变了这一切。&lt;/strong&gt; 它让AI在没有人类老师的情况下，自己从海量无标签数据中学习。&lt;/p&gt;&#xA;&lt;p&gt;但问题是：&lt;strong&gt;AI真的&amp;quot;学会&amp;quot;了吗？还是只是在玩一场自己设计规则的、精妙的游戏？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一策略一找不同这两张图是同一个东西吗&#34;&gt;一、策略一：找不同——&amp;ldquo;这两张图是同一个东西吗？&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第一种自监督学习策略，叫&lt;strong&gt;对比学习&lt;/strong&gt;。它的思路简单到令人发指：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;给AI看两张图，问它：这两张是同一个东西的&amp;quot;变体&amp;quot;，还是完全不同的东西？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;以SimCLR（2020年Google提出）为代表，这套方法的玩法是这样的：&lt;/p&gt;&#xA;&lt;p&gt;第一步：从一张猫的图片出发，做两次不同的&amp;quot;整容&amp;quot;——一次把它旋转+裁剪，一次给它调色+模糊。这两张&amp;quot;整容后&amp;quot;的图片，就是&amp;quot;正样本对&amp;quot;——它们是同一个东西的不同版本。&lt;/p&gt;&#xA;&lt;p&gt;第二步：再从同一个训练批次里，随机抓一堆其他图片（狗、车、树……），作为&amp;quot;负样本&amp;quot;——这些是&amp;quot;不同东西&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;第三步：让AI把所有图片映射到一个&amp;quot;嵌入空间&amp;quot;里——一个高维的&amp;quot;特征地图&amp;quot;。要求是：&lt;strong&gt;正样本对在空间里靠得近，负样本对在空间里离得远&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;就这么简单？差不多。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的派对上，所有人戴着面具。你的任务是：找到你的双胞胎兄弟。&lt;/p&gt;&#xA;&lt;p&gt;你只有一次机会——你可以在人群中任意选两个人，问：&amp;ldquo;他们是不是同一个人的不同造型？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;每问一次，你就学到一点特征：哦，原来我兄弟的&lt;strong&gt;身形轮廓&lt;/strong&gt;是稳定的，但&lt;strong&gt;衣服颜色&lt;/strong&gt;可以变；原来他的&lt;strong&gt;身高&lt;/strong&gt;是特征，但&lt;strong&gt;站姿&lt;/strong&gt;不是。&lt;/p&gt;&#xA;&lt;p&gt;SimCLR做的就是这件事——只不过它问了上亿次。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果如何？&lt;/strong&gt; 惊人地好。SimCLR在ImageNet上的分类准确率达到了76.5%，接近甚至超过了当时许多有监督学习方法。而且它学到的&amp;quot;视觉特征&amp;quot;非常通用——不仅在分类任务上表现好，在目标检测、语义分割等其他任务上也能迁移使用。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但问题来了：它真的&amp;quot;理解&amp;quot;猫是什么了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;仔细想想SimCLR实际在做的事：它只是被训练去&amp;quot;让同一张图片的两个增强版本靠近，让不同图片的版本远离&amp;quot;。它从来没有被告知&amp;quot;猫&amp;quot;这个概念，也不知道&amp;quot;猫&amp;quot;和&amp;quot;狗&amp;quot;的边界在哪里。&lt;/p&gt;&#xA;&lt;p&gt;它能区分猫和狗，是因为&lt;strong&gt;猫和狗在自然图像中的底层结构差异足够大&lt;/strong&gt;——它们占据的&amp;quot;像素空间&amp;quot;区域天然不同，经过增强后仍然不同。SimCLR的&amp;quot;靠近/远离&amp;quot;操作，恰好利用了这种天然差异。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;也就是说：SimCLR不是在&amp;quot;理解语义&amp;quot;，而是在&amp;quot;利用数据的统计结构&amp;quot;。&lt;/strong&gt; 它发现了一个&amp;quot;好用的区分方式&amp;quot;，但这个方式恰好与人类的语义类别对齐了。&lt;/p&gt;&#xA;&lt;p&gt;这不是坏事——实际上，这种&amp;quot;对齐&amp;quot;正是自监督学习的核心价值。但认识到这一点很重要：&lt;strong&gt;AI的&amp;quot;聪明&amp;quot;和人类的&amp;quot;理解&amp;quot;，底层逻辑可能完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二策略二填空遮住大部分猜出少部分&#34;&gt;二、策略二：填空——&amp;ldquo;遮住大部分，猜出少部分&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第二种策略，来自一个更直观的想法：&lt;strong&gt;如果你能完美地猜出被遮住的部分，说明你真的理解了整体。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是MAE（Masked Autoencoder，掩码自编码器，2021年Meta提出）的核心思路。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;玩法是这样的：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;第一步：把一张猫的图片切成196个16x16的小块，然后&lt;strong&gt;随机遮住其中75%——只留49个小块可见&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第二步：把剩下的49个可见小块输入编码器，让编码器&amp;quot;看&amp;quot;这49个碎片。&lt;/p&gt;&#xA;&lt;p&gt;第三步：用一个轻量解码器，从这49个碎片中&lt;strong&gt;重建出全部的196个小块&lt;/strong&gt;——包括被遮住的那147个。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：&lt;/strong&gt; 编码器只看25%的碎片，解码器必须重建100%的图像。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么遮住75%这么极端？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;因为如果只遮住10%，AI可以靠&amp;quot;邻接像素的颜色渐变&amp;quot;来填充——就像你在Photoshop里用&amp;quot;内容感知填充&amp;quot;一样。但遮住75%后，邻接信息几乎没有了，AI必须真正理解&amp;quot;这张图里有一只猫在草地上&amp;quot;才能猜出猫耳朵的位置、草地的纹理。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;给你看一张拼图的25块碎片，要你猜出整幅拼图的内容——包括你完全没看到的那些碎片。&lt;/p&gt;&#xA;&lt;p&gt;如果你猜对了，那说明你真的从这些碎片中&amp;quot;推导&amp;quot;出了整幅图的结构——而不是简单地&amp;quot;填补&amp;quot;了空白。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE的效果更是惊人：&lt;/strong&gt; 在ImageNet上达到了87.8%的Top-1准确率，并且展现出极强的规模扩展性——模型越大，效果越好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但它真的&amp;quot;理解&amp;quot;了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从Ω-CFI框架来看，MAE的本质是一个&lt;strong&gt;高维空间中的条件生成模型&lt;/strong&gt;：给定稀疏的观测（25%的可见块），在隐空间中构建一个&amp;quot;低秩流形&amp;quot;，让缺失部分在这个流形上的投影误差最小。&lt;/p&gt;&#xA;&lt;p&gt;说人话就是：&lt;strong&gt;MAE不是在&amp;quot;理解语义&amp;quot;，而是在&amp;quot;找到自然图像在数学空间中的低维结构&amp;quot;&lt;/strong&gt;。因为自然图像——无论是猫、狗、还是风景——本质上都存在于一个低维流形上（即&amp;quot;真实世界图像&amp;quot;只占所有可能像素组合的极小一部分）。MAE通过高掩码率，迫使模型找到这个流形。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这里的微妙之处：&lt;/strong&gt; 这个&amp;quot;低维流形&amp;quot;恰好与人类语义结构高度重合。不是因为MAE理解了&amp;quot;猫&amp;quot;是什么，而是因为&amp;quot;猫&amp;quot;这个语义概念在像素空间中也对应着一个低维结构。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以MAE的&amp;quot;理解&amp;quot;是一种数学上的巧合，还是真正的认知？&lt;/strong&gt; 这个问题，比它看起来要深得多。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三策略三自举我猜我猜我猜猜猜&#34;&gt;三、策略三：自举——&amp;ldquo;我猜我猜我猜猜猜&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第三种策略，也是最反直觉的一个——BYOL（Bootstrap Your Own Latent，自举潜在表征，2020年DeepMind提出）。&lt;/p&gt;&#xA;&lt;p&gt;它的思路是：&lt;strong&gt;让AI自己给自己当老师。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;玩法：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;同时训练两个网络——一个&amp;quot;学生&amp;quot;（在线网络）和一个&amp;quot;老师&amp;quot;（目标网络）。&lt;/p&gt;&#xA;&lt;p&gt;第一步：对同一张猫的图片做两种不同的增强，分别喂给学生和老师。&lt;/p&gt;&#xA;&lt;p&gt;第二步：学生试着&lt;strong&gt;预测老师会给出什么表征&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第三步：学生的参数更新，老师的参数&lt;strong&gt;缓慢地向学生靠拢&lt;/strong&gt;（通过EMA——指数移动平均）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最关键的是：BYOL不使用任何负样本。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;等等，没有负样本？那它不会&amp;quot;学偏&amp;quot;吗？&lt;/p&gt;&#xA;&lt;p&gt;想象一下，如果AI只需要&amp;quot;靠近&amp;quot;而不需要&amp;quot;远离&amp;quot;，它最后会怎样？——所有图片的表征会坍缩到同一个点，因为&amp;quot;全都靠近&amp;quot;比&amp;quot;有选择地靠近&amp;quot;容易得多。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
