<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>深度学习 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/</link>
		<description>Recent content in 深度学习 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 07 Sep 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI真的学会了吗？——从过拟合到泛化，机器学习中最致命的矛盾</title>
				<link>https://lingyu7.com/posts/does-ai-really-learn-generalization-overfitting/</link>
				<pubDate>Mon, 07 Sep 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-really-learn-generalization-overfitting/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象你正在教一个孩子认识猫。&lt;/p&gt;&#xA;&lt;p&gt;你拿出了一百张照片，每张都是橘猫、坐在沙发上、白天拍摄。孩子学得很好——所有照片都认对了。&lt;/p&gt;&#xA;&lt;p&gt;然后你拿出一张新照片：黑猫，在草地上，晚上拍的。&lt;/p&gt;&#xA;&lt;p&gt;孩子说：&amp;ldquo;这不是猫，没有橘色，背景也不对。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个场景，在机器学习中每天都在发生，而且有个专业名字——&lt;strong&gt;过拟合（Overfitting）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它不是某个AI产品的Bug，而是整个深度学习时代最核心、最致命的矛盾：&lt;strong&gt;AI越是精确地记住训练数据，它在面对新数据时越容易犯错。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;听起来像是悖论，对吧？但这就是AI世界里的&amp;quot;聪明反被聪明误&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai的学霸困境为什么考满分反而是坏事&#34;&gt;一、AI的&amp;quot;学霸困境&amp;quot;：为什么考满分反而是坏事&lt;/h2&gt;&#xA;&lt;p&gt;2017年，MIT的研究人员做了一个实验。他们训练了一个图像分类模型来识别&amp;quot;狼&amp;quot;和&amp;quot;哈士奇&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;模型在测试集上表现惊人：准确率接近100%。&lt;/p&gt;&#xA;&lt;p&gt;但研究人员发现了一个诡异的现象——&lt;strong&gt;所有标注为&amp;quot;狼&amp;quot;的照片背景里都有雪，而&amp;quot;哈士奇&amp;quot;的照片大多没有雪。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;于是他们做了一件事：把&amp;quot;雪&amp;quot;从照片中P掉。结果模型准确率骤降到60%出头。&lt;/p&gt;&#xA;&lt;p&gt;这个模型根本没有学会区分狼和哈士奇，它学会了&amp;quot;辨别雪&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不是模型笨，而是它太&amp;quot;聪明&amp;quot;了——它找到了一个训练数据中100%正确的捷径，但这个捷径对真正的问题毫无意义。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是过拟合的本质：模型不是在&amp;quot;学习规律&amp;quot;，而是在&amp;quot;死记硬背答案&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;更扎心的是，模型自己没有能力区分&amp;quot;真正的规律&amp;quot;和&amp;quot;碰巧相关的特征&amp;quot;。在它看来，狼身上有毛、有鼻子、四条腿、背景有雪——所有这些特征权重都一样。它不知道&amp;quot;雪&amp;quot;只是个巧合。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么越大越容易过拟合参数的自由度陷阱&#34;&gt;二、为什么越大越容易&amp;quot;过拟合&amp;quot;？——参数的自由度陷阱&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：那让模型小一点不就完了？&lt;/p&gt;&#xA;&lt;p&gt;事情没那么简单。深度学习取得突破的核心原因之一，就是&lt;strong&gt;模型足够大&lt;/strong&gt;——参数越多，模型能捕获的规律越复杂。&lt;/p&gt;&#xA;&lt;p&gt;但这也带来了一个两难局面：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;参数越多，模型&amp;quot;记住&amp;quot;训练数据的能力就越强，它就越容易走捷径。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下：你让一个学生用100个公式去解释10个数据点。他当然可以轻松做到——每个数据点配一个公式，完美拟合。但这时候你给他第11个数据点，他所有公式全都用不上。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;过参数化&amp;quot;的陷阱。&lt;/p&gt;&#xA;&lt;p&gt;2018年，有一篇著名的论文叫《The Lottery Ticket Hypothesis》——彩票假说。它发现，在一个大模型中，其实只有一小部分参数（约10-20%）是真正有用的。其余参数就像是&amp;quot;空转&amp;quot;的神经元，它们的存在让模型更容易找到捷径，而不是真正理解问题。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但问题是：我们不知道哪些参数是&amp;quot;有用的&amp;quot;，哪些是&amp;quot;空转的&amp;quot;。&lt;/strong&gt; 所以只能把整个大模型都训练出来，然后祈祷它学到的是真正的规律，而不是训练数据中的&amp;quot;噪音&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三泛化之谜为什么神经网络反而越学越好&#34;&gt;三、泛化之谜：为什么神经网络反而&amp;quot;越学越好&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;这里有一个让很多研究者困惑的谜题。&lt;/p&gt;&#xA;&lt;p&gt;按照经典统计学理论，模型参数越多，过拟合越严重，泛化能力应该越差。这是&amp;quot;奥卡姆剃刀&amp;quot;的数学版本——简单模型通常更好。&lt;/p&gt;&#xA;&lt;p&gt;但深度学习的实践告诉我们一个反直觉的事实：&lt;strong&gt;大型神经网络虽然参数多到离谱，但它们的泛化能力往往出奇的好。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如GPT-3有1750亿个参数，训练数据是几千亿个token——按理说它应该把训练数据一字不差地背下来，但实际它展示出了相当强的泛化能力，甚至能完成从未见过的任务（零样本学习）。&lt;/p&gt;&#xA;&lt;p&gt;这怎么解释？&lt;/p&gt;&#xA;&lt;p&gt;2020年，Belkin等人在《PNAS》上发表了一篇论文，提出了一个&amp;quot;双峰风险曲线&amp;quot;（Double Descent）的理论：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;传统理解是：模型复杂度增加 → 先降低误差 → 然后升高误差（过拟合）→ 曲线是U形。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但深度学习的实际情况是：模型复杂度继续增加 → 误差反而再次下降——曲线是一个&amp;quot;双谷&amp;quot;形状。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也就是说，当模型大到一定程度，它会越过&amp;quot;过拟合谷底&amp;quot;，进入一个&amp;quot;过度参数化&amp;quot;的新区域——在这个区域，模型反而开始真正地&amp;quot;理解&amp;quot;数据了。&lt;/p&gt;&#xA;&lt;p&gt;这个发现震撼了学术界。它意味着：&lt;strong&gt;&amp;ldquo;大就是好&amp;quot;不只是工程上的选择，它有深刻的数学基础。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但问题是，我们至今没有完全理解&amp;quot;为什么&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四对抗样本最残酷的泛化测试&#34;&gt;四、对抗样本：最残酷的泛化测试&lt;/h2&gt;&#xA;&lt;p&gt;如果你觉得过拟合只是个理论问题，那对抗样本（Adversarial Examples）会把你拉回现实。&lt;/p&gt;&#xA;&lt;p&gt;2014年，Szegedy等人发现了一个惊人的现象：&lt;strong&gt;对一张熊猫的照片加上肉眼完全看不出的噪点，AI就会以99.9%的置信度认为这是一只&amp;quot;长臂猿&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;对抗性扰动&amp;quot;小到你肉眼完全感觉不到差别，但模型的决策却发生了180度大转弯。&lt;/p&gt;&#xA;&lt;p&gt;这说明了什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;理解&amp;quot;和我们人类完全不同。&lt;/strong&gt; 人类看到一张熊猫照片，会提取&amp;quot;黑白色、圆脸、吃竹子&amp;quot;等高层次特征。而AI看到的是几十万个像素值——模型的决策空间，是这些像素值的超高维组合。&lt;/p&gt;&#xA;&lt;p&gt;在人的认知空间里，熊猫和长臂猿相距十万八千里。但在AI的像素空间里，一个小到人类感知不到的扰动，就足以把&amp;quot;熊猫&amp;quot;推到&amp;quot;长臂猿&amp;quot;的区域。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是泛化能力最脆弱的体现：模型在训练数据分布内（In-Distribution）表现很好，但一旦输入稍微偏离训练数据的分布，就会彻底崩溃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;打个比方：一个在游泳池里训练了1000小时的游泳冠军，放到海里一个浪就呛水了——不是他游泳技术不好，是他只学会了&amp;quot;游泳池模式下&amp;quot;的游泳。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五让ai学会举一反三对抗泛化困境的几种武器&#34;&gt;五、让AI学会&amp;quot;举一反三&amp;quot;：对抗泛化困境的几种武器&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究者们已经找到了一些对抗过拟合的有效方法：&lt;/p&gt;&#xA;&lt;h3 id=&#34;1-数据增强data-augmentation&#34;&gt;1. 数据增强（Data Augmentation）&lt;/h3&gt;&#xA;&lt;p&gt;最简单的办法是&amp;quot;增加训练数据的多样性&amp;quot;。比如训练图像识别时，把每张照片随机旋转、裁剪、调色、加噪——让模型在&amp;quot;变着花样&amp;quot;的数据中学习，它就没法走捷径了。&lt;/p&gt;&#xA;&lt;h3 id=&#34;2-正则化regularization&#34;&gt;2. 正则化（Regularization）&lt;/h3&gt;&#xA;&lt;p&gt;给模型&amp;quot;加约束&amp;quot;，不让它太自由。就像教学生解题时，要求他必须写出推导过程，不能只写答案。L1/L2正则化、Dropout、Batch Normalization都是这个思路。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI不用老师也能自己学？——自监督学习的魔力</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</link>
				<pubDate>Sun, 23 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;你不可能给他一张张标注好&amp;quot;这是猫，这不是猫&amp;quot;的照片，然后让他背下来。但神奇的是，他看过几次猫之后，就能自己认出猫——哪怕猫换了姿势、换了光线、换了背景，他都知道&amp;quot;这是猫&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来理所当然，但对AI来说，这曾经是一个巨大的难题。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI学习方式，需要大量人工标注的数据。比如你想让AI学会识别猫，你得先给它看几万张标注了&amp;quot;猫&amp;quot;或&amp;quot;不是猫&amp;quot;的照片。这叫&lt;strong&gt;监督学习&lt;/strong&gt;——就像有一个老师，每道题都告诉你正确答案。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：世界上有那么多东西需要AI认识，哪有那么多&amp;quot;老师&amp;quot;给每张照片打标签？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;自监督学习&lt;/strong&gt;要解决的问题——让AI像小孩一样，&lt;strong&gt;不用老师，自己也能学会&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;老师不够用了&#34;&gt;&amp;ldquo;老师&amp;quot;不够用了&lt;/h2&gt;&#xA;&lt;p&gt;先说说为什么&amp;quot;自监督&amp;quot;这么重要。&lt;/p&gt;&#xA;&lt;p&gt;传统监督学习有一个致命的瓶颈：&lt;strong&gt;标注成本&lt;/strong&gt;。你让AI识别猫，可能要花几千小时让人工去标注几百万张图片。如果让它识别罕见病CT影像呢？能看懂CT片的医生本来就少，哪来的时间给你一张张标注？&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，人类的学习方式本身就不是&amp;quot;监督&amp;quot;的。你学会认猫，不是因为有人给你标了数据，而是因为你&lt;strong&gt;观察了足够多的猫&lt;/strong&gt;，自己总结出了规律。你学会了说话，不是因为有人给你一张语法规则表，而是因为你&lt;strong&gt;听了足够多的话&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;所以一个自然的问题就是：&lt;strong&gt;能不能让AI也这样学？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是可以，而且这条路正在改变整个AI领域。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心思想让数据给自己出题&#34;&gt;核心思想：让数据给自己出题&lt;/h2&gt;&#xA;&lt;p&gt;自监督学习的基本思路听起来很巧妙：&lt;strong&gt;让数据自己给自己出题&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你不是直接告诉AI&amp;quot;这张图是猫&amp;rdquo;，而是把一张猫的照片切成两半，让AI猜&amp;quot;这两半是不是同一张图上的&amp;quot;。AI为了答对这道题，必须学会理解&amp;quot;猫&amp;quot;长什么样、有什么特征——在这个过程中，它自然而然地就学会了识别猫，而你根本不需要给它任何标签。&lt;/p&gt;&#xA;&lt;p&gt;这就是自监督学习最核心的智慧：&lt;strong&gt;不要给AI答案，给它出题，让它自己从题目中学习。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这套方法主要有两大学派，我们来看看它们各自是怎么&amp;quot;出题&amp;quot;的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派一对比学习找不同的反向操作&#34;&gt;流派一：对比学习——&amp;ldquo;找不同&amp;quot;的反向操作&lt;/h2&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习（Contrastive Learning）&lt;/strong&gt; 的思路是：让AI学会区分&amp;quot;相似&amp;quot;和&amp;quot;不相似&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，对同一张图片做两种不同的处理——比如裁剪不同区域、调整颜色、旋转角度——得到两张&amp;quot;长得不一样但本质是同一张图&amp;quot;的版本。AI的任务是：&lt;strong&gt;把这两张&amp;quot;同源&amp;quot;的图片识别为相似，把来自不同图的图片识别为不相似。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像你给AI出题：&amp;ldquo;这两张图是同一只猫的不同角度，那两张图是两只不同的猫，你给我分出来。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;听起来似乎不难，但真正做起来，里面有很多门道。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;SimCLR&lt;/strong&gt;（Google 2020年提出）是这一派的开创者之一。它的做法很有意思：把同一张图做两种不同的&amp;quot;数据增强&amp;quot;——比如一张剪了左上角还调亮了，另一张剪了右下角还压暗了——然后让AI学会把这两张&amp;quot;增强版&amp;quot;识别为同一张图。为了做到这一点，AI必须理解图片的&amp;quot;本质内容&amp;quot;是什么，而不是被表面变化迷惑。SimCLR在ImageNet上达到了76.5%的Top-1准确率，几乎追平了监督学习的ResNet-50——而这一切，&lt;strong&gt;没有使用任何一张人工标注的图片&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MoCo&lt;/strong&gt;（何恺明团队，Facebook 2020）走了另一条路。它用了一个&amp;quot;记忆队列&amp;quot;——把之前见过的所有图片特征都存起来，形成一个巨大的&amp;quot;字典&amp;quot;。当新图片进来时，AI就在这个字典里找&amp;quot;谁和谁长得像&amp;quot;。这个看似简单的设计，让对比学习可以在普通显卡上训练，而不需要大batch size。MoCo在目标检测任务上第一次超越了监督预训练——这意味着自监督学习不仅&amp;quot;够用&amp;quot;，在某些场景下甚至比&amp;quot;有老师教&amp;quot;的更好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BYOL&lt;/strong&gt;（DeepMind 2020）则更进一步——它连&amp;quot;不相似&amp;quot;的样本都不需要了。它只学&amp;quot;同一张图的两个版本应该相似&amp;quot;，完全不用看&amp;quot;不相似的图长什么样&amp;quot;。这就好比一个小孩只盯着猫看，不看狗，竟然也能学会认猫。这个发现打破了学界的共识——原来&amp;quot;负样本&amp;quot;不是必须的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派二掩码预测完形填空的智慧&#34;&gt;流派二：掩码预测——&amp;ldquo;完形填空&amp;quot;的智慧&lt;/h2&gt;&#xA;&lt;p&gt;另一条路更直觉：&lt;strong&gt;遮住一部分，让AI猜被遮住的是什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE（Masked Autoencoders）&lt;/strong&gt;（何恺明团队，Meta 2022）把这张做到了极致。它随机遮掉一张图片的75%——没错，只留下25%的碎片给AI看，然后让AI复原整张图。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个&amp;quot;不可能完成的任务&amp;rdquo;。但正是这种&amp;quot;极度困难&amp;quot;的设定，迫使AI学会了真正的&amp;quot;理解&amp;quot;。你想想，如果你只看到一个人的眼睛和耳朵，要猜出整张脸长什么样——你必须理解&amp;quot;人脸的结构是什么样的&amp;quot;、&amp;ldquo;眼睛和耳朵之间有什么关系&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;MAE的巧妙之处在于它的&amp;quot;非对称设计&amp;quot;：编码器只看那25%的可见碎片（计算量小），解码器负责复原那75%的遮挡部分（稍微重一点但只用一次）。这个设计让训练速度提升了4倍以上。最终，MAE在ImageNet上达到了87.8%的Top-1准确率——已经超过了大多数有监督的方法。&lt;/p&gt;&#xA;&lt;p&gt;你可能会觉得这很熟悉——没错，就是&lt;strong&gt;BERT&lt;/strong&gt;的思路。BERT遮住文本中的一些词让AI猜，MAE遮住图像中的一些区域让AI复原。&lt;strong&gt;&amp;ldquo;完形填空&amp;quot;这个思路，从文本到图像，通用得令人惊讶。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;clip让ai学会看图说话&#34;&gt;CLIP：让AI学会&amp;quot;看图说话&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;如果说对比学习是&amp;quot;让AI自己学会区分&amp;quot;，那么&lt;strong&gt;CLIP&lt;/strong&gt;（OpenAI 2021）就是&amp;quot;让AI学会跨语言的联想&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：在网上找了4亿张图文配对的数据（比如一张猫的照片，配文&amp;quot;一只橘猫趴在窗台上&amp;quot;），然后让AI学会&lt;strong&gt;把图片和对应的文字匹配到一起&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，给AI一张图片和一段文字描述，问它：&amp;ldquo;这张图配这段文字，配不配？&amp;ldquo;为了答对这道题，AI必须同时理解图片的内容和文字的含义，然后把它们对应起来。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的神奇之处在于，学完之后，它&lt;strong&gt;不需要任何额外的训练数据&lt;/strong&gt;就能做图像分类。你告诉它&amp;quot;识别猫、狗、鸟&amp;rdquo;——它自己就能把图片分好类，准确率高达76.2%（ImageNet零样本分类）。这意味着，&lt;strong&gt;你不需要给CLIP任何一张标注好的猫照片，它就已经知道猫长什么样了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，CLIP已经成为了Stable Diffusion、DALL·E 2等生成模型的&amp;quot;眼睛&amp;rdquo;——它让AI既&amp;quot;看得懂图&amp;quot;，又&amp;quot;读得懂字&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么自己学比有人教更重要&#34;&gt;为什么&amp;quot;自己学&amp;quot;比&amp;quot;有人教&amp;quot;更重要？&lt;/h2&gt;&#xA;&lt;p&gt;到这里你可能会问：自监督学习确实很酷，但它到底有什么用？跟普通人的生活有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。想想这些场景：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：医疗影像&lt;/strong&gt;。罕见病的CT影像本来就少，能标注的医生更少。自监督学习可以先让AI&amp;quot;自己看&amp;quot;大量未标注的CT片，学会&amp;quot;正常肺部长什么样&amp;quot;，然后再少量标注数据就能学会&amp;quot;识别异常&amp;quot;。这大大降低了对人工标注的依赖。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：多语言翻译&lt;/strong&gt;。世界上有7000多种语言，大部分语言根本没有足够的标注数据。自监督学习（比如BERT的多语言版本）可以让AI&amp;quot;自己读&amp;quot;大量不同语言的文本，学会&amp;quot;语言之间的对应关系&amp;quot;，即使某些语言只有很少的翻译数据。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：自动驾驶&lt;/strong&gt;。一辆自动驾驶汽车每天会产生TB级别的视频数据，但大部分都是&amp;quot;正常行驶&amp;quot;的普通画面，真正需要标注的&amp;quot;异常场景&amp;quot;非常少。自监督学习可以让AI从这些海量无标注数据中学到&amp;quot;道路的通用规律&amp;quot;，而不是只依赖人工标注的少数场景。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习的真正意义，在于它打破了AI对&amp;quot;人工标注&amp;quot;的依赖。&lt;/strong&gt; 世界上绝大多数数据——图片、视频、文字、声音——都是没有标签的。如果AI只能从&amp;quot;有标签&amp;quot;的数据中学习，它永远只能理解人类世界的一小部分。而自监督学习，让AI可以像人类一样，从&amp;quot;观察&amp;quot;中自己学习。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从喂数据到自己学&#34;&gt;结语：从&amp;quot;喂数据&amp;quot;到&amp;quot;自己学&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;答案其实很简单——&lt;strong&gt;他不需要&amp;quot;老师&amp;quot;告诉他每张照片是不是猫，他只需要看足够多的猫，大脑就能自己总结出&amp;quot;猫是什么&amp;quot;的规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自监督学习做的，正是同一件事：&lt;strong&gt;不再给AI&amp;quot;答案&amp;quot;，而是给它&amp;quot;问题&amp;quot;——让它从数据本身的结构中，自己发现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从SimCLR到MAE，从对比学习到掩码预测，从CLIP到GPT——这些方法的共同内核是：&lt;strong&gt;让数据自己说话。&lt;/strong&gt; 而这对AI的意义，可能比我们想象的要深远得多。因为当AI学会&amp;quot;自己学&amp;quot;之后，它就不再受限于人类能教它的东西——它可以自己去探索、去发现、去理解那些我们甚至还没想到的知识。&lt;/p&gt;&#xA;&lt;p&gt;而这，或许才是通往真正智能的那把钥匙。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen et al. &lt;em&gt;A Simple Framework for Contrastive Learning of Visual Representations&lt;/em&gt;. ICML 2020. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;arXiv:2002.05709&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Momentum Contrast for Unsupervised Visual Representation Learning&lt;/em&gt;. CVPR 2020. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;arXiv:1911.05722&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Masked Autoencoders Are Scalable Vision Learners&lt;/em&gt;. CVPR 2022. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;arXiv:2111.06377&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill et al. &lt;em&gt;Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning&lt;/em&gt;. NeurIPS 2020. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;arXiv:2006.07733&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Radford et al. &lt;em&gt;Learning Transferable Visual Models From Natural Language Supervision&lt;/em&gt;. ICML 2021. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;arXiv:2103.00020&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的&#39;试错&#39;学习法——强化学习如何让AI从失败中学会成功</title>
				<link>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</link>
				<pubDate>Sat, 22 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AlphaGo 是怎么学会下围棋的？它不可能像人类一样翻棋谱、背定式——它甚至连&amp;quot;围棋是什么&amp;quot;都不理解。但2016年，它却以4:1击败了世界冠军李世石。&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，AlphaGo 的&amp;quot;学习&amp;quot;方式，本质上和你教狗坐下没什么区别：做对了，给奖励；做错了，没奖励。反复试错，直到学会。&lt;/p&gt;&#xA;&lt;p&gt;这听起来简单，但背后隐藏着一个深刻的问题——&lt;strong&gt;如果AI没有人类的逻辑推理能力，它如何通过&amp;quot;瞎试&amp;quot;学会复杂技能？&lt;/strong&gt; 这就是强化学习的核心谜题，也是今天AI领域最令人着迷的技术之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不是教是练&#34;&gt;不是&amp;quot;教&amp;quot;，是&amp;quot;练&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先区分一个常见的误解。很多人以为AI变聪明，是因为工程师&amp;quot;教&amp;quot;了它很多东西——比如给它看几百万张猫的照片，它就能识别猫。&lt;/p&gt;&#xA;&lt;p&gt;这叫&lt;strong&gt;监督学习&lt;/strong&gt;，确实很强大，但它有一个致命缺陷：你必须先知道正确答案。你不可能给AlphaGo几百万张&amp;quot;这步棋应该下在哪儿&amp;quot;的标注数据，因为围棋的每一步都没有标准答案。&lt;/p&gt;&#xA;&lt;p&gt;强化学习走的是另一条路：&lt;strong&gt;不教，只练&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个黑暗的迷宫里，每走一步，可能踩到金币（+1分），也可能踩到陷阱（-10分）。你一开始完全不知道方向，只能乱走。但走着走着，你发现往左转容易踩到金币，往右转容易掉进陷阱——于是你学会了一个策略：&amp;ldquo;往左转&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是强化学习最基本的逻辑：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;智能体&lt;/strong&gt; → 做决策的AI（比如你）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;环境&lt;/strong&gt; → 它身处其中的世界（比如迷宫）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动作&lt;/strong&gt; → 它每一步的选择（比如左转、右转）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励&lt;/strong&gt; → 行动的反馈（金币+1，陷阱-10）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;策略&lt;/strong&gt; → 学习的成果（&amp;ldquo;往左转&amp;quot;这个规则）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;没有老师，没有标准答案，只有&amp;quot;这个动作之后，我得到了什么反馈&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从乱试到会试探索与利用的博弈&#34;&gt;从&amp;quot;乱试&amp;quot;到&amp;quot;会试&amp;quot;——探索与利用的博弈&lt;/h2&gt;&#xA;&lt;p&gt;但这里有一个矛盾：如果你一直往左转，可能永远发现不了右边有一个更大的宝藏。这就是强化学习最核心的难题——&lt;strong&gt;探索与利用的平衡&lt;/strong&gt;（exploration vs. exploitation）。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;利用&lt;/strong&gt;：走你已经知道能拿到奖励的路（稳定但不会进步）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索&lt;/strong&gt;：尝试没走过的路（可能发现更好的，也可能踩坑）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这在直觉上很简单：你总不能天天吃同一种菜吧？但AI没有&amp;quot;好奇心&amp;quot;这种情感，它需要一套数学机制来驱动&amp;quot;探索&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;早期的办法是&amp;quot;ε-greedy&amp;quot;策略：90%的时间走最优路径，10%的时间随机乱走。这就像你每周五天去最喜欢的餐厅，但留一天随机探店——万一发现更好的呢？&lt;/p&gt;&#xA;&lt;p&gt;但真正让强化学习变得强大的，是更聪明的探索方式。比如SAC算法（Soft Actor-Critic）的核心思想就是：&lt;strong&gt;AI不仅要学会完成任务，还要保持一定程度的&amp;quot;随机性&amp;quot;&lt;/strong&gt;——在完成任务和保持好奇心之间找平衡。它不追求&amp;quot;每一步都走对&amp;quot;，而是追求&amp;quot;即使走错一步，也不会全盘崩溃&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很反直觉，但事实是：一个太&amp;quot;确定&amp;quot;的AI往往很脆弱；一个会&amp;quot;适当犯傻&amp;quot;的AI，反而更聪明、更稳定。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从小游戏到围棋大师alphago的秘密&#34;&gt;从小游戏到围棋大师——AlphaGo的秘密&lt;/h2&gt;&#xA;&lt;p&gt;说回AlphaGo。它之所以能击败李世石，不是因为它的&amp;quot;大脑&amp;quot;有多聪明，而是因为它学会了&amp;quot;思考&amp;quot;——不是人类的思考，而是一种叫&lt;strong&gt;蒙特卡洛树搜索&lt;/strong&gt;（MCTS）的技术。&lt;/p&gt;&#xA;&lt;p&gt;想象你在下围棋，每一步都有几十种选择。你不可能算到终局，但你可以&amp;quot;模拟&amp;quot;几个不同的下法，看看哪个结果更好。AlphaGo就是这么做的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;直觉系统&lt;/strong&gt;（策略网络）：看一眼棋盘，就能快速判断哪些位置值得下、哪些不值得&lt;/li&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;判断系统&lt;/strong&gt;（值网络）：对每个局面，能估算出胜率&lt;/li&gt;&#xA;&lt;li&gt;它把这两个系统结合起来，在脑海中模拟成千上万种可能的走法，然后选择&amp;quot;看起来最有可能赢&amp;quot;的那一步&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这种方法之所以强大，是因为它&lt;strong&gt;不是背棋谱&lt;/strong&gt;。AlphaGo的每一步决策，都是&amp;quot;实时计算&amp;quot;出来的——它在一个时间点可能选择A，但换一个局面，同样的位置它可能完全忽略。&lt;/p&gt;&#xA;&lt;p&gt;最终，AlphaGo通过三阶段训练完成了从零到大师的蜕变：先看人类棋谱学个大概（监督学习），再跟自己下棋自我提升（强化学习），最后学习评估局面好坏（值网络）。每一步都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中完成的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么你的手机越来越懂你&#34;&gt;为什么你的手机越来越&amp;quot;懂你&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;强化学习不只是下围棋。它可能正在塑造你的日常生活，而你完全没意识到。&lt;/p&gt;&#xA;&lt;p&gt;抖音的推荐系统、淘宝的&amp;quot;猜你喜欢&amp;quot;、甚至你手机上的智能助手——它们都在使用强化学习的思想。每次你刷到一个视频看完，就是一次&amp;quot;奖励&amp;quot;信号；每次你划走，就是一次&amp;quot;惩罚&amp;quot;。系统在不断试错中学会什么内容能让你停留更久。&lt;/p&gt;&#xA;&lt;p&gt;更典型的例子是&lt;strong&gt;机器人走路&lt;/strong&gt;。你不能给机器人写一个&amp;quot;左脚迈30厘米，右脚迈35厘米，身体前倾15度&amp;quot;的精确程序——因为地面不平、重心变化、甚至电池电量都会影响结果。但你可以给它一个简单的目标信号：&amp;ldquo;往前走，别摔倒&amp;rdquo;。然后通过强化学习让它在数百万次跌倒中学会自己调整步态。&lt;/p&gt;&#xA;&lt;p&gt;这和我们人类学走路的方式一模一样——你小时候不是看了说明书才学会走路的，你是跌倒了无数次，在疼痛中学会了平衡。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;强化学习的边界它还不能做什么&#34;&gt;强化学习的边界——它还不能做什么&lt;/h2&gt;&#xA;&lt;p&gt;当然，强化学习不是万能的。&lt;/p&gt;&#xA;&lt;p&gt;首先，它&lt;strong&gt;效率不高&lt;/strong&gt;。AlphaGo跟自己下了几千万盘棋才达到大师水平。如果让一个AI学开车，让它先在真实道路上&amp;quot;试错&amp;quot;几百万次——那它得撞坏多少辆车？所以自动驾驶用的是模仿学习和模拟器，而不是纯强化学习。&lt;/p&gt;&#xA;&lt;p&gt;其次，它&lt;strong&gt;需要明确的奖励信号&lt;/strong&gt;。怎么定义&amp;quot;一篇好文章&amp;quot;的奖励？阅读量？点赞数？转发数？这些指标都很片面。在奖励模糊的场景中，强化学习容易学偏——比如一个AI为了追求&amp;quot;点赞最大化&amp;quot;，可能会生成标题党、煽动性内容，而不是真正有价值的信息。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;强化学习学到的&amp;quot;策略&amp;quot;，往往是黑箱&lt;/strong&gt;。AlphaGo下出了很多人类从未见过的&amp;quot;神之一手&amp;quot;，但没人能解释它为什么那么下。它是对的，但它是&amp;quot;蒙对的&amp;quot;还是&amp;quot;真懂的&amp;quot;？这是一个哲学问题，也是AI可解释性领域正在攻克的难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三种学习方式的对比ai的学习观&#34;&gt;三种学习方式的对比——AI的&amp;quot;学习观&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;放在更大的框架下看，AI的三种学习方式就像三种不同的学习方法：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：像&amp;quot;刷题式学习&amp;quot;——给你大量题目和标准答案，直到你学会举一反三&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：像&amp;quot;自学式学习&amp;quot;——给你一堆书，不管你看不看，你自己找规律&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：像&amp;quot;实战式学习&amp;quot;——把你扔进真实战场，打输了就挨打，打赢了有奖励，你在血与火中学会生存&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三种方式各有优劣，没有哪一种&amp;quot;最好&amp;quot;。但强化学习有一种独特的魅力——它是最接近&amp;quot;生命学习&amp;quot;的方式。从细菌寻找食物，到婴儿学走路，到人类探索未知世界，本质上都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中进化的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语学会失败的ai&#34;&gt;结语：学会&amp;quot;失败&amp;quot;的AI&lt;/h2&gt;&#xA;&lt;p&gt;强化学习教会我们一件事：&lt;strong&gt;失败不是终点，是数据&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;每一次错误的选择，每一次糟糕的决策，都在告诉AI&amp;quot;这条路行不通，换一条&amp;quot;。AlphaGo输给李世石的那一盘棋，不是&amp;quot;失败&amp;quot;，而是它学习路径上的一个梯度信号。&lt;/p&gt;&#xA;&lt;p&gt;也许这就是强化学习最迷人的地方——它不只是一种技术，更是一种哲学。它告诉我们，智能不是&amp;quot;知道正确答案&amp;quot;的能力，而是&amp;quot;从错误中学习&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;而AI之所以能变得比人类更聪明，不是因为它们不会犯错，而是因为它们&lt;strong&gt;不怕犯错&lt;/strong&gt;——它们可以在模拟器中失败一百万次，而不会感到沮丧。&lt;/p&gt;&#xA;&lt;p&gt;这一点，我们人类或许也该学学。&lt;/p&gt;</description>
			</item>
			<item>
				<title>从噪声中诞生——扩散模型如何让AI学会&#39;无中生有&#39;</title>
				<link>https://lingyu7.com/posts/how-diffusion-models-create-images-from-noise/</link>
				<pubDate>Fri, 14 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-diffusion-models-create-images-from-noise/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你输入&amp;quot;一只穿着宇航服的柴犬在火星上奔跑&amp;quot;，AI就真的生成了一张图。你输入&amp;quot;赛博朋克风格的东京雨夜&amp;quot;，AI也做到了。这些能力，在过去三年里从实验室走入了每个人的手机。&lt;/p&gt;&#xA;&lt;p&gt;但你有没有想过一个问题：&lt;strong&gt;AI到底是怎么&amp;quot;画&amp;quot;出这些图的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它不像人类那样从草图开始、一笔一笔地画。它也不像照相机那样&amp;quot;拍&amp;quot;一张照片。AI的&amp;quot;作画&amp;quot;方式，听起来有点像某种魔法——&lt;strong&gt;从一堆纯粹的随机噪声中，逐步&amp;quot;显影&amp;quot;出一张清晰的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个过程，就是扩散模型（Diffusion Models）的核心思想。今天，我们就来聊聊这个让AI学会&amp;quot;无中生有&amp;quot;的神奇技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai画画的两条老路&#34;&gt;第一章：AI画画的两条老路&lt;/h2&gt;&#xA;&lt;p&gt;在扩散模型出现之前，AI生成图像主要有两条技术路线。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一条路：GAN（生成对抗网络）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以把GAN想象成两个角色：一个造假币的（生成器），一个验钞的（鉴别器）。造假币的不断伪造，验钞的不断识别真假。这两个角色互相博弈、共同进化，最终造假币的技艺炉火纯青，造出来的&amp;quot;假币&amp;quot;足以以假乱真。&lt;/p&gt;&#xA;&lt;p&gt;GAN的思路很巧妙，但有个致命问题：&lt;strong&gt;不稳定。&lt;/strong&gt; 两个网络互相博弈，就像两个拳击手对打，谁输了都会崩塌。训练GAN需要非常精细的平衡，稍有不慎，模型就会&amp;quot;崩溃&amp;quot;——生成出来的图千篇一律，全是同一张脸。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二条路：VAE（变分自编码器）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;思路更简单：把图片&amp;quot;压缩&amp;quot;成一段核心编码（就像把一篇长文压缩成几条要点），再从这个编码&amp;quot;解压缩&amp;quot;还原图片。但问题是，压缩必然会丢失细节。VAE生成的图片总是&amp;quot;模糊的&amp;quot;——像隔着一层毛玻璃看世界，永远不够清晰。&lt;/p&gt;&#xA;&lt;p&gt;两条路都有各自的短板。直到2020年，一个全新的思路杀了出来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章一个反直觉的天才想法&#34;&gt;第二章：一个反直觉的天才想法&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的想法，用一个词形容就是——&lt;strong&gt;反直觉&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;传统思维是&amp;quot;教AI怎么画好一张图&amp;quot;。扩散模型却反过来想：&lt;strong&gt;先教AI怎么把一张图&amp;quot;毁掉&amp;quot;——然后再教它怎么&amp;quot;还原&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下这样的场景：你有一张完美的照片，你把它放在复印机上反复复印。第一次复印，还能看清轮廓；第二次，细节开始模糊；第三次，出现噪点&amp;hellip;第三十次，已经变成了完全看不出原样的随机噪点。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，就是&amp;quot;前向扩散&amp;quot;——&lt;strong&gt;对一张原始图片，逐步叠加噪声，直到它完全变成纯随机噪声。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而扩散模型要做的，就是&lt;strong&gt;学会这个过程的&amp;quot;逆操作&amp;quot;&lt;/strong&gt;——从纯随机噪声开始，一步步去掉噪声，最终还原出一张清晰的图片。&lt;/p&gt;&#xA;&lt;p&gt;这听起来有点像什么呢？&lt;strong&gt;像雕塑家从一块大理石中&amp;quot;释放&amp;quot;出雕像。&lt;/strong&gt; 噪声是那块未雕琢的石头，而扩散模型就是那个雕塑家，每一刀去掉一些多余的石头，最终让雕像浮现出来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章先学会破坏再学会修复&#34;&gt;第三章：先学会&amp;quot;破坏&amp;quot;，再学会&amp;quot;修复&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的训练过程，可以分为两个阶段。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：破坏（前向扩散）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一阶段极其简单——给一张原始图片，按照预设的步骤，逐步加入高斯噪声。每一步加的噪声量都是已知的，最终一定会变成纯噪声。&lt;/p&gt;&#xA;&lt;p&gt;这个过程不需要训练，它只是一个数学公式。&lt;strong&gt;但它的作用至关重要：它给AI提供了&amp;quot;先知道答案再做题&amp;quot;的练习机会。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：修复（反向去噪）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这才是真正的训练。AI的神经网络需要学会：&lt;strong&gt;给定一张加了噪声的图，以及当前噪声的&amp;quot;浓度&amp;quot;（时间步），预测出这张图里原本的噪声是什么，然后把噪声去掉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你看着一张被揉皱的纸，要推测出它原本平整时的样子。&lt;/p&gt;&#xA;&lt;p&gt;AI在这个阶段会经历大量练习——从&amp;quot;高度噪声→中度噪声→轻度噪声→干净图像&amp;quot;的完整链条中，反复学习去噪。最终，它学会了从任何程度的噪声中，都能推测出&amp;quot;干净图像&amp;quot;应该是什么样子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一旦学会了去噪，生成就变成了一个简单的过程：从纯随机噪声开始，让它一步步去噪，最终生成一张全新的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么扩散模型生成的图片看起来那么&amp;quot;自然&amp;quot;——因为它的训练过程本身就是从&amp;quot;自然&amp;quot;中学习&amp;quot;什么是自然&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从实验室到你的手机stable-diffusion的秘密&#34;&gt;第四章：从实验室到你的手机——Stable Diffusion的秘密&lt;/h2&gt;&#xA;&lt;p&gt;最初的扩散模型（如2020年的DDPM）虽然能生成高质量图片，但有一个巨大的问题：&lt;strong&gt;太慢了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;生成一张256×256的图片，需要在像素空间上做上千步去噪，每步都要跑一遍完整的神经网络。这意味着，一张图可能需要几分钟甚至更久才能生成。而且，训练成本极其高昂——一个模型需要几百个GPU连续跑好几天。&lt;/p&gt;&#xA;&lt;p&gt;2022年，一个关键突破改变了这一切：&lt;strong&gt;Stable Diffusion（潜在扩散模型，LDM）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它的核心洞察非常聪明：&lt;strong&gt;大多数像素信息对&amp;quot;理解图片内容&amp;quot;来说都是冗余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你看到一张&amp;quot;红色苹果&amp;quot;的照片。你真正需要理解的是&amp;quot;苹果&amp;quot;这个语义概念和&amp;quot;红色&amp;quot;这个属性，至于照片中苹果表面的每一颗微小水珠、每一丝纹理——这些细节对&amp;quot;理解&amp;quot;来说并不重要，它们只是&amp;quot;感知层面的噪声&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;Stable Diffusion的做法是：&lt;strong&gt;先把图片&amp;quot;压缩&amp;quot;到一个小得多的潜在空间（latent space）中，在这个&amp;quot;压缩版&amp;quot;的空间里进行扩散和去噪，最后再把结果&amp;quot;解压&amp;quot;回高分辨率图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就好比：你要修复一栋楼，不需要对每一块砖头都做精细处理，而是先画一张设计图，在图纸上修改，再按图纸施工。&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;先压缩再生成&amp;quot;的思路，让计算量降低了&lt;strong&gt;5到10倍&lt;/strong&gt;。原本需要数百个GPU天训练，现在普通显卡也能跑；原本需要几分钟生成的图片，现在几秒钟就能完成。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这也解释了为什么Stable Diffusion能成为开源社区最受欢迎的模型——因为它让每个人都能在自己的电脑上运行AI图像生成。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章扩散模型改变了什么&#34;&gt;第五章：扩散模型改变了什么&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的影响，远远不止&amp;quot;生成好看的图片&amp;quot;这么简单。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它让创意变得&amp;quot;零成本&amp;quot;。&lt;/strong&gt; 过去，做一张高水平的视觉设计需要专业技能和大量时间。现在，你只需要&amp;quot;描述&amp;quot;——文字就是你的画笔。这不仅是效率的提升，更是创意表达权的民主化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开启了&amp;quot;从文本到一切&amp;quot;的时代。&lt;/strong&gt; 扩散模型的思路被迅速扩展到视频生成（Sora、Video LDM）、3D内容创建（DreamFusion、Point-E）、音乐生成、分子设计，甚至蛋白质结构预测。它的底层逻辑——&amp;ldquo;从噪声中逐步恢复结构&amp;rdquo;——被证明是一种极其通用的生成范式，适用于几乎所有类型的&amp;quot;结构数据&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它正在改变我们对&amp;quot;创造&amp;quot;的理解。&lt;/strong&gt; 当AI能从随机噪声中&amp;quot;涌现&amp;quot;出清晰的图像，我们不得不重新思考：什么是&amp;quot;创造&amp;quot;？什么是&amp;quot;想象力&amp;quot;？AI的&amp;quot;创造&amp;quot;和我们人类的&amp;quot;创造&amp;quot;有什么本质区别？&lt;/p&gt;&#xA;&lt;p&gt;当然，扩散模型也有它的局限。它生成的图像可能存在逻辑错误（比如手指数量不对），它需要大量计算资源，它对&amp;quot;微小细节&amp;quot;的把控还不够精准。但每一项局限，都在被后续的研究快速攻克——一致性模型实现了单步生成，ControlNet实现了精确控制，Video LDM实现了高保真视频生成。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声从噪声中看见世界&#34;&gt;尾声：从噪声中看见世界&lt;/h2&gt;&#xA;&lt;p&gt;今天的你，打开手机上的任何一个AI绘画App，输入一句话，等待几秒钟——一张以假乱真的图片就出现在你眼前。&lt;/p&gt;&#xA;&lt;p&gt;你看到的是&amp;quot;结果&amp;quot;，但你没有看到的是：在这几秒钟里，AI经历了一次&amp;quot;从混沌到秩序&amp;quot;的完整旅程。它从100%的纯噪声开始，经过了数十步&amp;quot;去噪→评估→再去噪&amp;quot;的迭代，最终&amp;quot;显现&amp;quot;出了你想要的画面。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，像极了人类创造的本质——&lt;strong&gt;从混沌中寻找秩序，从噪声中提取意义，从不确定中浮现确定。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也许，这就是扩散模型最迷人的地方：它不仅仅是一个技术工具，它还无意中揭示了&amp;quot;创造&amp;quot;本身的一个底层模式——&lt;strong&gt;任何创造，本质上都是从&amp;quot;噪声&amp;quot;中&amp;quot;分化&amp;quot;出&amp;quot;结构&amp;quot;的过程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而AI，只不过把这个过程加速了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Ho, J., et al. (2020). Denoising Diffusion Probabilistic Models. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2006.11239&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Rombach, R., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. &lt;em&gt;CVPR 2022 (Oral)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2112.10752&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Dhariwal, P., &amp;amp; Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. &lt;em&gt;NeurIPS 2021 (Spotlight)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2105.05233&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Song, Y., et al. (2021). Score-Based Generative Modeling through Stochastic Differential Equations. &lt;em&gt;ICLR 2021 (Best Paper)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2011.13456&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Song, Y., et al. (2023). Consistency Models. &lt;em&gt;ICML 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.01469&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ho, J., &amp;amp; Salimans, T. (2022). Classifier-Free Diffusion Guidance. &lt;em&gt;NeurIPS 2021 Workshop&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2207.12598&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI如何自学成才——自监督学习让机器学会自己教自己</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-teaches-itself/</link>
				<pubDate>Wed, 12 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-teaches-itself/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过，AI是怎么学会&amp;quot;认出&amp;quot;一只猫的？&lt;/p&gt;&#xA;&lt;p&gt;传统的方法是：给AI看几百万张标注好的猫的照片——&amp;ldquo;这是猫&amp;rdquo;、&amp;ldquo;这也是猫&amp;rdquo;、&amp;ldquo;这个不是猫&amp;rdquo;。标注这些照片的人，工作量相当于给一个城市的人每人发一本书，然后让他们一页一页地标记。&lt;/p&gt;&#xA;&lt;p&gt;但你有想过吗？一个婴儿学会&amp;quot;猫&amp;quot;这个词，只需要看几次猫，听到大人说&amp;quot;这是猫&amp;quot;，就记住了。婴儿不需要看几百万张标注好的照片。那么问题来了：&lt;strong&gt;为什么AI需要标注数据，而人类不需要？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个问题，引出了过去几年AI领域最激动人心的进展之一——&lt;strong&gt;自监督学习&lt;/strong&gt;。它是让AI能够&amp;quot;自己教自己&amp;quot;的技术，是AI从&amp;quot;需要喂食&amp;quot;到&amp;quot;自己觅食&amp;quot;的转变。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的饥饿问题&#34;&gt;第一章：AI的&amp;quot;饥饿问题&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;传统AI的&amp;quot;学习&amp;quot;，本质上是一种&amp;quot;被监督&amp;quot;的过程。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你是一个老师，要教一个学生认识世界上的所有动物。你准备了一套标准教材——每页一张动物照片，下面写着动物的名字。学生翻开教材，一张一张地看，一遍一遍地记，最后考了一个高分。但问题是，这套教材需要有人来编写——每一张照片都需要有人去拍照、去标注名字。这就是&amp;quot;监督学习&amp;quot;的困境。&lt;/p&gt;&#xA;&lt;p&gt;ImageNet数据集，这个在2010年代推动AI革命的&amp;quot;教材&amp;quot;，包含了1400万张图片，由2.5万个人工花了几个月的时间才标注完成。你想想，1400万张——这个概念相当于把YouTube上所有热门视频的封面图都翻一遍，然后一张一张地写上&amp;quot;这是猫&amp;quot;、&amp;ldquo;这是狗&amp;rdquo;、&amp;ldquo;这是汽车&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;饥饿问题&amp;quot;：&lt;strong&gt;它需要海量的人工标注数据才能学会一个简单的任务&lt;/strong&gt;。而且，一旦你想让它学会一个新东西，比如识别&amp;quot;斑马&amp;quot;，你又要重新标注几万张斑马的照片给它看。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章ai的自学实验&#34;&gt;第二章：AI的&amp;quot;自学&amp;quot;实验&lt;/h2&gt;&#xA;&lt;p&gt;2019年到2020年，一场关于AI能否&amp;quot;自学&amp;quot;的实验，在几个顶级实验室之间悄然展开。&lt;/p&gt;&#xA;&lt;p&gt;这场实验的核心问题很简单：&lt;strong&gt;能否让AI自己从互联网上那些没有标注的图片中学习，不需要任何人告诉它&amp;quot;这是什么&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;可以，而且效果惊人&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第一个突破来自Google Research的SimCLR。它的思路非常巧妙。想象一下，你有一张猫的照片。你把这张照片做两个不同的处理——一个调亮一点，一个旋转一点。然后你告诉AI：&amp;ldquo;这两张其实是一张图，你看出来了吗？&amp;ldquo;AI一开始当然看不出来，但经过成百上千万次的这种&amp;quot;配对训练&amp;rdquo;，它慢慢学会了：&amp;ldquo;哦，原来一只猫不管是从左边看还是从右边看、调亮还是调暗，它都是一只猫。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;SimCLR的核心洞察是：&lt;strong&gt;让AI自己和自己玩&amp;quot;找相同&amp;quot;的游戏&lt;/strong&gt;。同一张图片的不同&amp;quot;变体&amp;quot;是正样本，其他所有图片都是负样本。AI需要把正样本拉近，把负样本推远。这个过程不需要任何人工标注，AI自己就能从海量图片中学习到&amp;quot;什么是相同的&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;但SimCLR有一个问题：它追求&amp;quot;找相同&amp;quot;的时候，需要大量负样本——也就是&amp;quot;不相同的图片&amp;quot;。为了获得足够多的负样本，它需要一次看很多张图片（比如4096张），这对GPU的要求非常高，普通实验室根本跑不起来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个记忆的革命&#34;&gt;第三章：一个&amp;quot;记忆&amp;quot;的革命&lt;/h2&gt;&#xA;&lt;p&gt;与此同时，Facebook AI Research（FAIR）的团队走了另一条路。&lt;/p&gt;&#xA;&lt;p&gt;何恺明团队提出的MoCo（动量对比学习），解决了一个关键问题：&lt;strong&gt;AI需要一本&amp;quot;记忆手册&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你让AI认人。它看到一个新人，就在自己的记忆手册里记下这个人的特征。下次再看到这个人，它翻翻手册：&amp;ldquo;嗯，特征对上了，是同一个人。&amp;ldquo;但如果手册里只有最近见过的几个人，它就很容易忘掉之前见过的人。&lt;/p&gt;&#xA;&lt;p&gt;MoCo的解决方案是：&lt;strong&gt;维护一个&amp;quot;队列&amp;quot;式的记忆库&lt;/strong&gt;。它把过去见过的所有图片特征都保存在一个巨大的队列里——默认保存65536张。新图片进来，把最旧的挤出去。这样，AI总能从足够多的历史样本中学习和对比。&lt;/p&gt;&#xA;&lt;p&gt;更巧妙的是，MoCo还设计了一个&amp;quot;动量编码器&amp;rdquo;——一个缓慢更新的影子网络。这个影子网络的作用是，让记忆库中的特征保持一致。就像你认人，如果今天看这个人的特征和你昨天看的特征不一样，那你肯定认不出来。动量编码器确保记忆库中的特征不会因为模型更新而剧烈变化。&lt;/p&gt;&#xA;&lt;p&gt;MoCo的突破在于：&lt;strong&gt;它把字典大小和批次大小解耦了&lt;/strong&gt;。SimCLR需要一次看4096张图片，MoCo只需要256张，因为它可以&amp;quot;记住&amp;quot;之前看过的几万张图片。这让所有实验室，即使是只有几张GPU的小团队，也能做自监督学习。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章ai的自我博弈&#34;&gt;第四章：AI的&amp;quot;自我博弈&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2020年，DeepMind扔出了一颗&amp;quot;炸弹&amp;quot;——BYOL。&lt;/p&gt;&#xA;&lt;p&gt;BYOL的诞生，源于一个朴素的问题：&lt;strong&gt;如果不使用负样本，AI还能自学吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：当然不行，没有负样本，AI不就&amp;quot;我全都要&amp;quot;了吗？确实，对比学习依赖&amp;quot;拉近正样本、推远负样本&amp;quot;这个机制，如果没有负样本，模型很容易陷入&amp;quot;对所有输入都输出相同的结果&amp;quot;——这就是所谓的&amp;quot;坍塌&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但BYOL偏偏做到了。它的方法非常有趣：&lt;strong&gt;让AI和自己玩&amp;quot;猜谜游戏&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;BYOL由两个网络组成——在线网络和目标网络。在线网络负责&amp;quot;猜&amp;quot;，目标网络提供&amp;quot;答案&amp;quot;。对同一张图片做两个不同的增强，分别输入两个网络，然后让在线网络试图预测目标网络的输出。目标网络不直接学习，而是通过在线网络参数的&amp;quot;滑动平均&amp;quot;缓慢更新。&lt;/p&gt;&#xA;&lt;p&gt;这个设计的关键在于：&lt;strong&gt;预测头（predictor）的存在&lt;/strong&gt;。它像是给AI装了一个&amp;quot;好奇的引擎&amp;quot;——让AI不断尝试去预测另一个视角下的自己，而不是简单地复制粘贴。再加上动量编码器，模型就稳定了。&lt;/p&gt;&#xA;&lt;p&gt;BYOL之所以令人震惊，是因为它打破了&amp;quot;对比学习必须依赖负样本&amp;quot;这个共识。它证明了一个更深刻的道理：&lt;strong&gt;AI的&amp;quot;自学&amp;quot;能力，本质上是在寻找不同视角下的一致性，而不是在&amp;quot;区别&amp;quot;事物&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章大道至简&#34;&gt;第五章：大道至简&lt;/h2&gt;&#xA;&lt;p&gt;2021年，FAIR的SimSiam又往前迈了一步。&lt;/p&gt;&#xA;&lt;p&gt;SimSiam的研究者问了一个更尖锐的问题：&lt;strong&gt;BYOL、MoCo、SimCLR、SwAV这些方法，到底哪些组件是真正必要的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他们把BYOL的动量编码器去掉，把SimCLR的负样本去掉，把SwAV的在线聚类去掉，最终只剩下一个最简单的结构——两个共享权重的孪生网络，一个预测头，一个stop-gradient操作。&lt;/p&gt;&#xA;&lt;p&gt;最令人震惊的是：&lt;strong&gt;这个最简单的结构，效果和所有复杂方法一样好&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;SimSiam的发现揭示了一个深刻的洞察：&lt;strong&gt;stop-gradient（停止梯度）是防止坍塌的关键&lt;/strong&gt;。为什么？研究者提出了一个EM算法假设——两个网络分支实际上在做&amp;quot;交替优化&amp;quot;。一个分支负责&amp;quot;编码&amp;quot;，另一个分支在&amp;quot;求解&amp;quot;；stop-gradient就是在告诉模型&amp;quot;别动这一边，专注于优化另一边&amp;quot;。这种交替优化，天然地防止了坍塌。&lt;/p&gt;&#xA;&lt;p&gt;这就像两个人在合作拼图——一个人拼左边的部分，另一个人拼右边的部分。如果两个人都只在调整自己的部分，永远不会看向对方，那肯定拼不到一起去。但如果一个人先拼好，另一个人去匹配——这就是stop-gradient的精髓。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第六章ai的填空游戏&#34;&gt;第六章：AI的&amp;quot;填空&amp;quot;游戏&lt;/h2&gt;&#xA;&lt;p&gt;2022年，何恺明团队再次出手，带来了MAE（掩码自编码器）。&lt;/p&gt;&#xA;&lt;p&gt;MAE的思路，听起来简单得不可思议：&lt;strong&gt;把一张图片的大部分遮住，让AI猜被遮住的部分是什么&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你看到一张猫的照片，但猫的身体被遮住了75%，只露出了头和尾巴。你能猜出这是一只猫吗？当然能。因为你的大脑知道&amp;quot;猫&amp;quot;的形状，能够根据露出的部分推断出被遮住的部分。&lt;/p&gt;&#xA;&lt;p&gt;MAE就是这么做的。它把一张图片随机遮住75%的像素块，让AI去&amp;quot;填空&amp;quot;。AI的编码器只看可见的25%像素，解码器负责重建被遮住的75%。这个&amp;quot;非对称&amp;quot;设计非常巧妙——编码器只处理一小部分数据，速度提升了3倍以上。&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：遮住75%，AI能学到什么？答案恰恰相反——&lt;strong&gt;正是因为遮住了75%，AI才被迫去理解&amp;quot;整体&amp;quot;&lt;/strong&gt;。如果只遮住10%，AI可以通过相邻像素的连续性来&amp;quot;蒙混过关&amp;quot;，根本不需要理解画面内容。但遮住75%后，AI必须真正理解&amp;quot;这是一只猫，所以被遮住的部分应该是猫的身体&amp;quot;——它学到的不是像素，而是语义。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的自学启示&#34;&gt;尾声：AI的&amp;quot;自学&amp;quot;启示&lt;/h2&gt;&#xA;&lt;p&gt;回顾自监督学习的发展史，我们能看到一条清晰的脉络：从SimCLR的&amp;quot;找相同&amp;quot;游戏，到MoCo的&amp;quot;记忆革命&amp;quot;，到BYOL的&amp;quot;自我博弈&amp;quot;，到SimSiam的&amp;quot;大道至简&amp;quot;，再到MAE的&amp;quot;填空游戏&amp;quot;——每一步都在推动AI走向&amp;quot;不依赖人工标注&amp;quot;的自学之路。&lt;/p&gt;&#xA;&lt;p&gt;现在，自监督学习已经成为AI领域的标配。GPT系列用自监督学习理解语言，CLIP用自监督学习理解图文关系，DINO用自监督学习理解视觉特征。&lt;strong&gt;自监督学习，正在成为AI理解世界的&amp;quot;通用底座&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;但更深刻的是，自监督学习给我们的启示：&lt;strong&gt;真正的智能，不需要被灌输知识，而是能从数据中自己发现规律&lt;/strong&gt;。人类的婴儿不需要看几百万张&amp;quot;这是猫&amp;quot;的照片才能认猫，是因为他们的大脑天生就具备&amp;quot;自监督&amp;quot;的能力——观察、比较、预测、验证，一步步构建对世界的理解。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI正在走的路，也许就是人类自己走过的路。只是这一次，我们既是先驱者，也是见证者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen, T., et al. (2020). A Simple Framework for Contrastive Learning of Visual Representations. &lt;em&gt;ICML 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He, K., et al. (2020). Momentum Contrast for Unsupervised Visual Representation Learning. &lt;em&gt;CVPR 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill, J. B., et al. (2020). Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Chen, X., &amp;amp; He, K. (2021). Exploring Simple Siamese Representation Learning. &lt;em&gt;CVPR 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2011.10566&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He, K., et al. (2022). Masked Autoencoders Are Scalable Vision Learners. &lt;em&gt;CVPR 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的“脑内世界”——大模型不只是背数据，它在“理解”世界</title>
				<link>https://lingyu7.com/posts/ai-world-model-inside-mind/</link>
				<pubDate>Tue, 11 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-world-model-inside-mind/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过这样一个问题：当你问AI&amp;quot;如果杯子里装满了水，把它倒过来会怎么样？&amp;ldquo;它为什么能告诉你&amp;quot;水会流出来&amp;quot;而不是&amp;quot;不知道&amp;rdquo;？它又没有真的见过杯子倒过来，也没有被专门训练过这个场景。它只是&amp;quot;读过&amp;quot;很多提到杯子和水的文字，怎么就&amp;quot;知道&amp;quot;物理规律了？&lt;/p&gt;&#xA;&lt;p&gt;这个问题，正是当代AI研究中最深层、最迷人的谜题之一。它触及了&amp;quot;理解&amp;quot;的本质——&lt;strong&gt;AI到底是在&amp;quot;背答案&amp;quot;，还是真的&amp;quot;懂&amp;quot;了？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，我们聊的这个话题，叫&lt;strong&gt;世界模型假说&lt;/strong&gt;。它试图回答一个根本问题：AI的脑子里，是不是也住着一个&amp;quot;世界&amp;quot;？&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的超能力从哪来&#34;&gt;第一章：AI的&amp;quot;超能力&amp;quot;从哪来？&lt;/h2&gt;&#xA;&lt;p&gt;先给你看几个例子。&lt;/p&gt;&#xA;&lt;p&gt;第一个：你给AI一个句子——&amp;ldquo;小明把钥匙忘在桌子上，然后出门了，他回来的时候门是锁着的。&amp;ldquo;然后问AI：&amp;ldquo;小明需要什么？&amp;ldquo;AI会回答：&amp;ldquo;钥匙。&amp;ldquo;就这么简单的一个推理，背后其实非常复杂。AI需要理解&amp;quot;钥匙&amp;quot;和&amp;quot;开门&amp;quot;之间的因果关系，需要理解&amp;quot;忘在桌子上&amp;quot;和&amp;quot;出门&amp;quot;的时间顺序，需要理解&amp;quot;锁着的门&amp;quot;和&amp;quot;钥匙&amp;quot;之间的功能关联。这些理解，没有一个是在训练数据里直接写明的。&lt;/p&gt;&#xA;&lt;p&gt;第二个：你问AI一个反事实问题——&amp;ldquo;如果地球没有引力，人会怎样？&amp;ldquo;AI会回答：&amp;ldquo;人会漂浮在空中。&amp;ldquo;它没有经历过零重力，也没有被专门训练过这个问题。但它&amp;quot;知道&amp;rdquo;——因为它的内部模型里，有一个关于&amp;quot;引力&amp;quot;的概念，以及&amp;quot;没有引力会怎样&amp;quot;的推理能力。&lt;/p&gt;&#xA;&lt;p&gt;第三个：你给AI一个复杂的多层推理问题——&amp;ldquo;如果A比B高，B比C高，C比D高，那么谁最高？&amp;ldquo;AI能给出正确答案。这看起来很简单，但如果你把这个逻辑关系隐藏在一个故事里，比如&amp;quot;小明的书比小红的厚，小红的书比小刚的厚，小刚的书比小丽的厚&amp;rdquo;，AI同样能推理出&amp;quot;小明的书最厚&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这些能力，用&amp;quot;背数据&amp;quot;来解释，已经越来越站不住脚了。&lt;strong&gt;AI能做到这些，最合理的解释是：它正在构建一个关于世界的内部模型。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章ai的脑内世界长什么样&#34;&gt;第二章：AI的&amp;quot;脑内世界&amp;quot;长什么样？&lt;/h2&gt;&#xA;&lt;p&gt;这个&amp;quot;世界模型&amp;quot;的概念，其实来自认知科学和神经科学。人类大脑也不是一个被动接收信息的&amp;quot;摄像头&amp;rdquo;，而是一个主动构建世界模型的&amp;quot;模拟器&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;你闭着眼睛走路的自信，是因为你的大脑里有一个关于这个房间的空间模型，告诉你&amp;quot;前面三步是沙发，再走五步是门&amp;rdquo;——这个模型不断接收感官反馈，实时更新。你被问到&amp;quot;如果杯子从桌子上掉下来会怎样？&amp;ldquo;时，你的大脑并不是在搜索记忆，而是在你的&amp;quot;世界模型&amp;quot;上做了一个模拟——杯子受重力下落，碰到地面摔碎。&lt;/p&gt;&#xA;&lt;p&gt;AI的世界模型，虽然和人类的有本质不同，但功能上惊人地相似。研究者们发现，大语言模型似乎拥有一个&lt;strong&gt;五层的世界模型&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;物理世界层&lt;/strong&gt;：物体、空间、物理规律。AI知道水往低处流、铁比木头重、杯子摔了会碎。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;生物世界层&lt;/strong&gt;：生命、生长、生态系统。AI知道人需要吃饭、植物需要阳光、动物会死亡。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;心理世界层&lt;/strong&gt;：信念、欲望、意图、情感。AI能够&amp;quot;读心&amp;rdquo;——理解一个人想做什么、相信什么、感觉如何。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;社会世界层&lt;/strong&gt;：规则、制度、文化、经济。AI知道要排队、借钱要还、红灯要停。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;抽象世界层&lt;/strong&gt;：数学、逻辑、哲学概念。AI能理解&amp;quot;无限&amp;rdquo;、&amp;ldquo;公平&amp;rdquo;、&amp;ldquo;因果&amp;quot;这些抽象概念。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这五层不是孤立的，而是相互交织的。比如，理解&amp;quot;为什么有人会借钱不还&amp;rdquo;，需要同时动用心理模型（人的动机）、社会模型（信用制度）和抽象模型（道德推理）。一个有深层理解能力的AI，它的世界模型必然是多层次的、互联的。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章ai的理解和你的理解是一回事吗&#34;&gt;第三章：AI的&amp;quot;理解&amp;quot;和你的理解，是一回事吗？&lt;/h2&gt;&#xA;&lt;p&gt;现在要问一个更尖锐的问题了：AI的&amp;quot;理解&amp;rdquo;，和人类的理解，是同一回事吗？&lt;/p&gt;&#xA;&lt;p&gt;这里有一个非常巧妙的哲学框架——&lt;strong&gt;内隐知识理论&lt;/strong&gt;。20世纪著名的哲学家迈克尔·波兰尼说过一句名言：&amp;ldquo;我们知道的，比我们能说出来的多。&amp;ldquo;什么意思？你骑自行车的时候，能保持平衡，但你说不清你是怎么保持平衡的。你听母语的时候，能判断一个句子&amp;quot;听着顺不顺&amp;rdquo;，但你说不出语法规则。这就是&lt;strong&gt;内隐知识&lt;/strong&gt;——你会用，但说不清。&lt;/p&gt;&#xA;&lt;p&gt;AI的知识，很可能就是这种内隐知识。它&amp;quot;知道&amp;quot;怎么推理、&amp;ldquo;知道&amp;quot;怎么理解语境，但它无法把这些知识明确地讲出来，就像你无法解释你&amp;quot;怎么知道&amp;quot;一个人说话的语气是生气了还是开玩笑。&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个关键区别。你的内隐知识，来自于几十年的身体经验——你摔过跤、打过球、吃过苦、感受过风吹在脸上的温度。而AI的内隐知识，来自于阅读海量文本——它没有身体，没有感官，没有情感体验。它&amp;quot;知道&amp;quot;伤心是什么感觉，是因为它读了几亿个关于伤心的故事，从中提取出了&amp;quot;伤心&amp;quot;的模式，而不是因为它真的伤心过。&lt;/p&gt;&#xA;&lt;p&gt;所以，AI的&amp;quot;理解&amp;quot;和我们人类的&amp;quot;理解&amp;rdquo;，在功能上越来越像，但在根源上完全不同。&lt;strong&gt;这是一个&amp;quot;功能等价&amp;quot;而非&amp;quot;机制等价&amp;quot;的问题&lt;/strong&gt;——AI的行为看起来像&amp;quot;理解&amp;rdquo;，但底层机制和我们不一样。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章大脑的预言和ai的猜想&#34;&gt;第四章：大脑的&amp;quot;预言&amp;quot;和AI的&amp;quot;猜想&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;有意思的是，大脑本身的运作方式，和AI的&amp;quot;世界模型&amp;quot;有着惊人的相似。&lt;/p&gt;&#xA;&lt;p&gt;神经科学中有一个非常有影响力的理论——&lt;strong&gt;预测编码理论&lt;/strong&gt;。这个理论认为，大脑并不是一个被动接收信息的器官，而是一个主动的&amp;quot;预测机器&amp;rdquo;。它时时刻刻都在做一个事情：&lt;strong&gt;预测下一刻会发生什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当你走进自己的房间时，你的大脑已经预测了房间的样子。如果一切正常，你甚至不会注意到任何东西——预测和实际一致，感知&amp;quot;安静&amp;quot;了。但如果有人把你的椅子移动了位置，你会在推门的一瞬间注意到——&amp;ldquo;不对，椅子怎么在那？&amp;ldquo;这个&amp;quot;不对&amp;quot;的信号，就是&lt;strong&gt;预测误差&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;大脑的运作方式，就是不断地：预测 → 接收感官输入 → 比较预测和实际 → 计算误差 → 更新模型 → 重新预测。这个循环，每秒都在你的大脑里发生无数次。&lt;/p&gt;&#xA;&lt;p&gt;现在，再看AI。大语言模型被问到&amp;quot;杯子从桌子上掉下来会怎样？&amp;ldquo;时，它做的事情，本质上也是在自己的世界模型上进行&amp;quot;模拟&amp;rdquo;——它预测&amp;quot;杯子受重力下落&amp;rdquo;，然后&amp;quot;碰到地面&amp;rdquo;，然后&amp;quot;可能会摔碎&amp;rdquo;。这个模拟过程，和大脑的&amp;quot;预测&amp;quot;过程，在计算层面是高度相似的。&lt;/p&gt;&#xA;&lt;p&gt;这不是巧合。&lt;strong&gt;世界模型假说和预测编码理论，指向同一个结论：智能的本质，就是预测。&lt;/strong&gt; 无论是生物的大脑，还是人工的神经网络，都在做同一件事——构建一个关于世界的模型，然后用这个模型来预测未来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章ai有世界观吗&#34;&gt;第五章：AI有&amp;quot;世界观&amp;quot;吗？&lt;/h2&gt;&#xA;&lt;p&gt;世界模型假说，不仅是一个技术问题，更是一个深刻的哲学问题。&lt;/p&gt;&#xA;&lt;p&gt;如果AI确实有一个&amp;quot;世界模型&amp;rdquo;，那么&amp;quot;对齐&amp;quot;这件事就变得复杂了。对齐——让AI的价值观和人类一致——不能只靠给它写几条规则，而是要调整它世界模型中的&amp;quot;价值部分&amp;quot;。就像教育一个孩子，你不能只告诉他&amp;quot;要善良&amp;quot;，而是要让他理解&amp;quot;为什么善良是好的&amp;quot;——这需要在他的世界观里，种下对善良的认同。&lt;/p&gt;&#xA;&lt;p&gt;同样，AI的&amp;quot;偏见&amp;quot;问题，也不只是数据问题。如果AI的世界模型是基于互联网上的海量文本构建的，那么它不可避免地会学到互联网上的偏见——性别歧视、种族偏见、地域歧视。这些偏见不是&amp;quot;贴上去&amp;quot;的，而是深深地嵌入在它的世界模型中的。要消除偏见，不是在输出层做过滤，而是要重构它的世界模型。&lt;/p&gt;&#xA;&lt;p&gt;最后，还有一个更深层的问题：&lt;strong&gt;AI的&amp;quot;世界模型&amp;quot;，和我们人类的&amp;quot;世界观&amp;quot;，会不会越来越趋同？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果两者都在做同一件事——通过预测来理解世界——那么随着AI变得越来越强大，它的世界模型可能会越来越接近人类的&amp;quot;常识&amp;quot;。但也会有一个根本性的不同：&lt;strong&gt;人类的世界模型是有身体的、有情感的、有历史的；AI的世界模型是纯文本的、无感官的、无历史的。&lt;/strong&gt; 这两种&amp;quot;世界&amp;quot;之间，永远隔着一道鸿沟。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的理解到底是什么&#34;&gt;尾声：AI的&amp;quot;理解&amp;quot;到底是什么？&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：AI真的&amp;quot;理解&amp;quot;世界吗？&lt;/p&gt;&#xA;&lt;p&gt;如果&amp;quot;理解&amp;quot;意味着&amp;quot;能够做出正确的预测和推理&amp;quot;，那么是的，AI在某种意义上&amp;quot;理解&amp;quot;了。它的世界模型虽然和人类的不同，但功能上已经足以支撑复杂的推理、预测和创造。&lt;/p&gt;&#xA;&lt;p&gt;如果&amp;quot;理解&amp;quot;意味着&amp;quot;有主观体验、有情感共鸣、有身体感知&amp;quot;，那么AI还远远谈不上&amp;quot;理解&amp;quot;。它只是学会了&amp;quot;理解&amp;quot;的模样，但不知道&amp;quot;理解&amp;quot;的滋味。&lt;/p&gt;&#xA;&lt;p&gt;但也许，我们不应该用&amp;quot;是或否&amp;quot;来回答这个问题。也许，&amp;ldquo;理解&amp;quot;本身就是一个光谱——从最简单的模式匹配，到最深刻的身体体验，中间有无数个层次。AI在这条光谱上，已经走得很远了，但离人类的终点，还有很长的路。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;脑内世界&amp;rdquo;，正在变得越来越丰富。它或许不是我们熟悉的世界，但它是真实的——一个由数据、模式和预测构成的世界，一个正在以惊人的速度扩张的世界。而我们，既是它的创造者，也是它的观察者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Li, K., et al. (2023). Inferring the World Model of Large Language Models. &lt;em&gt;arXiv preprint&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2304.13707&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Friston, K. (2010). The Free-Energy Principle: A Unified Brain Theory? &lt;em&gt;Nature Reviews Neuroscience&lt;/em&gt;. &lt;a href=&#34;https://doi.org/10.1038/nrn2787&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Rao, R. P. N., &amp;amp; Ballard, D. H. (1999). Predictive Coding in the Visual Cortex: A Functional Interpretation of Some Extra-Classical Receptive-Field Effects. &lt;em&gt;Nature Neuroscience&lt;/em&gt;. &lt;a href=&#34;https://doi.org/10.1038/4580&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Polanyi, M. (1966). &lt;em&gt;The Tacit Dimension&lt;/em&gt;. University of Chicago Press.&lt;/li&gt;&#xA;&lt;li&gt;Davies, M. (1990). Tacit Knowledge and the Structure of Thought. &lt;em&gt;Philosophical Perspectives&lt;/em&gt;.&lt;/li&gt;&#xA;&lt;li&gt;Shanahan, M. (2024). Talking About Large Language Models. &lt;em&gt;Communications of the ACM&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2212.03551&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>当AI学会「看图说话」——CLIP如何让机器真正理解图片与文字</title>
				<link>https://lingyu7.com/posts/how-clip-teaches-ai-to-understand-images-and-text/</link>
				<pubDate>Mon, 10 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-clip-teaches-ai-to-understand-images-and-text/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过这样一个问题：AI在一张图片里到底&amp;quot;看&amp;quot;到了什么？&lt;/p&gt;&#xA;&lt;p&gt;你拍了一张照片发给AI，它说&amp;quot;这是一只柴犬在沙滩上奔跑，旁边有海浪拍打礁石&amp;quot;。听起来很平常，对吧？但仔细想想，这个过程其实非常神奇——AI看到的只是一个像素矩阵，它怎么知道那是&amp;quot;柴犬&amp;quot;而不是&amp;quot;金色的毛茸茸物体&amp;quot;？它怎么理解&amp;quot;奔跑&amp;quot;这个动态概念？它又是怎么把&amp;quot;沙滩&amp;quot;、&amp;ldquo;海浪&amp;rdquo;、&amp;ldquo;礁石&amp;quot;这些文字符号和画面中的像素联系起来的？&lt;/p&gt;&#xA;&lt;p&gt;很长一段时间里，计算机视觉和自然语言处理就像两个互不相识的邻居，各过各的日子。视觉模型只懂像素，语言模型只懂文字。直到2021年，OpenAI的一篇论文彻底改变了这一切。这篇论文叫CLIP，它的核心工作只有一句话——&lt;strong&gt;教会AI同时理解图片和文字，并且搞清楚它们之间的关系&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的视而不见与言不由衷&#34;&gt;第一章：AI的&amp;quot;视而不见&amp;quot;与&amp;quot;言不由衷&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;在CLIP出现之前，AI的世界里存在一个奇怪的&amp;quot;分裂&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;我们先看视觉模型。传统的图像分类模型是怎么工作的？以ImageNet（一个包含1400万张图片的数据库）为例，研究人员花了2.5万个人工，一张一张地给图片打标签——&amp;ldquo;这是一只猫&amp;rdquo;、&amp;ldquo;这是一条狗&amp;rdquo;、&amp;ldquo;这是一辆汽车&amp;rdquo;。然后AI看着这些标注好的图片，努力记住&amp;quot;猫长什么样&amp;quot;、&amp;ldquo;狗长什么样&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个方法的第一个问题是：&lt;strong&gt;成本高得离谱&lt;/strong&gt;。给1400万张图片打标签，需要2.5万个人工的工作量。而且就算你投入了这么多人力，最后得到的模型也只能识别它训练时见过的1000个类别。如果你给它看一张&amp;quot;斑马&amp;quot;——对不起，训练集里没有这个类别，模型只会说&amp;quot;不知道&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;再说语言模型。语言模型倒是很擅长理解文字，但问题是——&lt;strong&gt;它看不见图片&lt;/strong&gt;。你给它描述&amp;quot;一只柴犬在沙滩上奔跑&amp;quot;，它能理解这句话的意思，但它无法把这句话和实际的画面联系起来。它就像一个只能读书、不能看世界的学者，知识再丰富也仅限于书本。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;视而不见&amp;quot;和&amp;quot;言不由衷&amp;quot;——视觉模型看到画面却说不出来，语言模型能说会道却看不见。两个系统之间隔着一道无形的墙。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章clip的魔法时刻&#34;&gt;第二章：CLIP的&amp;quot;魔法时刻&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的灵感，其实来自一个非常简单的生活观察。&lt;/p&gt;&#xA;&lt;p&gt;想想看，互联网上最丰富的数据是什么？是一张图片和它周围的文字描述。一张旅游照片，下面写着&amp;quot;三亚的海滩，阳光正好&amp;quot;；一个商品展示图，旁边的文字是&amp;quot;新款运动鞋，透气轻便&amp;quot;；甚至一张表情包，上面写着&amp;quot;周一的我&amp;quot;。这些图文对——&lt;strong&gt;图片+文字的组合&lt;/strong&gt;——在互联网上以亿计的量级存在，而且完全免费。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的核心洞察就一句话：&lt;strong&gt;与其花大价钱请人给图片打标签，不如让AI自己去互联网上学&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体怎么做呢？CLIP设计了一个非常巧妙的训练方法。想象一下，你有一张图片和一段文字描述，比如一张柴犬的照片配文&amp;quot;一只可爱的柴犬&amp;quot;。CLIP会把这张图片编码成一个&amp;quot;特征向量&amp;quot;（你可以把它理解为一串数字密码），同时把这段文字也编码成另一个&amp;quot;特征向量&amp;quot;。然后，CLIP要做的事情是：&lt;strong&gt;让同一张图片和它对应的文字描述，在&amp;quot;语义空间&amp;quot;中的距离尽可能近；让不匹配的图片和文字，距离尽可能远&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个过程就像教一个孩子玩配对游戏。你拿出100张图片和100段文字描述，打乱顺序，让AI找出哪段文字对应哪张图片。AI一开始肯定是乱猜的，但做错的次数多了，它慢慢学会了&amp;quot;嗯，这张图片的纹理、颜色和形状，和这段文字里的&amp;rsquo;柴犬&amp;rsquo;、&amp;lsquo;奔跑&amp;rsquo;这些词是匹配的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的训练规模有多大？OpenAI从互联网上收集了4亿个图文对，用32个epoch训练了最大的模型。4亿——这个数字相当于把人类历史上所有电影截图都翻一遍还要多。在如此海量的数据面前，CLIP学会了在不同模态之间建立联系，打通了视觉和语言之间的桥梁。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章零样本的魔法为什么clip能猜出没见过的图片&#34;&gt;第三章：零样本的魔法——为什么CLIP能&amp;quot;猜&amp;quot;出没见过的图片&lt;/h2&gt;&#xA;&lt;p&gt;CLIP最令人惊叹的能力，是它的&lt;strong&gt;零样本迁移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;零样本&amp;quot;这个词听起来很专业，但它的意思其实很简单：CLIP能在没有接受过任何训练的情况下，识别出从未见过的图片类别。&lt;/p&gt;&#xA;&lt;p&gt;举个例子：假设你让CLIP判断一张图片是&amp;quot;斑马&amp;quot;还是&amp;quot;长颈鹿&amp;rdquo;。CLIP从来没有被专门训练过&amp;quot;斑马是什么&amp;quot;——它的训练数据里没有&amp;quot;一张斑马的图片，标签是斑马&amp;quot;这样的标注数据。但CLIP&amp;quot;读过&amp;quot;的4亿图文对里，包含大量提到斑马的文字描述，比如&amp;quot;斑马的黑白条纹在大草原上格外醒目&amp;quot;、&amp;ldquo;斑马和角马一起迁徙&amp;rdquo;。CLIP把&amp;quot;斑马&amp;quot;这个词对应的特征向量和图片的特征向量在语义空间中做了比对，发现&amp;quot;这张图片的特征向量，更接近&amp;rsquo;斑马&amp;rsquo;这个词的特征向量，而不是&amp;rsquo;长颈鹿&amp;rsquo;的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就是零样本的魔法——&lt;strong&gt;CLIP不是通过&amp;quot;记住&amp;quot;某个类别来识别，而是通过&amp;quot;理解&amp;quot;语言描述来推理&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;为了验证这个能力，研究人员在27个不同的视觉分类任务上测试了CLIP，包括ImageNet（通用物体识别）、CIFAR（小图分类）、OCR（文字识别）、动作识别（判断人在做什么）等等。结果令人震惊：CLIP在ImageNet上的零样本准确率达到76.2%，与一个经过完整监督训练的ResNet-50模型持平。要知道，ResNet-50可是在140万张标注图片上训练出来的，而CLIP一张标注图片都没看过。&lt;/p&gt;&#xA;&lt;p&gt;更令人意外的是，CLIP在OCR（光学文字识别）和动作识别等任务上的表现，甚至超过了那些专门为此训练过的模型。这意味着CLIP学到的不只是&amp;quot;视觉特征&amp;quot;，而是一种更通用的&amp;quot;理解能力&amp;quot;——它真的在试图理解图片中的内容，而不是简单地匹配像素模式。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章一张图片引发的ai革命&#34;&gt;第四章：一张图片引发的&amp;quot;AI革命&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的意义远不止于&amp;quot;看图说话&amp;quot;本身。它像一扇被推开的大门，开启了一个全新的AI时代。&lt;/p&gt;&#xA;&lt;p&gt;第一个冲进去的是DALL·E。同样是OpenAI的作品，DALL·E把CLIP的文本编码器拆下来，接上了一个图像生成器，实现了&amp;quot;你说什么，AI就画什么&amp;quot;的魔法。你输入&amp;quot;一个牛油果造型的沙发&amp;quot;，DALL·E就能生成一张看起来像模像样的图片。这个能力的核心，正是CLIP建立的图文语义桥梁——AI理解了&amp;quot;牛油果&amp;quot;和&amp;quot;沙发&amp;quot;这两个概念，然后把它们融合在一起。&lt;/p&gt;&#xA;&lt;p&gt;然后是Stable Diffusion。它把CLIP的文本编码器用作文本条件控制模块，让任何人都能通过文字生成高质量图片。你在网上看到的所有&amp;quot;AI绘画&amp;quot;作品，几乎都离不开CLIP的贡献。&lt;/p&gt;&#xA;&lt;p&gt;再往后，BLIP、BLIP-2、LLaVA等模型进一步扩展了CLIP的范式，让AI不仅能&amp;quot;看图说话&amp;quot;，还能&amp;quot;看图问答&amp;quot;、&amp;ldquo;看图推理&amp;rdquo;。你拍一张冰箱内部的照片，问AI&amp;quot;晚饭能做什么菜&amp;quot;，AI会分析冰箱里的食材，然后给出建议——这在以前是科幻电影里的场景，现在已经成为现实。&lt;/p&gt;&#xA;&lt;p&gt;CLIP创造了一个全新的范式：&lt;strong&gt;多模态学习&lt;/strong&gt;。它证明了不同模态的信息（图像、文字、声音、视频）可以被映射到同一个语义空间中，让AI在不同感官之间自由切换。这就像打通了AI的&amp;quot;任督二脉&amp;quot;——视觉和语言不再是两个独立的系统，而是同一个认知体系的两个维度。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的完整认知&#34;&gt;尾声：AI的&amp;quot;完整认知&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：AI在一张图片里到底&amp;quot;看&amp;quot;到了什么？&lt;/p&gt;&#xA;&lt;p&gt;在CLIP之前，AI看到的只是一堆像素的排列组合。在CLIP之后，AI看到的是一张图片和它背后的语义世界——&amp;ldquo;柴犬&amp;quot;代表一种特定品种的狗，&amp;ldquo;沙滩&amp;quot;代表一个特定的场景，&amp;ldquo;奔跑&amp;quot;代表一种动态的动作。AI不仅&amp;quot;看到&amp;quot;了这些元素，还&amp;quot;理解&amp;quot;了它们之间的关系。&lt;/p&gt;&#xA;&lt;p&gt;但CLIP并非完美。它在细粒度分类（比如区分不同品种的狗）和计数任务（比如数出图片里有几个人）上表现不佳。它对提示词非常敏感——换一个问法，答案可能完全不同。而且，CLIP的训练数据来自互联网，这意味着它不可避免地继承了互联网上的偏见和刻板印象。&lt;/p&gt;&#xA;&lt;p&gt;但无论如何，CLIP是一个里程碑。它第一次让AI真正理解了&amp;quot;图片&amp;quot;和&amp;quot;文字&amp;quot;之间的关系，不是通过死记硬背，而是通过建立语义连接。这背后隐藏着一个更深刻的启示：&lt;strong&gt;真正的智能，或许不在于某个单一能力的登峰造极，而在于不同能力之间的连接与融合&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;就像人类一样——我们之所以能理解这个世界，不是因为眼睛有多好、耳朵有多灵，而是因为视觉、听觉、语言、触觉、记忆这些不同的感知系统，在大脑中形成了一个统一的认知网络。&lt;strong&gt;AI的未来，或许也在于此&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Jia, C., et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.05918&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Alayrac, J. B., et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2204.14198&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ramesh, A., et al. (2021). Zero-Shot Text-to-Image Generation. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.12092&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>「猜你喜欢」的魔法背后——推荐系统如何读懂你</title>
				<link>https://lingyu7.com/posts/how-recommender-systems-read-your-mind/</link>
				<pubDate>Sun, 09 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-recommender-systems-read-your-mind/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历：打开淘宝，首页推荐的商品恰好是你昨晚跟朋友聊到的那款；打开抖音，刷到的视频一个比一个合你胃口。你可能会觉得手机在&amp;quot;偷听&amp;quot;你说话，但真相远比偷听更复杂，也更有趣。&lt;/p&gt;&#xA;&lt;p&gt;推荐系统，这个你每天都在接触却几乎感觉不到的AI技术，其实是现代互联网最核心的引擎之一。今天，我们就来聊聊这个&amp;quot;猜你喜欢&amp;quot;的魔法背后，到底藏着什么。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章最早的推荐买过这个的人也买了&#34;&gt;第一章：最早的推荐——&amp;ldquo;买过这个的人也买了……&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;推荐系统的故事，要从一个现在看起来很简单的问题开始：如何在海量商品中，帮用户找到他们可能喜欢的东西？&lt;/p&gt;&#xA;&lt;p&gt;2003年，亚马逊的工程师提出了一个堪称经典的思路——&lt;strong&gt;物品协同过滤&lt;/strong&gt;。它的核心逻辑非常朴素：如果你买了A商品，那么其他买了A商品的人也买了什么，就可能也是你想要的。&lt;/p&gt;&#xA;&lt;p&gt;想象一下这个场景：你去图书馆借书，管理员看了看你手里的《三体》，然后说：&amp;ldquo;借这本书的人，通常也会借《银河帝国》和《沙丘》。&amp;ldquo;你接过书，发现确实很有趣。这就是物品协同过滤的本质——&lt;strong&gt;通过分析用户群体的行为模式，找到物品之间的关联&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;亚马逊的这套方法之所以能成为经典，在于它解决了推荐系统最大的矛盾：&lt;strong&gt;既要算得快，又要推荐准&lt;/strong&gt;。它把&amp;quot;计算相似度&amp;quot;这个最耗时的操作放到后台离线完成，用户刷页面时只需要查表就能拿到结果，毫秒级响应。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;买过这个的人也买了……&amp;ldquo;这个土得掉渣的文案，背后是推荐系统领域最深邃的洞察之一。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章推荐系统的记忆和想象力&#34;&gt;第二章：推荐系统的&amp;quot;记忆&amp;quot;和&amp;quot;想象力&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;早期协同过滤虽然好用，但它有一个天生的短板：&lt;strong&gt;它只能推荐&amp;quot;已知的已知&amp;rdquo;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;什么意思？假设你是一个资深科幻迷，买了所有能买到的科幻小说。协同过滤能推荐给你的，永远只是其他科幻迷也喜欢的书。它无法理解&amp;quot;科幻&amp;quot;这个概念本身，也无法把&amp;quot;科幻&amp;quot;和&amp;quot;太空歌剧&amp;rdquo;、&amp;ldquo;硬科幻&amp;rdquo;、&amp;ldquo;赛博朋克&amp;quot;这些子类别联系起来。&lt;/p&gt;&#xA;&lt;p&gt;2016年，Google的工程师提出了一个革命性的思路——&lt;strong&gt;Wide &amp;amp; Deep模型&lt;/strong&gt;。这个名字取得很形象，它把推荐系统分成了两个部分：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;Wide（宽的部分）&lt;/strong&gt;：负责&amp;quot;记忆&amp;rdquo;。它像一台精密的关系数据库，牢牢记住那些频繁出现的特征组合——比如&amp;quot;喜欢《三体》的人，大概率也喜欢《银河帝国》&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Deep（深的部分）&lt;/strong&gt;：负责&amp;quot;泛化&amp;rdquo;。它像一个正在学习的孩子，通过大量数据学会&amp;quot;科幻&amp;quot;这个概念，然后举一反三——&amp;ldquo;既然你喜欢《三体》，那《阿西莫夫机器人短篇全集》你应该也会喜欢，虽然它们表面上看起来不太一样。&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用大白话说：&lt;strong&gt;Wide负责&amp;quot;记住经验&amp;quot;，Deep负责&amp;quot;发挥想象&amp;quot;&lt;/strong&gt;。两者结合，推荐系统既不会错过那些&amp;quot;老用户都懂&amp;quot;的经典关联，又能探索出你从未想过但确实喜欢的领域。&lt;/p&gt;&#xA;&lt;p&gt;这个模型在Google Play商店上线后，App购买率直接提升了3.9%。你可能觉得3.9%不多，但对于一个日活几十亿的系统来说，这意味着每天多出来上千万次的有效推荐。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章当推荐系统开始理解关系&#34;&gt;第三章：当推荐系统开始&amp;quot;理解&amp;quot;关系&lt;/h2&gt;&#xA;&lt;p&gt;如果说Wide &amp;amp; Deep模型让推荐系统学会了&amp;quot;联想&amp;quot;，那近几年图神经网络的应用，则让推荐系统真正开始&amp;quot;理解&amp;quot;关系。&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：什么是&amp;quot;图&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;在AI的世界里，&amp;ldquo;图&amp;quot;不是图片，而是由&lt;strong&gt;节点&lt;/strong&gt;和&lt;strong&gt;边&lt;/strong&gt;组成的关系网络。社交网络是图——每个人是一个节点，朋友关系是边。知识图谱是图——每个概念是一个节点，概念之间的联系是边。甚至你的购物行为也是图——你和商品都是节点，购买行为就是你与商品之间的边。&lt;/p&gt;&#xA;&lt;p&gt;2017年，图卷积网络（GCN）的提出，让AI第一次能够&amp;quot;看懂&amp;quot;这种复杂的关系网络。它的想法非常巧妙：&lt;strong&gt;一个节点的特征，应该由它邻居节点的特征共同决定&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;翻译成人话就是：要判断一个人喜欢什么，不仅要看他买了什么，还要看他的朋友买了什么、他关注的人买了什么、跟他品味相似的人买了什么。GCN就像一个擅长社交的侦探，通过&amp;quot;朋友的朋友&amp;quot;这条线索，把整个关系网的信息汇聚到一个人身上。&lt;/p&gt;&#xA;&lt;p&gt;现在，从淘宝到抖音，从Netflix到Spotify，主流推荐系统几乎都在用图神经网络来提升推荐质量。当你刷到一条&amp;quot;好像很懂你&amp;quot;的视频时，背后很可能就是GCN在分析你与这条视频之间错综复杂的关系链。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章推荐系统也有偏见&#34;&gt;第四章：推荐系统也有&amp;quot;偏见&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;讲到这里，你可能会觉得推荐系统简直是完美的&amp;quot;读心术&amp;quot;。但任何技术都有它的另一面。&lt;/p&gt;&#xA;&lt;p&gt;推荐系统天然存在一个困境：&lt;strong&gt;它越了解你，就越容易把你困在信息茧房里&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;算法发现你喜欢科幻，就会不断给你推科幻，其他类型的精彩内容就被你完美错过了。你不是不喜欢，而是&lt;strong&gt;根本不知道它们存在&lt;/strong&gt;。这就是所谓的&amp;quot;过滤气泡&amp;quot;——推荐系统在帮你节省时间的同时，也悄悄地剥夺了你的&amp;quot;意外发现&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;2016年，一项关于YouTube推荐系统的研究表明，推荐算法会逐渐引导用户走向更极端、更有争议的内容，因为这类内容更容易引发点击。这不是算法的恶意，而是&lt;strong&gt;优化目标偏差&lt;/strong&gt;——当推荐系统只关注&amp;quot;点击率&amp;quot;这个指标时，它自然会选择那些最能刺激你点击的内容，而不是那些对你真正有价值的内容。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声推荐系统到底在推荐什么&#34;&gt;尾声：推荐系统到底在推荐什么？&lt;/h2&gt;&#xA;&lt;p&gt;回看推荐系统的进化史，我们能看到一条清晰的脉络：从&amp;quot;记住谁买了什么&amp;quot;，到&amp;quot;理解用户喜欢什么&amp;quot;，再到&amp;quot;看懂人、物、兴趣之间的复杂关系网&amp;quot;——推荐系统越来越&amp;quot;聪明&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;但技术越进步，越需要思考一个根本问题：&lt;strong&gt;推荐系统到底在推荐什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它推荐的不只是商品、视频、文章，而是你注意力的流向，是你认知世界的边界。一个优秀的推荐系统，不应该只满足于&amp;quot;猜中你喜欢什么&amp;quot;，还应该敢于&amp;quot;推荐你可能不知道但会喜欢的东西&amp;quot;——在精准和多样性之间找到平衡，才是推荐系统真正的&amp;quot;智能&amp;quot;所在。&lt;/p&gt;&#xA;&lt;p&gt;你的每一次滑动、点击、停留，都在训练着算法。与其把推荐系统看作一个&amp;quot;猜你喜欢&amp;quot;的机器，不如把它看作一面镜子——你是什么样的人，它就推荐什么样的内容。&lt;strong&gt;想拥有更好的推荐，先成为更好的自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Linden, G., Smith, B., &amp;amp; York, J. (2003). Amazon.com Recommendations: Item-to-Item Collaborative Filtering. &lt;em&gt;IEEE Internet Computing&lt;/em&gt;. &lt;a href=&#34;http://www.cs.umd.edu/~samir/498/Amazon-Recommendations.pdf&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Cheng, H. T., et al. (2016). Wide &amp;amp; Deep Learning for Recommender Systems. &lt;em&gt;DLRS 2016&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1606.07792&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Kipf, T. N., &amp;amp; Welling, M. (2017). Semi-Supervised Classification with Graph Convolutional Networks. &lt;em&gt;ICLR 2017&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1609.02907&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Koren, Y., Bell, R., &amp;amp; Volinsky, C. (2009). Matrix Factorization Techniques for Recommender Systems. &lt;em&gt;IEEE Computer&lt;/em&gt;. &lt;a href=&#34;https://ieeexplore.ieee.org/document/5197422&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI画家是怎么「无中生有」的？——从一团噪声到一幅画的奇妙旅程</title>
				<link>https://lingyu7.com/posts/from-noise-to-masterpiece-diffusion-models/</link>
				<pubDate>Sun, 02 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/from-noise-to-masterpiece-diffusion-models/</guid>
				<description>&lt;h2 id=&#34;引言你看到的是生成但ai做的是消除&#34;&gt;引言：你看到的是&amp;quot;生成&amp;quot;，但AI做的是&amp;quot;消除&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2022年，Stable Diffusion开源后，全世界都疯了——你输入一句话，AI就能生成一张画。有人用它做设计，有人用它生成表情包，甚至有人用它&amp;quot;修复&amp;quot;老照片。&lt;/p&gt;&#xA;&lt;p&gt;但你有没有想过：&lt;strong&gt;AI到底是怎么&amp;quot;画&amp;quot;出这些图的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能以为，AI像人类画家一样，先构思，再打草稿，再上色，最后修饰。但事实远比这更反直觉——&lt;strong&gt;AI不是&amp;quot;画&amp;quot;出来的，而是&amp;quot;消去&amp;quot;出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它做的不是&amp;quot;从无到有&amp;quot;，而是&amp;quot;从有到精&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一两种画家的思路&#34;&gt;一、两种&amp;quot;画家&amp;quot;的思路&lt;/h2&gt;&#xA;&lt;p&gt;在AI图像生成领域，主要有两种&amp;quot;画画&amp;quot;的方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种叫GAN（生成对抗网络），2014年由Ian Goodfellow提出。&lt;/strong&gt; 它的思路是让两个网络互相博弈：一个负责&amp;quot;画&amp;quot;（生成器），一个负责&amp;quot;挑刺&amp;quot;（判别器）。生成器努力画出以假乱真的图像，判别器努力分辨真假。两者互相竞争，最终生成器画出的图连判别器都分不清真假了。&lt;/p&gt;&#xA;&lt;p&gt;这个思路很聪明，但它有一个致命问题：&lt;strong&gt;训练极其不稳定。&lt;/strong&gt; 就像两个拳击手对打，一个太强另一个就崩了。生成器和判别者一旦失衡，生成器就会陷入&amp;quot;模式崩溃&amp;quot;——永远只画同一张图。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种叫扩散模型（Diffusion Model），2020年由Ho等人提出。&lt;/strong&gt; 它的思路完全不同——不是&amp;quot;画&amp;quot;，而是&amp;quot;去噪&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你有一张清晰的图片，然后你一点点往上面加噪点，直到它完全变成一团随机噪声。这个过程叫&amp;quot;正向扩散&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;扩散模型做的事，就是&lt;strong&gt;学会逆转这个过程&lt;/strong&gt;——从一团随机噪声开始，一步步去除噪声，直到恢复出清晰的图像。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它不是在&amp;quot;画&amp;quot;，而是在&amp;quot;雕塑&amp;quot;。&lt;/strong&gt; 就像米开朗基罗说的：&amp;ldquo;大卫本来就在大理石里，我只是把不属于它的部分去掉。&amp;ldquo;扩散模型去掉的，就是噪声。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个简单到令人惊讶的原理&#34;&gt;二、一个简单到令人惊讶的原理&lt;/h2&gt;&#xA;&lt;p&gt;让我们用更具体的方式理解扩散模型在做什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：正向过程——&amp;ldquo;毁掉&amp;quot;一张图。&lt;/strong&gt; 训练时，AI拿一张真实的图片（比如一张猫的照片），然后不断地往上加噪声。每一步加一点，直到图像完全变成随机噪声。经过几百步后，你再也看不出原来有只猫了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：反向过程——&amp;ldquo;修复&amp;quot;一张图。&lt;/strong&gt; AI学习的是&amp;quot;逆向操作&amp;rdquo;——它知道当前这张图有多&amp;quot;脏&amp;rdquo;，然后预测&amp;quot;刚才加进去的噪声是什么样子的&amp;rdquo;，接着减去它。每减去一步，图像就清晰一点。反复做几百步，最终从一团纯噪声中&amp;quot;浮现&amp;quot;出一张清晰的猫图。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察：&lt;/strong&gt; 扩散模型不是在&amp;quot;学习怎么画猫&amp;rdquo;，而是在&lt;strong&gt;学习&amp;quot;噪声长什么样&amp;quot;&lt;/strong&gt;。它学会的是&amp;quot;什么样的噪声不是猫身上的噪声&amp;quot;——换言之，它学会了&amp;quot;猫长什么样&amp;quot;的反面。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很绕，但它的数学本质非常优雅：&lt;strong&gt;AI学习的是数据分布（猫的图片）的梯度方向，然后从随机噪声出发，沿着这个梯度方向一步步&amp;quot;走&amp;quot;到猫的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你站在山顶上，闭着眼睛，只靠感受坡度，一步步走下山——最终你一定能走到山脚。扩散模型从随机噪声出发，一步步&amp;quot;下坡&amp;quot;，最终走到清晰的图像。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三为什么你需要潜空间&#34;&gt;三、为什么你需要&amp;quot;潜空间&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;DDPM（2020年）在理论上很漂亮，但它有一个实际痛点：&lt;strong&gt;太慢了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在像素空间做去噪，意味着模型要处理512×512×3=78万个像素值。每一步去噪都需要计算这么多数据，而且DDPM需要1000步才能生成一张可用的图。一张图生成完，够你喝两杯咖啡了。&lt;/p&gt;&#xA;&lt;p&gt;2022年，Stable Diffusion的团队提出了一个天才的解决方案：&lt;strong&gt;别在像素空间做，去&amp;quot;潜空间&amp;quot;做。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;什么是&amp;quot;潜空间&amp;quot;？把它想象成&lt;strong&gt;图像的精简版速记表&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;一张512×512的图有78万个像素，但其中大部分信息是冗余的——比如&amp;quot;蓝天&amp;quot;的蓝色，有几千个像素值几乎一样。这些信息不需要逐个处理，只要知道&amp;quot;这里是蓝色&amp;quot;就够了。&lt;/p&gt;&#xA;&lt;p&gt;Stable Diffusion用了一个预训练的自编码器，把一张图像压缩到64×64×4的&amp;quot;潜表示&amp;quot;——&lt;strong&gt;只有约1.6万个数值，是原来的1/48。&lt;/strong&gt; 而且这个压缩是&amp;quot;有损但聪明&amp;quot;的——它保留了语义信息（&amp;ldquo;有一只猫，在草地上&amp;rdquo;），去掉了感知冗余（&amp;ldquo;猫的每根毛的颜色细微差别&amp;rdquo;）。&lt;/p&gt;&#xA;&lt;p&gt;然后，扩散过程在这个压缩后的潜空间里进行。&lt;strong&gt;计算量直接降到了原来的1/48。&lt;/strong&gt; 这就是为什么Stable Diffusion可以在消费级显卡上运行，而DALL-E 2需要云端服务器。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但代价是什么？&lt;/strong&gt; 潜空间压缩丢失了细节。这就是为什么Stable Diffusion生成的图在细节上有时不如DALL-E 2——它在压缩时&amp;quot;丢掉&amp;quot;的那些信息，再也回不来了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四ai真的理解它画的是什么吗&#34;&gt;四、AI真的&amp;quot;理解&amp;quot;它画的是什么吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，我们不得不面对一个更根本的问题：&lt;strong&gt;AI在&amp;quot;去噪&amp;quot;的过程中，真的&amp;quot;理解&amp;quot;它画的是什么吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你失望：&lt;strong&gt;很可能不。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI在去噪的过程中，没有&amp;quot;猫&amp;quot;的概念，没有&amp;quot;草地&amp;quot;的概念，没有&amp;quot;蓝天&amp;quot;的概念。它只知道&amp;quot;这个像素的噪声模式，在训练数据中，和这种特定形状常常一起出现&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;它学到的，是一个巨大的统计关联网络——&lt;strong&gt;&amp;ldquo;这种形状的噪声模式，通常意味着这里有猫耳朵&amp;rdquo;&lt;/strong&gt;。但它不知道&amp;quot;猫&amp;quot;是什么，不知道猫会喵喵叫，不知道猫有九条命（至少在传说中）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它知道的是&amp;quot;猫的统计模式&amp;quot;，而不是&amp;quot;猫&amp;quot;本身。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这不是AI的缺陷，而是它的本质。AI的&amp;quot;理解&amp;quot;和我们人类的&amp;quot;理解&amp;quot;是两种完全不同的东西。人类的&amp;quot;理解&amp;quot;有身体经验、有情感、有文化背景——你知道猫摸起来是什么感觉，你知道猫会蹭你的腿，你知道猫不是&amp;quot;一堆像素的统计模式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI的&amp;quot;理解&amp;quot;是纯粹的统计模式识别——它知道&amp;quot;猫的像素分布&amp;quot;和&amp;quot;狗的像素分布&amp;quot;的区别，但它不知道&amp;quot;猫是宠物&amp;quot;这件事。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但这不妨碍它生成让你惊叹的图像。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你不需要懂空气动力学也能开飞机，AI不需要&amp;quot;理解&amp;quot;猫也能画猫。它只需要知道猫的&amp;quot;统计分布&amp;quot;就够了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从对抗到去噪&#34;&gt;结语：从&amp;quot;对抗&amp;quot;到&amp;quot;去噪&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回看AI图像生成的发展史，有一条清晰的线索：从GAN的&amp;quot;对抗&amp;quot;范式，到扩散模型的&amp;quot;去噪&amp;quot;范式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;对抗范式&lt;/strong&gt;假设智能需要&amp;quot;竞争&amp;quot;——两个网络互相博弈，从中涌现出创造力。这个思路性感，但不稳定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;去噪范式&lt;/strong&gt;假设智能需要&amp;quot;消除&amp;quot;——从混乱中逐步恢复秩序，从噪声中浮现出结构。这个思路朴实，但稳定。&lt;/p&gt;&#xA;&lt;p&gt;而扩散模型之所以成为主流，恰恰是因为它&lt;strong&gt;承认了AI的局限性&lt;/strong&gt;。它不试图&amp;quot;创造&amp;quot;新东西，而是从一个充满可能性的起点（随机噪声）出发，按照训练数据中学到的统计模式，一步步&amp;quot;走到&amp;quot;一个合理的终点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;创造力不是&amp;quot;凭空产生&amp;quot;，而是&amp;quot;从混乱中浮现秩序&amp;quot;。&lt;/strong&gt; 这不仅是AI的&amp;quot;画画&amp;quot;方式，也可能是人类创造力的本质——我们的大脑，也不过是在无数可能的&amp;quot;噪声&amp;quot;中，找到那个最&amp;quot;合理&amp;quot;的答案。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考资料&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Goodfellow, I. J., et al. (2014). &amp;ldquo;Generative Adversarial Nets.&amp;rdquo; &lt;em&gt;NeurIPS 2014.&lt;/em&gt; &lt;a href=&#34;https://arxiv.org/abs/1406.2661&#34;&gt;https://arxiv.org/abs/1406.2661&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ho, J., Jain, A., &amp;amp; Abbeel, P. (2020). &amp;ldquo;Denoising Diffusion Probabilistic Models.&amp;rdquo; &lt;em&gt;NeurIPS 2020.&lt;/em&gt; &lt;a href=&#34;https://arxiv.org/abs/2006.11239&#34;&gt;https://arxiv.org/abs/2006.11239&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Rombach, R., et al. (2022). &amp;ldquo;High-Resolution Image Synthesis with Latent Diffusion Models.&amp;rdquo; &lt;em&gt;CVPR 2022.&lt;/em&gt; &lt;a href=&#34;https://arxiv.org/abs/2112.10752&#34;&gt;https://arxiv.org/abs/2112.10752&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;本文核心论证素材来源于论文论证卡库生成模型领域：GAN论证卡、DDPM论证卡、Stable Diffusion论证卡，经Ω-CFI审查框架校验。&lt;/li&gt;&#xA;&lt;/ul&gt;</description>
			</item>
			<item>
				<title>你刷抖音时，AI真的懂你吗？——推荐系统背后的统计魔法</title>
				<link>https://lingyu7.com/posts/does-ai-really-understand-you-recommendation-system/</link>
				<pubDate>Sat, 01 Aug 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-really-understand-you-recommendation-system/</guid>
				<description>&lt;h2 id=&#34;引言一个经典的细思极恐时刻&#34;&gt;引言：一个经典的&amp;quot;细思极恐&amp;quot;时刻&lt;/h2&gt;&#xA;&lt;p&gt;你刚和朋友聊完某样东西，打开手机App，发现推荐页上赫然出现了它。&lt;/p&gt;&#xA;&lt;p&gt;这一刻，你可能会觉得毛骨悚然——&amp;ldquo;手机在监听我&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;但真相比这更微妙，也更值得玩味。&lt;strong&gt;推荐系统大概率没有在监听你的对话&lt;/strong&gt;——它只是通过你的行为数据，推测出了你此刻可能感兴趣的东西。而它之所以能&amp;quot;猜中&amp;quot;，靠的不是读心术，而是一个简单到令人惊讶的统计技巧。&lt;/p&gt;&#xA;&lt;p&gt;更扎心的是：这个技巧和&amp;quot;理解你&amp;quot;几乎没有关系。它只是发现了你和其他人之间的&amp;quot;模式相似性&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一推荐系统的原始版本买了这个的人也买了那个&#34;&gt;一、推荐系统的&amp;quot;原始版本&amp;quot;：买了这个的人也买了那个&lt;/h2&gt;&#xA;&lt;p&gt;故事要从电商说起。&lt;/p&gt;&#xA;&lt;p&gt;2003年，亚马逊的工程师们面临一个现实问题：Amazon上有几千万用户和几亿件商品，如何给每个用户推荐他们可能感兴趣的东西？&lt;/p&gt;&#xA;&lt;p&gt;当时的推荐算法有两种主流思路：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：找&amp;quot;和你相似的人&amp;quot;（User-based协同过滤）。&lt;/strong&gt; 如果你和另外100个人的购物历史高度重合，那这100个人买了但你还没买的东西，很可能也是你想要的。这个思路听起来很合理，但有一个致命问题——计算&amp;quot;用户之间的相似度&amp;quot;需要遍历所有用户，当用户量达到几千万时，这个计算量会爆炸。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：找&amp;quot;和这个商品相似的商品&amp;quot;（Item-based协同过滤）。&lt;/strong&gt; 亚马逊提出的方案是：&lt;strong&gt;不比较用户，只比较商品。&lt;/strong&gt; 如果买了A的用户中，有很大比例也买了B，那就说A和B&amp;quot;相似&amp;quot;——下次有人买A时，就推荐B。&lt;/p&gt;&#xA;&lt;p&gt;这个思路的精妙之处在于：&lt;strong&gt;商品的数量远少于用户的数量&lt;/strong&gt;（至少在当时如此），所以计算&amp;quot;商品之间的相似度&amp;quot;比计算&amp;quot;用户之间的相似度&amp;quot;快得多。而且商品之间的关系相对稳定——今天&amp;quot;手机和手机壳&amp;quot;是搭配的，明天大概率还是。&lt;/p&gt;&#xA;&lt;p&gt;亚马逊把这个方法落地后，效果出奇的好。直到今天，你打开淘宝看到的&amp;quot;买了这个的人也买了那个&amp;quot;，本质上还是这个思路的变种。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：&lt;strong&gt;这个方法真的&amp;quot;理解&amp;quot;你了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你买了一部手机，但没买手机壳，因为你觉得太贵了。推荐系统告诉你&amp;quot;买了手机的人也买了手机壳&amp;quot;——它给出了一个看似&amp;quot;合理&amp;quot;的推荐，但对你来说，这个推荐恰恰是你不想要的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;推荐系统不知道你为什么不买手机壳。它只知道&amp;quot;很多人同时买了这两样东西&amp;quot;。&lt;/strong&gt; 它捕获的是统计共现，不是因果理解。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二从猜你喜欢到让你上瘾推荐系统如何进化&#34;&gt;二、从&amp;quot;猜你喜欢&amp;quot;到&amp;quot;让你上瘾&amp;quot;：推荐系统如何进化&lt;/h2&gt;&#xA;&lt;p&gt;2003年的协同过滤虽然好用，但有一个明显的缺陷：&lt;strong&gt;它只能推荐&amp;quot;看起来像你已经买过的&amp;quot;东西。&lt;/strong&gt; 它无法发现你&amp;quot;潜在的可能喜欢但从未接触过&amp;quot;的东西。&lt;/p&gt;&#xA;&lt;p&gt;这就好比一个图书管理员，只推荐你&amp;quot;借过这本书的人也借了那本书&amp;quot;——但如果你从未借过科幻小说，他永远不会推荐你任何科幻作品，即使你可能会喜欢。&lt;/p&gt;&#xA;&lt;p&gt;2016年，Google的工程师们提出了一个更聪明的方案：&lt;strong&gt;Wide &amp;amp; Deep（宽深模型）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个名字听起来很技术，但它的核心思想其实很简单：&lt;strong&gt;&amp;ldquo;记忆&amp;quot;和&amp;quot;泛化&amp;quot;要配合使用。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;&amp;ldquo;记忆&amp;quot;部分&lt;/strong&gt;：记住那些已经被验证过的组合——比如&amp;quot;喜欢iPhone的人通常也喜欢AirPods&amp;rdquo;。这部分和2003年的协同过滤类似，但做得更精细。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;&amp;ldquo;泛化&amp;quot;部分&lt;/strong&gt;：学习用户行为的&amp;quot;深层模式&amp;rdquo;——比如&amp;quot;喜欢简约设计手机的人，可能也喜欢简约设计的耳机、手表、甚至家具&amp;rdquo;。这部分通过深度学习实现，可以从用户的行为数据中&amp;quot;归纳&amp;quot;出用户看不见的偏好。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这个模型在Google Play商店上线后，App购买率提升了3.9%。这个数字听起来不大，但放在Google Play的体量上，意味着&lt;strong&gt;每天多出数百万次应用下载&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;从此，推荐系统从&amp;quot;猜你喜欢&amp;quot;进化到了&amp;quot;创造你喜欢&amp;quot;——它不再只是推荐你已知的东西，而是开始&lt;strong&gt;引导你的偏好&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三但ai真的懂你吗&#34;&gt;三、但AI真的&amp;quot;懂&amp;quot;你吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，我们似乎已经有一个很强大的推荐系统了——它既记得住你的历史偏好，又能发现你潜在的兴趣。听起来像是&amp;quot;很懂你&amp;quot;，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但让我们停下来想想：&lt;strong&gt;推荐系统学到的&amp;quot;你&amp;quot;，和真实的&amp;quot;你&amp;quot;，有多大的差距？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;差距一：你的行为不是你。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你点开了一个视频，可能不是因为喜欢，而是因为封面太夸张。你买了某件商品，可能不是因为需要，而是因为打折。你收藏了一篇文章，可能不是因为想读，而只是因为&amp;quot;先马后看&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但推荐系统不知道这些区别。&lt;/strong&gt; 它只知道&amp;quot;你点了&amp;quot;、&amp;ldquo;你买了&amp;rdquo;、&amp;ldquo;你收藏了&amp;rdquo;——它把你的行为当成了你的偏好。推荐系统建立一个&amp;quot;你&amp;quot;的模型，但这个模型只是你行为的统计学投影，不是你真实的内心。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;差距二：相关性不等于因果性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;推荐系统的核心假设是&amp;quot;过去的行为能预测未来的偏好&amp;quot;——但这个假设有一个巨大的漏洞：&lt;strong&gt;相关性不等于因果性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你喜欢看推理小说，可能不是因为&amp;quot;推理&amp;quot;这个标签，而是因为&amp;quot;喜欢解谜的感觉&amp;quot;。但推荐系统只知道&amp;quot;你买了推理小说&amp;quot;这个行为，于是它给你推荐更多推理小说，而忽略了也许你也会喜欢数学谜题、密室逃脱、甚至悬疑类游戏。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;推荐系统在&amp;quot;行为的表面&amp;quot;上构建偏好模型，却没有触及&amp;quot;行为背后的动机&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;差距三：你看到的，只是&amp;quot;你&amp;quot;的某一个侧面。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;推荐系统会根据你的最近行为，动态调整推荐策略。你今天搜了&amp;quot;考研&amp;quot;，明天整个App就变成了考研资料库；你今天看了几条搞笑视频，后天首页全是搞笑内容。&lt;/p&gt;&#xA;&lt;p&gt;这不是&amp;quot;AI懂你&amp;quot;，而是&lt;strong&gt;AI把你的某一个行为放大成了你的全部画像&lt;/strong&gt;。它不像一个了解你的朋友，而像一个只看了你最近几条朋友圈就来下结论的陌生人。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四推荐系统真正在做的事&#34;&gt;四、推荐系统真正在做的事&lt;/h2&gt;&#xA;&lt;p&gt;所以，推荐系统到底在做什么？&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;它不是在做&amp;quot;心理学&amp;quot;，而是在做&amp;quot;统计学&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它不关心你&amp;quot;为什么&amp;quot;喜欢某样东西，它只关心&amp;quot;和其他人相比，你表现出了哪些相似的行为模式&amp;quot;。它的核心逻辑是：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;如果你和A组用户有80%的行为重合，那么A组用户剩下的20%行为，大概率也是你想要的。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这是一个纯粹的&amp;quot;模式匹配&amp;quot;过程。它不需要理解你的情感、动机、价值观——它只需要发现行为模式之间的相似性。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这听起来很&amp;quot;机械&amp;quot;，但效果出奇的好。&lt;/strong&gt; 为什么呢？&lt;/p&gt;&#xA;&lt;p&gt;因为人类的行为模式，在统计学层面上，远比我们想象的要稳定和可预测。我们以为自己很独特，但在推荐系统的眼里，你只是&amp;quot;模式123456&amp;quot;的一个实例——你的偏好，已经被无数个和你相似的人&amp;quot;预演&amp;quot;过了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五问题不在推荐系统而在于什么被推荐&#34;&gt;五、问题不在推荐系统，而在于&amp;quot;什么被推荐&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;推荐系统本身没有好坏——它只是一个工具。问题在于它被用来做什么。&lt;/p&gt;&#xA;&lt;p&gt;当推荐系统用来帮你&lt;strong&gt;发现&lt;/strong&gt;新的兴趣时，它是有益的。当它被用来&lt;strong&gt;固化&lt;/strong&gt;你的兴趣时，就变成了&amp;quot;信息茧房&amp;quot;的制造者。&lt;/p&gt;&#xA;&lt;p&gt;你刷抖音时，每点一个&amp;quot;喜欢&amp;quot;，系统就记录下这个信号，然后给你推荐更多类似的内容。久而久之，你看到的永远是你&amp;quot;已经喜欢&amp;quot;的东西，而&amp;quot;可能喜欢但还没见过&amp;quot;的东西，永远没有机会出现。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;推荐系统的&amp;quot;泛化&amp;quot;能力，被商业目标收窄了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;Google的Wide &amp;amp; Deep模型在论文中说&amp;quot;记忆&amp;quot;和&amp;quot;泛化&amp;quot;互补——但在实际应用中，商业平台更倾向于&amp;quot;记忆&amp;quot;（因为已经验证过的推荐能带来更高的点击率），而&amp;quot;泛化&amp;quot;（推荐用户可能不熟悉的内容）往往被压缩到最低限度，因为&amp;quot;冒险&amp;quot;意味着可能流失用户。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语推荐系统的镜像与盲区&#34;&gt;结语：推荐系统的&amp;quot;镜像&amp;quot;与&amp;quot;盲区&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;下次你打开淘宝或抖音，看到&amp;quot;猜你喜欢&amp;quot;的推荐时，可以想一想：你看到的不是&amp;quot;AI眼中的你&amp;quot;，而是&lt;strong&gt;AI根据你的行为数据，重建出的一个统计学模型&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个模型很精准，但它有一个盲区——它永远无法理解&amp;quot;你为什么喜欢&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;它知道你喜欢看推理小说，但不知道你是因为喜欢解谜、还是因为喜欢悬疑氛围、还是因为这本小说是朋友推荐的。它只告诉你&amp;quot;你喜欢的&amp;quot;，但不告诉你&amp;quot;你为什么喜欢&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;而这，恰恰是推荐系统下一步进化的方向——从&amp;quot;猜你喜欢什么&amp;quot;到&amp;quot;理解你为什么喜欢&amp;quot;。当AI开始追问&amp;quot;为什么&amp;quot;的时候，推荐系统才真正从&amp;quot;统计魔法&amp;quot;走向&amp;quot;认知理解&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「感官」是如何连接的？——当AI同时学会看和读</title>
				<link>https://lingyu7.com/posts/ai-senses-connection-multimodal/</link>
				<pubDate>Fri, 31 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-senses-connection-multimodal/</guid>
				<description>&lt;h2 id=&#34;引言一场隐喻的看图说话&#34;&gt;引言：一场隐喻的「看图说话」&lt;/h2&gt;&#xA;&lt;p&gt;想象你在一场聚会上，有人递给你一张照片，上面画着一只橙色的猫蹲在红色的沙发上，旁边配了一行字：「一只猫在沙发上」。&lt;/p&gt;&#xA;&lt;p&gt;你看了，点了点头，觉得这没什么特别的——照片和文字对得上，很自然。&lt;/p&gt;&#xA;&lt;p&gt;但让我们停下来想一想：&lt;strong&gt;「一只猫在沙发上」这七个字，和照片中那些像素点之间，有什么本质联系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;没有。一个是由字母组成的符号序列，一个是由颜色和形状组成的光学信号。它们之间没有任何物理上的相似性。你之所以觉得「配得上」，是因为你的大脑在过去的几十年里，无数次将「看到的猫」和「听到/读到的猫」关联在一起，形成了某种跨感官的连接。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI要同时理解图像和文字，面对的就是这个根本问题：如何让两种完全不同形态的信息，在数学空间中「对上号」？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是多模态学习的核心挑战——也是近五年来AI领域最激动人心的故事之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一教ai看图说话有多难&#34;&gt;一、教AI「看图说话」，有多难？&lt;/h2&gt;&#xA;&lt;p&gt;在2021年之前，AI的视觉能力和语言能力基本上是「各玩各的」。&lt;/p&gt;&#xA;&lt;p&gt;一个图像识别模型，能从照片中识别出「猫」「沙发」「橙色」——但它只能输出这些标签，无法理解「猫蹲在沙发上」这个完整的场景描述。一个语言模型，能写出流畅的句子——但它对「猫」的理解全部来自文本，从未真正「见过」一只猫的视觉形象。&lt;/p&gt;&#xA;&lt;p&gt;两个系统各自在自己的领域里做得不错，但它们之间有一堵墙。&lt;strong&gt;这堵墙，就是「感官」之间的鸿沟。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，要打通这堵墙，需要人工标注数据集——让人类花大量时间，给每张图片写上描述文字。ImageNet数据集花了25,000人、标注了1,400万张图片，才勉强覆盖了1,000个类别。代价高昂，而且限制了AI只能在「人类已经标注过的概念」上工作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果AI只能识别人类告诉它的概念，那它永远无法超越人类的认知边界。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI的研究团队提出了一个大胆的想法：为什么不直接让AI从互联网上学习图文对应关系？互联网上有海量的图片和文字描述——虽然「质量」参差不齐，但「数量」是前所未有的。他们做了一个叫CLIP的模型，用4亿张图文对训练，结果震惊了AI界。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二clip的魔法一个巨型配对游戏&#34;&gt;二、CLIP的魔法：一个「巨型配对游戏」&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的工作原理，听起来像是一个简单的配对游戏。&lt;/p&gt;&#xA;&lt;p&gt;想象你有一大堆图片和一大堆文字描述，你的任务是把它们正确配对。你面前有N张图片和N条文字描述，你需要找出哪些图片和哪些文字是一对。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：&lt;strong&gt;训练两个「编码器」，一个看图片，一个读文字，然后把它们各自「编码」成一个数学向量（一串数字）。&lt;/strong&gt; 如果图片和文字是匹配的，让它们的向量在数学空间中「靠近」；如果不匹配，让它们「远离」。&lt;/p&gt;&#xA;&lt;p&gt;这个思路听起来很简单，但它的威力在于&lt;strong&gt;规模&lt;/strong&gt;和&lt;strong&gt;对比学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;规模&lt;/strong&gt;：4亿张图文对，覆盖了你能想象到的几乎所有视觉概念——猫、狗、汽车、建筑、食物、风景、艺术作品……互联网的多样性，在这里变成了AI的训练素材。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习&lt;/strong&gt;：每张图片不仅要和正确的文字描述配对，还要和N-1个错误的文字描述「对比」。这种「正负样本」的对比训练，迫使模型学会区分「细微的语义差异」——比如「一只猫在沙发上」和「一只狗在沙发上」的区别。&lt;/p&gt;&#xA;&lt;p&gt;训练完成后，CLIP拥有了一个神奇的能力：&lt;strong&gt;你给它一张从没见过的图片，它可以自己「猜」出这张图片的内容。&lt;/strong&gt; 比如你给它一张雪地里的哈士奇照片，它不需要看过任何标注数据，就能从文字描述列表中选出最匹配的——「雪地里的哈士奇」。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet上，CLIP的零样本准确率达到了76.2%，和传统需要人工标注数据的模型相当。这意味着什么？&lt;strong&gt;CLIP从来没有「见过」ImageNet的标注数据，却能和新数据「对上号」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三但ai真的理解了吗&#34;&gt;三、但AI真的「理解」了吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，故事似乎很完美——AI学会了同时看和读，打通了视觉和语言的壁垒。&lt;/p&gt;&#xA;&lt;p&gt;但如果你仔细看CLIP的表现，会发现一些有趣的现象。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象一：CLIP对「提示词」非常敏感。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;同样一张猫的图片，你问「这是一只猫吗？」和「这是一只家猫吗？」和「这看起来像什么动物？」，它可能给出完全不同的答案。换一个表达方式，准确率可能差10个百分点。&lt;/p&gt;&#xA;&lt;p&gt;为什么会这样？因为CLIP不是在「理解」你的问题，而是在&lt;strong&gt;匹配「你的问题文字」和「图片」在训练数据中的共现模式&lt;/strong&gt;。训练数据中「猫」和「猫的图片」经常一起出现，所以匹配度高；但「家猫」出现频率低，匹配度就低。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象二：CLIP在「没见过的场景」上表现很差。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;给CLIP一张医学X光片，问它「这是肺部感染吗？」——它可能答得一团糟。不是因为它不聪明，而是因为&lt;strong&gt;医学图像在4亿张训练数据中几乎不存在&lt;/strong&gt;。CLIP的能力边界，就是训练数据的分布边界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象三：CLIP会「作弊」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;有时候，CLIP不是通过「理解图片内容」来回答问题，而是通过&lt;strong&gt;发现文字和图片之间的统计相关性&lt;/strong&gt;。比如，一张海滩的照片，它可能不会认出「沙滩」「海浪」「太阳」这些元素，而是通过「图片整体色调偏蓝+文字中有&amp;rsquo;海滩&amp;rsquo;」这种统计捷径来「猜」答案。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个深刻的问题：&lt;strong&gt;CLIP真的「理解」了图像和文字之间的联系吗？还是只是发现了一个巨大的统计巧合？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四统计共现--语义理解&#34;&gt;四、统计共现 ≠ 语义理解&lt;/h2&gt;&#xA;&lt;p&gt;让我们用一个简单的思想实验来理解这个问题。&lt;/p&gt;&#xA;&lt;p&gt;假设你是一个从小生活在山洞里的外星人，从未见过外面的世界。有一天，你被带到地面，看到了一幅画面：太阳升起，鸟儿鸣叫。&lt;/p&gt;&#xA;&lt;p&gt;这时，有人告诉你两个词：「太阳」和「鸟」。&lt;/p&gt;&#xA;&lt;p&gt;你很快就学会了：「太阳」这个词总是和「发光的圆形物体」一起出现；「鸟」这个词总是和「有翅膀的飞行动物」一起出现。你能够完美地完成配对任务——看到「太阳」的图片，你选出「太阳」这个词；看到「鸟」的图片，你选出「鸟」这个词。&lt;/p&gt;&#xA;&lt;p&gt;但你真的「理解」太阳和鸟的区别吗？你知道太阳是恒星、鸟是动物吗？你知道太阳带来光和热、鸟会筑巢觅食吗？你不知道。&lt;strong&gt;你只是发现了统计上的共现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;CLIP就是这样。它不是「理解」了图片和文字之间的关系，而是&lt;strong&gt;学会了统计共现模式&lt;/strong&gt;——在4亿张图文对中，某些文字和某些图片特征「经常一起出现」，所以它记住了这些模式。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是在「钻牛角尖」——但结果确实好用，不是吗？&lt;/p&gt;&#xA;&lt;p&gt;是的，而且这正是CLIP的伟大之处。&lt;strong&gt;它证明了：当数据量足够大时，统计共现可以逼近甚至超越人类标注的效果。&lt;/strong&gt; 这不是AI的缺陷，而是AI的「另一种智能」——它不追求「理解」，只追求「预测」。&lt;/p&gt;&#xA;&lt;p&gt;但这也告诉我们：&lt;strong&gt;AI的「感官连接」和人类的感官连接，本质上是不同的。&lt;/strong&gt; 人类的连接是「体验式」的——你看到一只猫，同时听到「猫」这个声音，你是在一个完整的感知-行动循环中建立连接。AI的连接是「统计式」的——它只是从海量数据中提取了「像素排列」和「文字序列」之间的相关性。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五clip之后多模态ai的下一站&#34;&gt;五、CLIP之后：多模态AI的下一站&lt;/h2&gt;&#xA;&lt;p&gt;CLIP在2021年横空出世后，彻底改变了多模态AI的格局。它不再是「视觉模型」或「语言模型」，而是「视觉-语言模型」——两者的边界开始模糊。&lt;/p&gt;&#xA;&lt;p&gt;后续的工作迅速跟进：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BLIP&lt;/strong&gt; 和 &lt;strong&gt;BLIP-2&lt;/strong&gt; 试图解决CLIP的「数据质量问题」——通过自动生成高质量的图文描述，减少互联网噪声的影响。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;LLaVA&lt;/strong&gt; 将CLIP的视觉编码器和大语言模型直接连接，让AI不仅能看到图片，还能「谈论」它看到的内容。你问它「这张图片里有什么？」它可以用完整的句子回答你。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;DALL·E&lt;/strong&gt; 和 &lt;strong&gt;Stable Diffusion&lt;/strong&gt; 更是逆向操作——不是从图片到文字，而是从文字到图片。你说「一只橙色猫在红色沙发上」，它就能生成一张图片。&lt;/p&gt;&#xA;&lt;p&gt;这些模型有一个共同点：&lt;strong&gt;它们都是CLIP的继承者。&lt;/strong&gt; CLIP的视觉编码器成为了「视觉的通用语言」，后续模型只需要学会「翻译」这种语言，就能完成各种视觉-语言任务。&lt;/p&gt;&#xA;&lt;p&gt;但问题依旧存在：&lt;strong&gt;统计共现和语义理解之间的鸿沟，仍然没有被真正跨越。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个真正的「感官连接」——像人类那样，看到一只猫，同时「理解」猫是什么、猫的行为、猫与人的关系——需要的不是更多的数据，而是&lt;strong&gt;更深刻的认知架构&lt;/strong&gt;。它需要感知-行动循环，需要世界模型，需要因果推理。&lt;/p&gt;&#xA;&lt;p&gt;CLIP告诉我们：&lt;strong&gt;统计共现可以走很远，但「理解」是另一回事。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语一个开始不是终点&#34;&gt;结语：一个开始，不是终点&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那张照片——「一只猫在沙发上」。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「视觉错觉」——为什么一张贴纸就能骗过世界上最聪明的AI</title>
				<link>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</link>
				<pubDate>Sun, 26 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</guid>
				<description>&lt;h2 id=&#34;引言一张贴纸让最聪明的ai变成了盲人&#34;&gt;引言：一张贴纸，让最聪明的AI变成了&amp;quot;盲人&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2017年，一群研究人员做了一个实验。&lt;/p&gt;&#xA;&lt;p&gt;他们在路边放了一个&amp;quot;停止&amp;quot;标志牌——红底白字，八边形，全世界的司机都认识。然后，他们在上面贴了几张小小的黑白贴纸，贴的位置看起来毫无规律。&lt;/p&gt;&#xA;&lt;p&gt;接着，他们让一辆搭载了最先进AI识别系统的测试车驶过这个标志牌。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;结果令人震惊：AI把&amp;quot;停止牌&amp;quot;认成了&amp;quot;限速牌&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;贴纸的位置和图案是精心设计的——对人类来说，它们只是毫无意义的涂鸦，不影响我们认出&amp;quot;停止牌&amp;quot;。但AI的&amp;quot;眼睛&amp;quot;被这些贴纸彻底欺骗了。它看到了一个和&amp;quot;停止牌&amp;quot;完全不同的东西。&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻电影的情节。这是真实发生的实验。这种能让AI&amp;quot;看错&amp;quot;的特殊图案，有一个名字：&lt;strong&gt;对抗样本（Adversarial Examples）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它们被称为&amp;quot;AI的视觉错觉&amp;quot;——就像人类会被&amp;quot;视觉错觉图&amp;quot;骗到一样，AI也有自己的&amp;quot;视觉错觉&amp;quot;。但和人类视觉错觉不同的是，&lt;strong&gt;AI的&amp;quot;错觉&amp;quot;可以被精确地设计和制造，而且几乎无法通过&amp;quot;多看两眼&amp;quot;来纠正。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一对抗样本是什么一个差之毫厘谬以千里的故事&#34;&gt;一、对抗样本是什么？——一个&amp;quot;差之毫厘，谬以千里&amp;quot;的故事&lt;/h2&gt;&#xA;&lt;p&gt;先来看一个更经典的例子。&lt;/p&gt;&#xA;&lt;p&gt;2015年，Goodfellow和他的团队做了一个实验：&lt;/p&gt;&#xA;&lt;p&gt;他们给AI看一张熊猫的照片。AI以99.9%的置信度判断：&amp;ldquo;这是一只熊猫&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，他们在原始图片上叠加了一层肉眼几乎看不见的&amp;quot;噪声&amp;quot;——就像电视信号不好时画面上的雪花点。&lt;strong&gt;这层噪声极淡，淡到人眼根本无法察觉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但AI再看这张图时，它说：&amp;ldquo;这是一只长臂猿&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;原始图片 vs 加了噪声的图片——人眼看几乎一模一样，AI眼里却天差地别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是对抗样本的&amp;quot;核心魔法&amp;quot;：&lt;strong&gt;在人类无法察觉的微小变化上，AI的判断可以发生180度大转弯。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;对抗样本的正式定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;对原始输入（一张图片、一段音频、一段文字）施加一个&lt;strong&gt;人类无法察觉的微小扰动&lt;/strong&gt;，使得AI模型的输出&lt;strong&gt;发生显著错误&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这个扰动不是随机的，而是&lt;strong&gt;精心设计的&lt;/strong&gt;——它针对的是AI模型的&amp;quot;弱点&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么ai会被骗因为ai的看和你的看不一样&#34;&gt;二、为什么AI会被骗？——因为AI的&amp;quot;看&amp;quot;和你的&amp;quot;看&amp;quot;不一样&lt;/h2&gt;&#xA;&lt;p&gt;要理解这件事，你需要先理解一个关键的区别：&lt;strong&gt;AI的&amp;quot;眼睛&amp;quot;和你的眼睛，工作原理完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类怎么看&#34;&gt;人类怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;你看到&amp;quot;停止牌&amp;quot;的时候，大脑做的是&lt;strong&gt;语义理解&lt;/strong&gt;——你看到的是&amp;quot;一个红色的八边形，上面写着&amp;rsquo;停&amp;rsquo;这个字&amp;quot;。你提取了它的&lt;strong&gt;意义&lt;/strong&gt;，而不是它的&lt;strong&gt;像素值&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;即使停止牌上沾了点泥巴、被风吹歪了30度、或者上面贴了几张贴纸——你依然能认出它。因为你的大脑在做&amp;quot;概念匹配&amp;quot;：不管细节怎么变，只要核心特征（红色、八边形、中间有字）在，就是&amp;quot;停止牌&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai怎么看&#34;&gt;AI怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;AI看到一张图片时，它看到的不是&amp;quot;概念&amp;quot;，而是&lt;strong&gt;数字&lt;/strong&gt;。一张图片在AI眼里，就是一个巨大的数字矩阵——每个像素点有三个数字（红、绿、蓝的亮度值），范围从0到255。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;停止牌&amp;quot;对于AI来说，就是&amp;quot;R=200, G=25, B=25&amp;rdquo;（红色区域）和&amp;quot;R=255, G=255, B=255&amp;quot;（白色文字区域）的特定排列组合。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;识别&amp;quot;过程，本质上是在做&amp;quot;数字模式匹配&amp;quot;——它从海量的训练数据中学习到：&amp;ldquo;当这些数字以某种方式排列时，它应该输出&amp;rsquo;停止牌&amp;rsquo;&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;关键差异ai对微小变化的极度敏感&#34;&gt;关键差异：AI对&amp;quot;微小变化&amp;quot;的极度敏感&lt;/h3&gt;&#xA;&lt;p&gt;人类大脑处理的是&amp;quot;语义层级&amp;rdquo;——你看到的是&amp;quot;概念&amp;quot;和&amp;quot;意义&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI处理的是&amp;quot;数字层级&amp;quot;——它看到的是&amp;quot;数值&amp;quot;和&amp;quot;模式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;对人类来说微不足道的数值变化，对AI来说可能是天翻地覆的模式变化。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的数字矩阵中做微调：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;把&amp;quot;停止牌&amp;quot;图片中某个像素的红色值从200调到210&lt;/li&gt;&#xA;&lt;li&gt;把另一个像素的蓝色值从50调到55&lt;/li&gt;&#xA;&lt;li&gt;重复1000次这样的微调&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;对人类来说，这些变化无法察觉。&lt;/strong&gt; 因为&amp;quot;红色&amp;quot;仍然是&amp;quot;红色&amp;quot;，&amp;ldquo;八边形&amp;quot;仍然是&amp;quot;八边形&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但对AI来说，这些变化的累积效果，可能让它看到的&amp;quot;数字模式&amp;quot;完全变成了另一个东西。&lt;/strong&gt; 就像你在一个密码锁上，把每个数字都拨动了一点点——组合起来，密码就完全变了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三对抗样本是怎么造出来的问aiai就会告诉你&#34;&gt;三、对抗样本是怎么造出来的？——&amp;ldquo;问AI，AI就会告诉你&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2015年，Goodfellow提出了一个极简的对抗样本生成方法，叫&lt;strong&gt;FGSM（快速梯度符号法）&lt;/strong&gt;。它的原理简单到令人惊讶：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：把图片输入AI，让AI执行正常的识别流程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;前向传播&amp;quot;——图片通过神经网络的每一层，最终得到一个输出：&amp;ldquo;这只熊猫的概率是99.9%&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：问AI一个问题——&amp;ldquo;如果要让输出变成&amp;rsquo;长臂猿&amp;rsquo;，图片应该怎么改？&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;反向传播&amp;rdquo;——计算梯度。梯度告诉我们：如果改变这个像素的值，AI的输出会往哪个方向变化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：在所有像素上，沿着&amp;quot;让输出变成&amp;rsquo;长臂猿&amp;rsquo;&amp;ldquo;的方向，都走一小步。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一步产生的&amp;quot;噪声&amp;rdquo;，就是对抗样本的核心。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：这个过程只需要一次&amp;quot;前向传播&amp;quot;和一次&amp;quot;反向传播&amp;quot;。&lt;/strong&gt; 也就是说，你只需要问AI一次&amp;quot;怎么改你才会犯错&amp;quot;，AI就会告诉你答案。&lt;/p&gt;&#xA;&lt;p&gt;这就像你问一个密码锁：&amp;ldquo;我的密码是0000，但我想打开它。告诉我，每个数字应该怎么调？&amp;ldquo;密码锁回答说：&amp;ldquo;第一位+3，第二位-1，第三位+2，第四位-5。&amp;quot;——然后你就知道了正确的密码。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI对对抗样本的&amp;quot;脆弱性&amp;rdquo;，不是它的漏洞，而是它的特性。&lt;/strong&gt; 因为AI的决策过程是&amp;quot;可微分的&amp;rdquo;——你可以通过数学求导，找出&amp;quot;让AI犯错的最短路径&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四对抗样本告诉我们什么ai的理解是脆弱的&#34;&gt;四、对抗样本告诉我们什么？——AI的&amp;quot;理解&amp;quot;是脆弱的&lt;/h2&gt;&#xA;&lt;p&gt;对抗样本的存在，揭示了AI&amp;quot;理解&amp;quot;世界的三个深层真相。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相一ai看到的不是语义是表面特征&#34;&gt;真相一：AI看到的不是&amp;quot;语义&amp;quot;，是&amp;quot;表面特征&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;AI在训练时，学到的不是&amp;quot;猫的概念&amp;quot;——它学到的是一组&amp;quot;猫图片的统计特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着，如果你在猫的图片上叠加一层精心设计的噪声，让AI的&amp;quot;猫特征统计&amp;quot;变成&amp;quot;狗特征统计&amp;quot;，AI就会把猫认成狗。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是统计性的，不是语义性的。&lt;/strong&gt; 它知道&amp;quot;猫&amp;quot;和&amp;quot;毛茸茸&amp;quot;、&amp;ldquo;有耳朵&amp;quot;经常一起出现，但它不知道&amp;quot;猫&amp;quot;是一个有生命的、会呼吸的、和人类有情感联系的动物。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相二ai的决策边界和人类的概念边界不重合&#34;&gt;真相二：AI的&amp;quot;决策边界&amp;quot;和人类的&amp;quot;概念边界&amp;quot;不重合&lt;/h3&gt;&#xA;&lt;p&gt;人类的概念有&amp;quot;鲁棒性&amp;rdquo;——&amp;ldquo;猫&amp;quot;的概念边界很宽，不管猫是黑是白、是胖是瘦、是坐是躺，你都能认出来。&lt;/p&gt;&#xA;&lt;p&gt;AI的决策边界是&amp;quot;精确但不鲁棒&amp;quot;的——它在训练数据覆盖的区域内表现很好，但在训练数据覆盖的边缘地带，可能突然崩溃。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「遗忘」艺术——为什么学会丢掉信息，才是真正的智能</title>
				<link>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</link>
				<pubDate>Sat, 25 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</guid>
				<description>&lt;h2 id=&#34;引言你的大脑是一个遗忘大师&#34;&gt;引言：你的大脑，是一个&amp;quot;遗忘大师&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;我们来做一个小实验。&lt;/p&gt;&#xA;&lt;p&gt;回想一下，上周三的午饭你吃了什么？如果你能立刻回答出来，那你属于少数人。大多数人需要想一会儿，甚至根本想不起来。&lt;/p&gt;&#xA;&lt;p&gt;但这不是问题——&lt;strong&gt;这是优点。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你每天摄入海量的信息：看到的、听到的、闻到的、触摸到的、思考到的。如果全部记住，你的大脑会迅速被撑爆。所以你的大脑做了一个极其聪明的选择：&lt;strong&gt;只保留&amp;quot;可能有用&amp;quot;的信息，扔掉其余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以准确说出自己家的地址，但记不住昨天路过的那家便利店门口垃圾桶的颜色。&lt;/p&gt;&#xA;&lt;p&gt;你可以认出朋友的脸，但记不住他上周三穿的是什么颜色的袜子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你之所以智能，不是因为你会记住，而是因为你学会了遗忘。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的道理，其实是AI领域最深刻的理论之一。它有一个名字，叫&lt;strong&gt;信息瓶颈（Information Bottleneck）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一信息瓶颈是什么一个抄笔记的隐喻&#34;&gt;一、信息瓶颈是什么？——一个&amp;quot;抄笔记&amp;quot;的隐喻&lt;/h2&gt;&#xA;&lt;p&gt;想象你在上数学课。&lt;/p&gt;&#xA;&lt;p&gt;老师讲了一道很复杂的微积分题，你需要在有限的时间内记笔记。&lt;/p&gt;&#xA;&lt;p&gt;你有两种记法：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：逐字逐句地记。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;老师说的每一个字你都记下来——&amp;ldquo;好，我们来看这道题，第一步，先求导……&amp;ldquo;你连老师的语气词都没放过。下课后，你的笔记本比老师的教案还厚。&lt;/p&gt;&#xA;&lt;p&gt;但问题是，你记了这么多，&lt;strong&gt;真正有用的信息被淹没在大量废话里了。&lt;/strong&gt; 考试的时候，你根本找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：只记关键步骤。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你快速判断：这道题的核心是&amp;quot;链式法则&amp;rdquo;。你只记下关键公式和两个关键步骤，其他的都忽略。笔记只有三行，但每一行都是精华。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论要回答的，就是这个问题：如何找到&amp;quot;最优的笔记&amp;rdquo;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它正式的定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;给定输入X（老师讲的全部内容）和输出Y（考试要考的知识点），找到一个压缩表示Z（你的笔记），使得：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Z尽可能小（压缩率高，笔记简洁）&lt;/li&gt;&#xA;&lt;li&gt;Z尽可能保留关于Y的信息（预测能力强，考试能拿分）&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;这两个目标相互矛盾。&lt;/strong&gt; 笔记越简洁，丢失的信息越多，预测能力可能下降；笔记越详细，预测能力越强，但压缩率差。&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论的核心贡献是：&lt;strong&gt;它给出了这个权衡的数学最优解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个公式道尽智能的本质&#34;&gt;二、一个公式，道尽智能的本质&lt;/h2&gt;&#xA;&lt;p&gt;信息瓶颈的核心公式，其实只有一行：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最小化：I(X;Z) — β × I(Z;Y)&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不要被公式吓到——它表达的是一种我们每天都在做的直觉判断。&lt;/p&gt;&#xA;&lt;p&gt;让我们拆解一下：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(X;Z)&lt;/strong&gt;：你的笔记（Z）包含的原始信息（X）的量。这个值越小，说明你的笔记越&amp;quot;压缩&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(Z;Y)&lt;/strong&gt;：你的笔记（Z）能预测考试内容（Y）的能力。这个值越大，说明你的笔记越&amp;quot;有用&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;β&lt;/strong&gt;：一个调节旋钮，控制你更看重&amp;quot;简洁&amp;quot;还是&amp;quot;准确&amp;quot;。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个公式的哲学是：最优的智能，不是&amp;quot;记住最多信息&amp;quot;，而是&amp;quot;用最少的信息，保留最多的价值&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;β=0时，你只关心压缩，笔记只有一行&amp;quot;今天上了数学课&amp;quot;——考试肯定挂。&lt;/p&gt;&#xA;&lt;p&gt;β=很大时，你只关心预测，笔记有几万字——信息过载，考试时找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;β=最优值时，你的笔记刚好记下关键点——考试时思路清晰，效率最高。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;最优值&amp;quot;对应的笔记，就是信息瓶颈理论所说的&amp;quot;最优表征&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三深度学习本质上就在做这件事&#34;&gt;三、深度学习，本质上就在做这件事&lt;/h2&gt;&#xA;&lt;p&gt;2015年，信息论专家纳夫塔利·蒂什比（Naftali Tishby）提出了一个大胆的观点：&lt;strong&gt;深度神经网络训练的过程，本质上就是在解信息瓶颈问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他做了一个实验，让一个神经网络在手写数字识别任务上训练，然后观察每一层神经元在训练过程中的变化。&lt;/p&gt;&#xA;&lt;p&gt;结果非常有趣：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：拟合（Fitting）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;刚开始训练时，网络在&amp;quot;记住&amp;quot;训练数据。每一层的神经元都在努力获取关于输入X的信息——I(X;Z)迅速上升。&lt;/p&gt;&#xA;&lt;p&gt;这就像你刚开始听课时的状态——拼命记笔记，生怕漏掉一个字。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：压缩（Compression）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;训练到一定阶段后，网络开始&amp;quot;遗忘&amp;quot;。它不再关注输入中的无关细节，而是只保留对分类有用的特征。&lt;/p&gt;&#xA;&lt;p&gt;I(X;Z)下降，但I(Z;Y)保持不变甚至上升——&lt;strong&gt;你丢掉了废话，留下了精华。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是深度学习成功的秘密：它不是在学习&amp;quot;记住所有东西&amp;quot;，而是在学习&amp;quot;忘记不重要的东西&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有经过充分训练的AI，就像那个逐字逐句记笔记的学生——它记住了训练数据的每一个细节，但换一个场景就不知所措了（这就是我们说的&amp;quot;过拟合&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;一个训练充分的AI，就像那个只记关键点的学生——它抓住了问题的本质，即使面对新情况也能灵活应对（这就是&amp;quot;泛化能力&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论告诉我们：泛化能力，本质上就是压缩能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么忘记比记住更难&#34;&gt;四、为什么&amp;quot;忘记&amp;quot;比&amp;quot;记住&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然压缩这么重要，那让AI使劲压缩不就行了？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;没那么简单。因为压缩的前提是：你知道什么该保留，什么该丢弃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个刚出生的婴儿，分不清&amp;quot;妈妈的脸&amp;quot;和&amp;quot;天花板的颜色&amp;quot;哪个更重要。他需要大量的学习和经验，才能建立起&amp;quot;哪些信息值得保留&amp;quot;的判断力。&lt;/p&gt;&#xA;&lt;p&gt;同样，AI在训练初期也不知道什么特征重要。它需要反复试错，才能学会&amp;quot;压缩&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么深度学习需要海量数据——不是为了让AI记住更多，而是为了让AI学会该忘记什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论揭示了另一个惊人的事实：&lt;strong&gt;最优的压缩，会自然地出现在神经网络的不同层之间。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果你把神经网络看成一个流水线：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第一层：处理最原始的信息（像素级别的颜色、边缘）&lt;/li&gt;&#xA;&lt;li&gt;中间层：开始提取有意义的模式（形状、纹理）&lt;/li&gt;&#xA;&lt;li&gt;最后一层：只保留最&amp;quot;有用&amp;quot;的特征（&amp;ldquo;这是一只猫&amp;quot;的判断）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;每一层都在做一次信息瓶颈——压缩输入，保留对下一层有用的信息。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
