<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>CLIP on 灵语AI</title>
		<link>https://lingyu7.com/tags/clip/</link>
		<description>Recent content in CLIP on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sun, 30 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/clip/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;举一反三&#39;——迁移学习如何让AI学会触类旁通</title>
				<link>https://lingyu7.com/posts/transfer-learning-ai-learns-to-learn/</link>
				<pubDate>Sun, 30 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/transfer-learning-ai-learns-to-learn/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你肯定有过这样的经历：&lt;/p&gt;&#xA;&lt;p&gt;学完骑自行车，再学骑电动车，几分钟就上手了。不是因为电动车更简单，而是因为你的身体已经记住了怎么保持平衡、怎么转弯、怎么刹车——这些技能从自行车&amp;quot;迁移&amp;quot;到了电动车。&lt;/p&gt;&#xA;&lt;p&gt;或者，你学会做番茄炒蛋之后，第一次做番茄鸡蛋面，虽然没做过，但你知道番茄要炒出汁、鸡蛋要滑嫩、火候要够——这些经验从一道菜&amp;quot;迁移&amp;quot;到了另一道菜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这种&amp;quot;举一反三&amp;quot;的能力，人类天生就有。但AI呢？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，AI的学习方式更像是&amp;quot;从零开始&amp;quot;。学完识别猫，如果要识别狗，它需要重新学习——用成千上万张狗的照片重新训练。它不会把&amp;quot;识别猫&amp;quot;的经验迁移到&amp;quot;识别狗&amp;quot;上。&lt;/p&gt;&#xA;&lt;p&gt;但这种情况正在改变。&lt;strong&gt;迁移学习（Transfer Learning），正是让AI学会&amp;quot;举一反三&amp;quot;的技术。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai不需要每次都从零开始&#34;&gt;核心观点：AI不需要每次都&amp;quot;从零开始&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你想让孩子学会辨认各种鸟类，你会怎么做？&lt;/p&gt;&#xA;&lt;p&gt;最笨的办法：给他一本厚厚的鸟类图鉴，让他把每一种鸟的图片、名字、特征都背下来。但更聪明的方式是：先教他&amp;quot;鸟&amp;quot;的概念——有翅膀、会飞、有喙。然后教他&amp;quot;鸟的类别&amp;quot;——鸣禽、猛禽、水鸟。等他掌握了这些基础，再教他识别具体的种类。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;迁移学习的思路，和&amp;quot;先教基础，再教具体&amp;quot;如出一辙。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统的AI训练方式，就像让一个孩子每次学新东西都从零开始。今天学猫，明天学狗，但学狗的时候已经把猫忘光了。这显然不是&amp;quot;智能&amp;quot;该有的样子。&lt;/p&gt;&#xA;&lt;p&gt;迁移学习改变了这一切。它的核心思想很简单：&lt;strong&gt;让AI先在一个大任务上学习通用知识，然后把这些知识迁移到具体的小任务上。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像一个学生先学基础数学，再去学微积分；先学编程基础，再去学深度学习。基础打好了，学什么都快。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么从零开始训练ai很傻&#34;&gt;为什么&amp;quot;从零开始&amp;quot;训练AI很傻？&lt;/h2&gt;&#xA;&lt;p&gt;你可能觉得&amp;quot;从零开始训练也没什么大不了的&amp;quot;，但现实中，从零训练一个AI模型，成本和代价高得惊人。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价一数据饥渴&#34;&gt;代价一：数据饥渴&lt;/h3&gt;&#xA;&lt;p&gt;一个典型的图像识别模型，需要数百万张标注好的图片。一张图片的标注成本大约0.5-2元人民币——也就是说，训练一个模型，光标注费用就可能上百万。&lt;/p&gt;&#xA;&lt;p&gt;更夸张的是语言模型。GPT-3的训练数据达到了45TB的文本，相当于整个英文维基百科的几十倍。这些文本的采集、清洗、标注，成本以亿计。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价二计算天价&#34;&gt;代价二：计算天价&lt;/h3&gt;&#xA;&lt;p&gt;训练一个大模型，需要成千上万块GPU同时运行数周甚至数月。GPT-3的单次训练成本据估计超过1200万美元。而像GPT-4这样的更大模型，成本只会更高。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价三时间成本&#34;&gt;代价三：时间成本&lt;/h3&gt;&#xA;&lt;p&gt;从零训练一个模型，不是几天，而是几个月。更关键的是，如果每次有新任务都要从头开始，AI的迭代速度会被严重拖慢。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;那迁移学习是怎么解决这些问题的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;很简单：&lt;strong&gt;让AI先&amp;quot;上一次大学&amp;quot;，然后&amp;quot;再去上班&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;上大学&amp;quot;阶段——在大规模通用数据上训练一个&amp;quot;基础模型&amp;rdquo;（也叫预训练模型）。这个阶段成本确实高，但只需要做一次。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;上班&amp;quot;阶段——在具体任务上&amp;quot;微调&amp;quot;这个基础模型。因为基础模型已经掌握了通用知识，所以微调只需要少量数据、少量计算、少量时间。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个比喻，其实就是迁移学习的精髓。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;迁移学习的三种武功从大改到微调到精调&#34;&gt;迁移学习的三种&amp;quot;武功&amp;rdquo;——从&amp;quot;大改&amp;quot;到&amp;quot;微调&amp;quot;到&amp;quot;精调&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;迁移学习不是一种单一的技术，而是一整套方法。根据&amp;quot;改动的程度&amp;quot;，可以分为三个层次。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一层全参数微调fine-tuning&#34;&gt;第一层：全参数微调（Fine-tuning）&lt;/h3&gt;&#xA;&lt;p&gt;这是最&amp;quot;简单粗暴&amp;quot;的迁移学习方法，也是最常用的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法&lt;/strong&gt;：拿到一个已经训练好的基础模型（比如BERT、GPT），然后在你自己的任务数据上继续训练，模型的所有参数都会跟着调整。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你请了一个顶级厨师（基础模型），他本来擅长做西餐。你让他到你的中餐馆上班，他需要重新学习怎么用炒锅、怎么调酱汁——但刀工、火候、对食材的理解这些基本功还在，所以学得很快。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果&lt;/strong&gt;：在大多数任务上，微调的效果都很好。比如在GLUE（自然语言理解基准测试）上，微调后的BERT在所有任务上都超过了从零训练的模型，平均高出13%以上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;代价&lt;/strong&gt;：但全参数微调有一个问题——如果模型很大，成本依然很高。微调一个175B参数的GPT-3，虽然比从头训练便宜，但依然需要数千美元的计算资源。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二层参数高效微调loraadapter&#34;&gt;第二层：参数高效微调（LoRA、Adapter）&lt;/h3&gt;&#xA;&lt;p&gt;既然全参数微调还是贵，那能不能只改一小部分参数？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;LoRA（Low-Rank Adaptation）&lt;/strong&gt; 就是答案。它的思路非常巧妙：&lt;/p&gt;&#xA;&lt;p&gt;研究发现，大模型在微调时，参数的变化量其实很小，而且这些变化可以用一个&amp;quot;低秩矩阵&amp;quot;来近似。简单说就是：&lt;strong&gt;你不需要动整个模型，只需要加一个小小的&amp;quot;适配器&amp;quot;，然后只训练这个适配器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：你买的手机，出厂时系统是标准的。但你可以安装一些&amp;quot;插件&amp;quot;——比如一个拍照增强插件、一个电池优化插件。这些插件不改变手机系统本身，但能大幅提升特定功能的表现。&lt;/p&gt;&#xA;&lt;p&gt;LoRA就是给大模型安装&amp;quot;插件&amp;quot;——只训练不到0.01%的参数，就能达到全参数微调95-99%的效果。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前要几万美元的微调，现在只需要几十美元。而且因为改动很小，同一个基础模型可以同时&amp;quot;服务&amp;quot;多个不同的任务——只需为每个任务准备一个轻量级的LoRA插件。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三层少样本学习maml原型网络&#34;&gt;第三层：少样本学习（MAML、原型网络）&lt;/h3&gt;&#xA;&lt;p&gt;如果连微调数据都没有，只有几个样本怎么办？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;少样本学习&lt;/strong&gt;的用武之地。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAML（Model-Agnostic Meta-Learning）&lt;/strong&gt; 的思路是：不直接训练一个模型来解决某个任务，而是训练一个&amp;quot;学习算法&amp;quot;——让模型学会&amp;quot;如何快速学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像教一个人&amp;quot;如何学习&amp;quot;而不是教他&amp;quot;某个具体知识&amp;quot;。你教他记忆方法、信息检索技巧、逻辑推理框架——然后不管让他学什么，他都能快速上手。&lt;/p&gt;&#xA;&lt;p&gt;MAML训练出来的模型，在一个新任务上只需要看5个样本，就能快速适应。在Omniglot（手写字符识别）数据集上，MAML的5-shot准确率达到了98.8%——几乎和人类不相上下。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个真实的奇迹clip的零样本迁移&#34;&gt;一个真实的奇迹：CLIP的&amp;quot;零样本迁移&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;如果说上面这些方法还需要&amp;quot;一点数据&amp;quot;，那CLIP（Contrastive Language-Image Pre-training）直接把迁移学习推向了极致——&lt;strong&gt;零样本迁移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP是OpenAI在2021年发布的一个模型。它的训练方式很特别：不是像传统模型那样给每张图片打标签（&amp;ldquo;这是猫&amp;rdquo;、&amp;ldquo;这是狗&amp;rdquo;），而是让模型学习&amp;quot;图片&amp;quot;和&amp;quot;文字描述&amp;quot;之间的对应关系。&lt;/p&gt;&#xA;&lt;p&gt;它看了4亿张图片和对应的文字描述（比如一张猫的照片对应&amp;quot;一只橘猫在窗台上晒太阳&amp;quot;），然后学会了把&amp;quot;图片的含义&amp;quot;和&amp;quot;文字的含义&amp;quot;映射到同一个&amp;quot;语义空间&amp;quot;中。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;意味着你不需要给CLIP准备任何训练数据，直接问它：&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;这张图片里是猫还是狗？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;CLIP会自己把图片转换成&amp;quot;语义向量&amp;quot;，把&amp;quot;猫&amp;quot;和&amp;quot;狗&amp;quot;也转换成向量，然后比较谁更接近——就能直接回答你。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet（1000类图像分类基准）上，CLIP的零样本准确率达到了76.2%，而传统的有监督ResNet-50（用120万张标注图片训练的模型）的准确率也不过76.3%。&lt;strong&gt;CLIP没看过一张ImageNet的训练图片，就达到了和看过120万张图片的模型几乎一样的水平。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是迁移学习的终极形态：&lt;strong&gt;学一次，用遍天下。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不只是ai迁移学习和大模型时代的范式革命&#34;&gt;不只是AI——迁移学习和大模型时代的&amp;quot;范式革命&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;迁移学习的兴起，从根本上改变了AI的开发方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2018年之前&lt;/strong&gt;，做AI就像&amp;quot;手工作坊&amp;quot;——每个任务都要从头采集数据、设计模型、训练部署。做一个猫狗识别系统，需要几个月；做一个情感分析系统，又需要几个月。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI不用老师也能自己学？——自监督学习的魔力</title>
				<link>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</link>
				<pubDate>Sun, 23 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-self-supervised-learning-ai-learns-without-teacher/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;你不可能给他一张张标注好&amp;quot;这是猫，这不是猫&amp;quot;的照片，然后让他背下来。但神奇的是，他看过几次猫之后，就能自己认出猫——哪怕猫换了姿势、换了光线、换了背景，他都知道&amp;quot;这是猫&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来理所当然，但对AI来说，这曾经是一个巨大的难题。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI学习方式，需要大量人工标注的数据。比如你想让AI学会识别猫，你得先给它看几万张标注了&amp;quot;猫&amp;quot;或&amp;quot;不是猫&amp;quot;的照片。这叫&lt;strong&gt;监督学习&lt;/strong&gt;——就像有一个老师，每道题都告诉你正确答案。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：世界上有那么多东西需要AI认识，哪有那么多&amp;quot;老师&amp;quot;给每张照片打标签？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;自监督学习&lt;/strong&gt;要解决的问题——让AI像小孩一样，&lt;strong&gt;不用老师，自己也能学会&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;老师不够用了&#34;&gt;&amp;ldquo;老师&amp;quot;不够用了&lt;/h2&gt;&#xA;&lt;p&gt;先说说为什么&amp;quot;自监督&amp;quot;这么重要。&lt;/p&gt;&#xA;&lt;p&gt;传统监督学习有一个致命的瓶颈：&lt;strong&gt;标注成本&lt;/strong&gt;。你让AI识别猫，可能要花几千小时让人工去标注几百万张图片。如果让它识别罕见病CT影像呢？能看懂CT片的医生本来就少，哪来的时间给你一张张标注？&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，人类的学习方式本身就不是&amp;quot;监督&amp;quot;的。你学会认猫，不是因为有人给你标了数据，而是因为你&lt;strong&gt;观察了足够多的猫&lt;/strong&gt;，自己总结出了规律。你学会了说话，不是因为有人给你一张语法规则表，而是因为你&lt;strong&gt;听了足够多的话&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;所以一个自然的问题就是：&lt;strong&gt;能不能让AI也这样学？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是可以，而且这条路正在改变整个AI领域。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心思想让数据给自己出题&#34;&gt;核心思想：让数据给自己出题&lt;/h2&gt;&#xA;&lt;p&gt;自监督学习的基本思路听起来很巧妙：&lt;strong&gt;让数据自己给自己出题&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你不是直接告诉AI&amp;quot;这张图是猫&amp;rdquo;，而是把一张猫的照片切成两半，让AI猜&amp;quot;这两半是不是同一张图上的&amp;quot;。AI为了答对这道题，必须学会理解&amp;quot;猫&amp;quot;长什么样、有什么特征——在这个过程中，它自然而然地就学会了识别猫，而你根本不需要给它任何标签。&lt;/p&gt;&#xA;&lt;p&gt;这就是自监督学习最核心的智慧：&lt;strong&gt;不要给AI答案，给它出题，让它自己从题目中学习。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这套方法主要有两大学派，我们来看看它们各自是怎么&amp;quot;出题&amp;quot;的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派一对比学习找不同的反向操作&#34;&gt;流派一：对比学习——&amp;ldquo;找不同&amp;quot;的反向操作&lt;/h2&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习（Contrastive Learning）&lt;/strong&gt; 的思路是：让AI学会区分&amp;quot;相似&amp;quot;和&amp;quot;不相似&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，对同一张图片做两种不同的处理——比如裁剪不同区域、调整颜色、旋转角度——得到两张&amp;quot;长得不一样但本质是同一张图&amp;quot;的版本。AI的任务是：&lt;strong&gt;把这两张&amp;quot;同源&amp;quot;的图片识别为相似，把来自不同图的图片识别为不相似。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像你给AI出题：&amp;ldquo;这两张图是同一只猫的不同角度，那两张图是两只不同的猫，你给我分出来。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;听起来似乎不难，但真正做起来，里面有很多门道。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;SimCLR&lt;/strong&gt;（Google 2020年提出）是这一派的开创者之一。它的做法很有意思：把同一张图做两种不同的&amp;quot;数据增强&amp;quot;——比如一张剪了左上角还调亮了，另一张剪了右下角还压暗了——然后让AI学会把这两张&amp;quot;增强版&amp;quot;识别为同一张图。为了做到这一点，AI必须理解图片的&amp;quot;本质内容&amp;quot;是什么，而不是被表面变化迷惑。SimCLR在ImageNet上达到了76.5%的Top-1准确率，几乎追平了监督学习的ResNet-50——而这一切，&lt;strong&gt;没有使用任何一张人工标注的图片&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MoCo&lt;/strong&gt;（何恺明团队，Facebook 2020）走了另一条路。它用了一个&amp;quot;记忆队列&amp;quot;——把之前见过的所有图片特征都存起来，形成一个巨大的&amp;quot;字典&amp;quot;。当新图片进来时，AI就在这个字典里找&amp;quot;谁和谁长得像&amp;quot;。这个看似简单的设计，让对比学习可以在普通显卡上训练，而不需要大batch size。MoCo在目标检测任务上第一次超越了监督预训练——这意味着自监督学习不仅&amp;quot;够用&amp;quot;，在某些场景下甚至比&amp;quot;有老师教&amp;quot;的更好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BYOL&lt;/strong&gt;（DeepMind 2020）则更进一步——它连&amp;quot;不相似&amp;quot;的样本都不需要了。它只学&amp;quot;同一张图的两个版本应该相似&amp;quot;，完全不用看&amp;quot;不相似的图长什么样&amp;quot;。这就好比一个小孩只盯着猫看，不看狗，竟然也能学会认猫。这个发现打破了学界的共识——原来&amp;quot;负样本&amp;quot;不是必须的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;流派二掩码预测完形填空的智慧&#34;&gt;流派二：掩码预测——&amp;ldquo;完形填空&amp;quot;的智慧&lt;/h2&gt;&#xA;&lt;p&gt;另一条路更直觉：&lt;strong&gt;遮住一部分，让AI猜被遮住的是什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE（Masked Autoencoders）&lt;/strong&gt;（何恺明团队，Meta 2022）把这张做到了极致。它随机遮掉一张图片的75%——没错，只留下25%的碎片给AI看，然后让AI复原整张图。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个&amp;quot;不可能完成的任务&amp;rdquo;。但正是这种&amp;quot;极度困难&amp;quot;的设定，迫使AI学会了真正的&amp;quot;理解&amp;quot;。你想想，如果你只看到一个人的眼睛和耳朵，要猜出整张脸长什么样——你必须理解&amp;quot;人脸的结构是什么样的&amp;quot;、&amp;ldquo;眼睛和耳朵之间有什么关系&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;MAE的巧妙之处在于它的&amp;quot;非对称设计&amp;quot;：编码器只看那25%的可见碎片（计算量小），解码器负责复原那75%的遮挡部分（稍微重一点但只用一次）。这个设计让训练速度提升了4倍以上。最终，MAE在ImageNet上达到了87.8%的Top-1准确率——已经超过了大多数有监督的方法。&lt;/p&gt;&#xA;&lt;p&gt;你可能会觉得这很熟悉——没错，就是&lt;strong&gt;BERT&lt;/strong&gt;的思路。BERT遮住文本中的一些词让AI猜，MAE遮住图像中的一些区域让AI复原。&lt;strong&gt;&amp;ldquo;完形填空&amp;quot;这个思路，从文本到图像，通用得令人惊讶。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;clip让ai学会看图说话&#34;&gt;CLIP：让AI学会&amp;quot;看图说话&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;如果说对比学习是&amp;quot;让AI自己学会区分&amp;quot;，那么&lt;strong&gt;CLIP&lt;/strong&gt;（OpenAI 2021）就是&amp;quot;让AI学会跨语言的联想&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：在网上找了4亿张图文配对的数据（比如一张猫的照片，配文&amp;quot;一只橘猫趴在窗台上&amp;quot;），然后让AI学会&lt;strong&gt;把图片和对应的文字匹配到一起&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，给AI一张图片和一段文字描述，问它：&amp;ldquo;这张图配这段文字，配不配？&amp;ldquo;为了答对这道题，AI必须同时理解图片的内容和文字的含义，然后把它们对应起来。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的神奇之处在于，学完之后，它&lt;strong&gt;不需要任何额外的训练数据&lt;/strong&gt;就能做图像分类。你告诉它&amp;quot;识别猫、狗、鸟&amp;rdquo;——它自己就能把图片分好类，准确率高达76.2%（ImageNet零样本分类）。这意味着，&lt;strong&gt;你不需要给CLIP任何一张标注好的猫照片，它就已经知道猫长什么样了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，CLIP已经成为了Stable Diffusion、DALL·E 2等生成模型的&amp;quot;眼睛&amp;rdquo;——它让AI既&amp;quot;看得懂图&amp;quot;，又&amp;quot;读得懂字&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么自己学比有人教更重要&#34;&gt;为什么&amp;quot;自己学&amp;quot;比&amp;quot;有人教&amp;quot;更重要？&lt;/h2&gt;&#xA;&lt;p&gt;到这里你可能会问：自监督学习确实很酷，但它到底有什么用？跟普通人的生活有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。想想这些场景：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：医疗影像&lt;/strong&gt;。罕见病的CT影像本来就少，能标注的医生更少。自监督学习可以先让AI&amp;quot;自己看&amp;quot;大量未标注的CT片，学会&amp;quot;正常肺部长什么样&amp;quot;，然后再少量标注数据就能学会&amp;quot;识别异常&amp;quot;。这大大降低了对人工标注的依赖。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：多语言翻译&lt;/strong&gt;。世界上有7000多种语言，大部分语言根本没有足够的标注数据。自监督学习（比如BERT的多语言版本）可以让AI&amp;quot;自己读&amp;quot;大量不同语言的文本，学会&amp;quot;语言之间的对应关系&amp;quot;，即使某些语言只有很少的翻译数据。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：自动驾驶&lt;/strong&gt;。一辆自动驾驶汽车每天会产生TB级别的视频数据，但大部分都是&amp;quot;正常行驶&amp;quot;的普通画面，真正需要标注的&amp;quot;异常场景&amp;quot;非常少。自监督学习可以让AI从这些海量无标注数据中学到&amp;quot;道路的通用规律&amp;quot;，而不是只依赖人工标注的少数场景。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习的真正意义，在于它打破了AI对&amp;quot;人工标注&amp;quot;的依赖。&lt;/strong&gt; 世界上绝大多数数据——图片、视频、文字、声音——都是没有标签的。如果AI只能从&amp;quot;有标签&amp;quot;的数据中学习，它永远只能理解人类世界的一小部分。而自监督学习，让AI可以像人类一样，从&amp;quot;观察&amp;quot;中自己学习。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从喂数据到自己学&#34;&gt;结语：从&amp;quot;喂数据&amp;quot;到&amp;quot;自己学&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那个问题：小孩是怎么学会认猫的？&lt;/p&gt;&#xA;&lt;p&gt;答案其实很简单——&lt;strong&gt;他不需要&amp;quot;老师&amp;quot;告诉他每张照片是不是猫，他只需要看足够多的猫，大脑就能自己总结出&amp;quot;猫是什么&amp;quot;的规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自监督学习做的，正是同一件事：&lt;strong&gt;不再给AI&amp;quot;答案&amp;quot;，而是给它&amp;quot;问题&amp;quot;——让它从数据本身的结构中，自己发现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从SimCLR到MAE，从对比学习到掩码预测，从CLIP到GPT——这些方法的共同内核是：&lt;strong&gt;让数据自己说话。&lt;/strong&gt; 而这对AI的意义，可能比我们想象的要深远得多。因为当AI学会&amp;quot;自己学&amp;quot;之后，它就不再受限于人类能教它的东西——它可以自己去探索、去发现、去理解那些我们甚至还没想到的知识。&lt;/p&gt;&#xA;&lt;p&gt;而这，或许才是通往真正智能的那把钥匙。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Chen et al. &lt;em&gt;A Simple Framework for Contrastive Learning of Visual Representations&lt;/em&gt;. ICML 2020. &lt;a href=&#34;https://arxiv.org/abs/2002.05709&#34;&gt;arXiv:2002.05709&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Momentum Contrast for Unsupervised Visual Representation Learning&lt;/em&gt;. CVPR 2020. &lt;a href=&#34;https://arxiv.org/abs/1911.05722&#34;&gt;arXiv:1911.05722&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;He et al. &lt;em&gt;Masked Autoencoders Are Scalable Vision Learners&lt;/em&gt;. CVPR 2022. &lt;a href=&#34;https://arxiv.org/abs/2111.06377&#34;&gt;arXiv:2111.06377&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Grill et al. &lt;em&gt;Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning&lt;/em&gt;. NeurIPS 2020. &lt;a href=&#34;https://arxiv.org/abs/2006.07733&#34;&gt;arXiv:2006.07733&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Radford et al. &lt;em&gt;Learning Transferable Visual Models From Natural Language Supervision&lt;/em&gt;. ICML 2021. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;arXiv:2103.00020&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的&#39;超能力&#39;——CLIP如何让机器同时看懂文字和图像</title>
				<link>https://lingyu7.com/posts/clip-ai-sees-world-through-text-and-images/</link>
				<pubDate>Thu, 13 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/clip-ai-sees-world-through-text-and-images/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一下：你看到一张照片——一只橘猫坐在窗台上，夕阳把它的毛染成了金色。你不仅知道&amp;quot;这是猫&amp;quot;，还能感受到&amp;quot;温暖、安静、傍晚&amp;quot;。你甚至能在脑海中把这个画面描述成一段文字。&lt;/p&gt;&#xA;&lt;p&gt;但AI呢？传统AI只能做一件事：要么它会说&amp;quot;这张图片中有猫，置信度98%&amp;quot;，要么它只能处理文字，根本看不懂图片。&lt;strong&gt;它没有&amp;quot;通感&amp;quot;——无法把视觉和语言联系起来。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI发布了一个名为CLIP的模型，彻底改变了这一切。它让AI学会了&amp;quot;一边看一边读&amp;quot;的能力，就像人类天生具备的那样。今天，我们就来聊聊CLIP——这个让AI拥有&amp;quot;超能力&amp;quot;的模型，到底是怎么工作的，以及它为什么如此重要。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的单向道困境&#34;&gt;第一章：AI的&amp;quot;单向道&amp;quot;困境&lt;/h2&gt;&#xA;&lt;p&gt;要理解CLIP的突破，先要知道AI的&amp;quot;老毛病&amp;quot;是什么。&lt;/p&gt;&#xA;&lt;p&gt;在CLIP之前，计算机视觉领域的&amp;quot;标准答案&amp;quot;是监督学习：给AI看几百万张人工标注好的图片，每张图片都附着一个标签——&amp;ldquo;猫&amp;rdquo;、&amp;ldquo;狗&amp;rdquo;、&amp;ldquo;汽车&amp;rdquo;、&amp;ldquo;飞机&amp;rdquo;。AI的任务就是记住这些标签，然后下次看到新的图片时，说出它属于哪个类别。&lt;/p&gt;&#xA;&lt;p&gt;ImageNet，这个用了十年之久的标准数据集，由2.5万人花了几个月时间，标注了1,400万张图片。这听起来已经很了不起了，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但问题在于：&lt;strong&gt;地球上只有1,400万种东西吗？当然不是。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你打开手机相册，随便翻一张照片——比如&amp;quot;桌上放着一杯星巴克拿铁，旁边是今天刚买的书&amp;quot;。这种组合，ImageNet里不会有。AI只学过&amp;quot;杯子&amp;quot;和&amp;quot;书&amp;quot;这两个独立标签，它无法理解&amp;quot;一杯星巴克拿铁放在一本书旁边&amp;quot;这个完整的场景。&lt;/p&gt;&#xA;&lt;p&gt;更糟糕的是，如果你想教会AI识别一个新类别，比如&amp;quot;戴帽子的企鹅&amp;quot;，你需要重新让人标注几万张戴帽子的企鹅的照片，然后从头训练模型。&lt;strong&gt;每增加一个类别，就要重新标注、重新训练。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;单向道&amp;quot;困境：它只能识别训练时见过的类别，而且永远无法理解&amp;quot;标签之外&amp;quot;的世界。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章clip的天才想法&#34;&gt;第二章：CLIP的&amp;quot;天才想法&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2021年，OpenAI的研究团队提出了一个简单到令人震惊的想法：&lt;strong&gt;为什么不让AI自己去互联网上&amp;quot;自学&amp;quot;图文关系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;互联网上有海量的图文对——一张照片配上一段文字描述。比如一张猫的照片，下面写着&amp;quot;这只橘猫正在窗台上晒太阳&amp;quot;。这些数据不需要人工标注，它们自然存在于互联网的每个角落。&lt;/p&gt;&#xA;&lt;p&gt;CLIP（Contrastive Language-Image Pre-training）的核心思路是：&lt;strong&gt;训练两个&amp;quot;编码器&amp;quot;，一个负责&amp;quot;看&amp;quot;图片，一个负责&amp;quot;读&amp;quot;文字，然后把它们看到/读到的东西映射到同一个&amp;quot;语义空间&amp;quot;中。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你有一个巨大的图书馆，里面所有的书都有封面和书名。你让一个助手（图像编码器）专门看封面，另一个助手（文本编码器）专门读书名。然后你让两个助手合作：把封面和书名匹配起来。&lt;/p&gt;&#xA;&lt;p&gt;一开始，两个助手都不认识对方的工作。但经过4亿次&amp;quot;配对练习&amp;quot;后，他们逐渐达成了默契——当封面是一只猫，书名是&amp;quot;橘猫晒太阳&amp;quot;时，他们就学会了把&amp;quot;猫的视觉特征&amp;quot;和&amp;quot;猫的文字描述&amp;quot;关联起来。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;CLIP的&amp;quot;天才&amp;quot;之处在于：它不需要人类告诉它&amp;quot;这是什么&amp;quot;。它自己从互联网上海量的图文对中，学会了理解&amp;quot;图像和文字之间的关系&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一场4亿次连连看游戏&#34;&gt;第三章：一场4亿次&amp;quot;连连看&amp;quot;游戏&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的训练过程，本质上是一场规模巨大的&amp;quot;连连看&amp;quot;游戏。&lt;/p&gt;&#xA;&lt;p&gt;假设你有一个批次（batch）包含N张图片和N段文字描述。你把所有图片和所有文字两两配对，形成N×N个可能的组合。其中只有N个组合是&amp;quot;正确的配对&amp;quot;（图片和它对应的文字描述），其余N²-N个都是&amp;quot;错误配对&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的任务就是：&lt;strong&gt;把正确的配对拉近，把错误的配对推远。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个简单的任务，但关键在&amp;quot;拉近&amp;quot;和&amp;quot;推远&amp;quot;的尺度上。CLIP使用了一种叫做&amp;quot;对比损失&amp;quot;的方法——它不仅要让正确配对的图文在语义空间中距离很近，还要让错误配对的图文距离足够远。而且，它同时优化两个方向：从图片找文字，从文字找图片。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;双向对称&amp;quot;的设计，让CLIP学会了真正的&amp;quot;图文通感&amp;quot;——它不只是知道&amp;quot;这张图配这段文字&amp;quot;，而是理解了&amp;quot;这类视觉特征对应这类语义特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;更令人惊讶的是，CLIP在训练过程中&lt;strong&gt;完全没有使用人工标注&lt;/strong&gt;。它的4亿图文对全部来自互联网上未经清洗的原始数据——可以说，CLIP是从&amp;quot;野生&amp;quot;互联网中自学成才的。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章零样本的魔法&#34;&gt;第四章：零样本的&amp;quot;魔法&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP最令人震撼的能力，是它的&amp;quot;零样本学习&amp;quot;——&lt;strong&gt;不需要专门训练，就能识别从未见过的类别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你教一个孩子认识了&amp;quot;猫&amp;quot;、&amp;ldquo;狗&amp;rdquo;、&amp;ldquo;鸟&amp;quot;这三种动物。现在你拿一张&amp;quot;斑马&amp;quot;的照片给他看，他肯定不认识。但如果你告诉他&amp;quot;斑马是一种像马一样、身上有黑白条纹的动物&amp;rdquo;，他就能立刻理解——因为他把&amp;quot;马&amp;quot;的视觉特征和&amp;quot;黑白条纹&amp;quot;这个文字描述组合起来了。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的工作原理，本质上就是这种&amp;quot;组合理解&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当你给CLIP一张图片，让它判断&amp;quot;这是什么&amp;quot;时，它不会像传统AI那样去查一个固定的类别列表。相反，你给它一段文字描述——比如&amp;quot;一张斑马的照片&amp;quot;——CLIP会计算这张图片和这段文字在语义空间中的距离。如果距离足够近，它就认为&amp;quot;对上了&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;你可以随时告诉CLIP一个新的类别，它立刻就能识别。&lt;/strong&gt; 不需要重新训练，不需要重新标注数据。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet的零样本测试中，CLIP达到了76.2%的准确率——与一个经过全监督训练的ResNet-50模型不相上下。而ResNet-50是在人工标注的120万张图片上训练出来的，CLIP却一张标注数据都没用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章clip改变了什么&#34;&gt;第五章：CLIP改变了什么&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的出现，不仅是一个技术突破，更是一个&amp;quot;范式转变&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它终结了&amp;quot;标注依赖&amp;quot;的时代。&lt;/strong&gt; 在过去，每做一个新任务，就要重新标注数据。CLIP证明了：自然语言本身就是最好的监督信号。互联网上无处不在的图文对，比任何人工标注数据集都更丰富、更多样、更便宜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开启了&amp;quot;多模态AI&amp;quot;的大门。&lt;/strong&gt; CLIP证明了图文之间的&amp;quot;语义对齐&amp;quot;是可行的。之后，DALL·E用它做图像生成，Stable Diffusion用它做文生图，BLIP和LLaVA用它做图文理解——CLIP几乎成了多模态AI的&amp;quot;通用底座&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它改变了我们思考AI的方式。&lt;/strong&gt; 传统AI的思维是&amp;quot;识别&amp;quot;——识别出这是什么。CLIP的思维是&amp;quot;理解&amp;quot;——理解图像和文字之间的关系。这听起来像是一个微妙的差别，但本质上，这是从&amp;quot;记忆&amp;quot;到&amp;quot;理解&amp;quot;的跨越。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第六章clip的盲区&#34;&gt;第六章：CLIP的&amp;quot;盲区&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;当然，CLIP并不完美。它也有自己的&amp;quot;盲区&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个盲区：细粒度理解。&lt;/strong&gt; CLIP能认出&amp;quot;猫&amp;quot;，但分不清&amp;quot;布偶猫&amp;quot;和&amp;quot;暹罗猫&amp;quot;的区别。它的理解是&amp;quot;粗粒度&amp;quot;的，就像你能认出&amp;quot;汽车&amp;quot;，但分不清&amp;quot;宝马3系&amp;quot;和&amp;quot;奔驰C级&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个盲区：计数能力。&lt;/strong&gt; 给CLIP看一张图片，问它&amp;quot;图片里有几只鸟&amp;quot;，它大概率会答错。CLIP理解的是&amp;quot;语义&amp;quot;而不是&amp;quot;数量&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个盲区：抽象推理。&lt;/strong&gt; CLIP能理解&amp;quot;一只狗在追球&amp;quot;，但无法理解&amp;quot;如果狗追到了球，接下来会发生什么&amp;quot;。它没有&amp;quot;因果推理&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四个盲区：位置感知。&lt;/strong&gt; CLIP知道图片中有&amp;quot;猫&amp;quot;和&amp;quot;沙发&amp;quot;，但不知道&amp;quot;猫在沙发上面&amp;quot;还是&amp;quot;猫在沙发旁边&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这些盲区，恰恰是后来研究者们努力突破的方向——BLIP-2加入了更精细的视觉理解，Flamingo引入了时序推理，ImageBind扩展到了六种模态（图像、文字、音频、深度、热成像、IMU）。CLIP不是终点，而是一个起点。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的通感时代&#34;&gt;尾声：AI的&amp;quot;通感&amp;quot;时代&lt;/h2&gt;&#xA;&lt;p&gt;今天的你，打开手机相册搜索&amp;quot;夕阳&amp;quot;，AI能准确地找出所有夕阳的照片——如果倒退到2020年，这个功能几乎不可能实现。你告诉AI&amp;quot;帮我生成一张穿着宇航服的猫在火星上散步的图片&amp;quot;，AI能做到——DALL·E和Stable Diffusion的背后，都站着CLIP。&lt;/p&gt;&#xA;&lt;p&gt;CLIP教会AI的，不是&amp;quot;识别&amp;quot;，而是&amp;quot;理解&amp;quot;——理解图像和文字之间的关系，理解视觉和语义之间的桥梁。&lt;/p&gt;&#xA;&lt;p&gt;这种能力，我们叫它&amp;quot;多模态理解&amp;quot;。而人类最擅长的，恰恰就是多模态理解——我们同时用眼睛看、用耳朵听、用语言描述、用身体感受，我们把来自不同感官的信息整合在一起，形成一个完整的&amp;quot;世界模型&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI正在走的路，就是人类已经走过的路。只是这一次，我们既是老师，也是学生。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Jia, C., et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.05918&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Li, J., et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. &lt;em&gt;ICML 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2301.12597&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Alayrac, J. B., et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2204.14198&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Girdhar, R., et al. (2023). ImageBind: One Embedding Space To Bind Them All. &lt;em&gt;CVPR 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2305.05665&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>当AI学会「看图说话」——CLIP如何让机器真正理解图片与文字</title>
				<link>https://lingyu7.com/posts/how-clip-teaches-ai-to-understand-images-and-text/</link>
				<pubDate>Mon, 10 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-clip-teaches-ai-to-understand-images-and-text/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过这样一个问题：AI在一张图片里到底&amp;quot;看&amp;quot;到了什么？&lt;/p&gt;&#xA;&lt;p&gt;你拍了一张照片发给AI，它说&amp;quot;这是一只柴犬在沙滩上奔跑，旁边有海浪拍打礁石&amp;quot;。听起来很平常，对吧？但仔细想想，这个过程其实非常神奇——AI看到的只是一个像素矩阵，它怎么知道那是&amp;quot;柴犬&amp;quot;而不是&amp;quot;金色的毛茸茸物体&amp;quot;？它怎么理解&amp;quot;奔跑&amp;quot;这个动态概念？它又是怎么把&amp;quot;沙滩&amp;quot;、&amp;ldquo;海浪&amp;rdquo;、&amp;ldquo;礁石&amp;quot;这些文字符号和画面中的像素联系起来的？&lt;/p&gt;&#xA;&lt;p&gt;很长一段时间里，计算机视觉和自然语言处理就像两个互不相识的邻居，各过各的日子。视觉模型只懂像素，语言模型只懂文字。直到2021年，OpenAI的一篇论文彻底改变了这一切。这篇论文叫CLIP，它的核心工作只有一句话——&lt;strong&gt;教会AI同时理解图片和文字，并且搞清楚它们之间的关系&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的视而不见与言不由衷&#34;&gt;第一章：AI的&amp;quot;视而不见&amp;quot;与&amp;quot;言不由衷&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;在CLIP出现之前，AI的世界里存在一个奇怪的&amp;quot;分裂&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;我们先看视觉模型。传统的图像分类模型是怎么工作的？以ImageNet（一个包含1400万张图片的数据库）为例，研究人员花了2.5万个人工，一张一张地给图片打标签——&amp;ldquo;这是一只猫&amp;rdquo;、&amp;ldquo;这是一条狗&amp;rdquo;、&amp;ldquo;这是一辆汽车&amp;rdquo;。然后AI看着这些标注好的图片，努力记住&amp;quot;猫长什么样&amp;quot;、&amp;ldquo;狗长什么样&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个方法的第一个问题是：&lt;strong&gt;成本高得离谱&lt;/strong&gt;。给1400万张图片打标签，需要2.5万个人工的工作量。而且就算你投入了这么多人力，最后得到的模型也只能识别它训练时见过的1000个类别。如果你给它看一张&amp;quot;斑马&amp;quot;——对不起，训练集里没有这个类别，模型只会说&amp;quot;不知道&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;再说语言模型。语言模型倒是很擅长理解文字，但问题是——&lt;strong&gt;它看不见图片&lt;/strong&gt;。你给它描述&amp;quot;一只柴犬在沙滩上奔跑&amp;quot;，它能理解这句话的意思，但它无法把这句话和实际的画面联系起来。它就像一个只能读书、不能看世界的学者，知识再丰富也仅限于书本。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;视而不见&amp;quot;和&amp;quot;言不由衷&amp;quot;——视觉模型看到画面却说不出来，语言模型能说会道却看不见。两个系统之间隔着一道无形的墙。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章clip的魔法时刻&#34;&gt;第二章：CLIP的&amp;quot;魔法时刻&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的灵感，其实来自一个非常简单的生活观察。&lt;/p&gt;&#xA;&lt;p&gt;想想看，互联网上最丰富的数据是什么？是一张图片和它周围的文字描述。一张旅游照片，下面写着&amp;quot;三亚的海滩，阳光正好&amp;quot;；一个商品展示图，旁边的文字是&amp;quot;新款运动鞋，透气轻便&amp;quot;；甚至一张表情包，上面写着&amp;quot;周一的我&amp;quot;。这些图文对——&lt;strong&gt;图片+文字的组合&lt;/strong&gt;——在互联网上以亿计的量级存在，而且完全免费。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的核心洞察就一句话：&lt;strong&gt;与其花大价钱请人给图片打标签，不如让AI自己去互联网上学&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体怎么做呢？CLIP设计了一个非常巧妙的训练方法。想象一下，你有一张图片和一段文字描述，比如一张柴犬的照片配文&amp;quot;一只可爱的柴犬&amp;quot;。CLIP会把这张图片编码成一个&amp;quot;特征向量&amp;quot;（你可以把它理解为一串数字密码），同时把这段文字也编码成另一个&amp;quot;特征向量&amp;quot;。然后，CLIP要做的事情是：&lt;strong&gt;让同一张图片和它对应的文字描述，在&amp;quot;语义空间&amp;quot;中的距离尽可能近；让不匹配的图片和文字，距离尽可能远&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个过程就像教一个孩子玩配对游戏。你拿出100张图片和100段文字描述，打乱顺序，让AI找出哪段文字对应哪张图片。AI一开始肯定是乱猜的，但做错的次数多了，它慢慢学会了&amp;quot;嗯，这张图片的纹理、颜色和形状，和这段文字里的&amp;rsquo;柴犬&amp;rsquo;、&amp;lsquo;奔跑&amp;rsquo;这些词是匹配的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的训练规模有多大？OpenAI从互联网上收集了4亿个图文对，用32个epoch训练了最大的模型。4亿——这个数字相当于把人类历史上所有电影截图都翻一遍还要多。在如此海量的数据面前，CLIP学会了在不同模态之间建立联系，打通了视觉和语言之间的桥梁。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章零样本的魔法为什么clip能猜出没见过的图片&#34;&gt;第三章：零样本的魔法——为什么CLIP能&amp;quot;猜&amp;quot;出没见过的图片&lt;/h2&gt;&#xA;&lt;p&gt;CLIP最令人惊叹的能力，是它的&lt;strong&gt;零样本迁移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;零样本&amp;quot;这个词听起来很专业，但它的意思其实很简单：CLIP能在没有接受过任何训练的情况下，识别出从未见过的图片类别。&lt;/p&gt;&#xA;&lt;p&gt;举个例子：假设你让CLIP判断一张图片是&amp;quot;斑马&amp;quot;还是&amp;quot;长颈鹿&amp;rdquo;。CLIP从来没有被专门训练过&amp;quot;斑马是什么&amp;quot;——它的训练数据里没有&amp;quot;一张斑马的图片，标签是斑马&amp;quot;这样的标注数据。但CLIP&amp;quot;读过&amp;quot;的4亿图文对里，包含大量提到斑马的文字描述，比如&amp;quot;斑马的黑白条纹在大草原上格外醒目&amp;quot;、&amp;ldquo;斑马和角马一起迁徙&amp;rdquo;。CLIP把&amp;quot;斑马&amp;quot;这个词对应的特征向量和图片的特征向量在语义空间中做了比对，发现&amp;quot;这张图片的特征向量，更接近&amp;rsquo;斑马&amp;rsquo;这个词的特征向量，而不是&amp;rsquo;长颈鹿&amp;rsquo;的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就是零样本的魔法——&lt;strong&gt;CLIP不是通过&amp;quot;记住&amp;quot;某个类别来识别，而是通过&amp;quot;理解&amp;quot;语言描述来推理&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;为了验证这个能力，研究人员在27个不同的视觉分类任务上测试了CLIP，包括ImageNet（通用物体识别）、CIFAR（小图分类）、OCR（文字识别）、动作识别（判断人在做什么）等等。结果令人震惊：CLIP在ImageNet上的零样本准确率达到76.2%，与一个经过完整监督训练的ResNet-50模型持平。要知道，ResNet-50可是在140万张标注图片上训练出来的，而CLIP一张标注图片都没看过。&lt;/p&gt;&#xA;&lt;p&gt;更令人意外的是，CLIP在OCR（光学文字识别）和动作识别等任务上的表现，甚至超过了那些专门为此训练过的模型。这意味着CLIP学到的不只是&amp;quot;视觉特征&amp;quot;，而是一种更通用的&amp;quot;理解能力&amp;quot;——它真的在试图理解图片中的内容，而不是简单地匹配像素模式。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章一张图片引发的ai革命&#34;&gt;第四章：一张图片引发的&amp;quot;AI革命&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的意义远不止于&amp;quot;看图说话&amp;quot;本身。它像一扇被推开的大门，开启了一个全新的AI时代。&lt;/p&gt;&#xA;&lt;p&gt;第一个冲进去的是DALL·E。同样是OpenAI的作品，DALL·E把CLIP的文本编码器拆下来，接上了一个图像生成器，实现了&amp;quot;你说什么，AI就画什么&amp;quot;的魔法。你输入&amp;quot;一个牛油果造型的沙发&amp;quot;，DALL·E就能生成一张看起来像模像样的图片。这个能力的核心，正是CLIP建立的图文语义桥梁——AI理解了&amp;quot;牛油果&amp;quot;和&amp;quot;沙发&amp;quot;这两个概念，然后把它们融合在一起。&lt;/p&gt;&#xA;&lt;p&gt;然后是Stable Diffusion。它把CLIP的文本编码器用作文本条件控制模块，让任何人都能通过文字生成高质量图片。你在网上看到的所有&amp;quot;AI绘画&amp;quot;作品，几乎都离不开CLIP的贡献。&lt;/p&gt;&#xA;&lt;p&gt;再往后，BLIP、BLIP-2、LLaVA等模型进一步扩展了CLIP的范式，让AI不仅能&amp;quot;看图说话&amp;quot;，还能&amp;quot;看图问答&amp;quot;、&amp;ldquo;看图推理&amp;rdquo;。你拍一张冰箱内部的照片，问AI&amp;quot;晚饭能做什么菜&amp;quot;，AI会分析冰箱里的食材，然后给出建议——这在以前是科幻电影里的场景，现在已经成为现实。&lt;/p&gt;&#xA;&lt;p&gt;CLIP创造了一个全新的范式：&lt;strong&gt;多模态学习&lt;/strong&gt;。它证明了不同模态的信息（图像、文字、声音、视频）可以被映射到同一个语义空间中，让AI在不同感官之间自由切换。这就像打通了AI的&amp;quot;任督二脉&amp;quot;——视觉和语言不再是两个独立的系统，而是同一个认知体系的两个维度。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的完整认知&#34;&gt;尾声：AI的&amp;quot;完整认知&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：AI在一张图片里到底&amp;quot;看&amp;quot;到了什么？&lt;/p&gt;&#xA;&lt;p&gt;在CLIP之前，AI看到的只是一堆像素的排列组合。在CLIP之后，AI看到的是一张图片和它背后的语义世界——&amp;ldquo;柴犬&amp;quot;代表一种特定品种的狗，&amp;ldquo;沙滩&amp;quot;代表一个特定的场景，&amp;ldquo;奔跑&amp;quot;代表一种动态的动作。AI不仅&amp;quot;看到&amp;quot;了这些元素，还&amp;quot;理解&amp;quot;了它们之间的关系。&lt;/p&gt;&#xA;&lt;p&gt;但CLIP并非完美。它在细粒度分类（比如区分不同品种的狗）和计数任务（比如数出图片里有几个人）上表现不佳。它对提示词非常敏感——换一个问法，答案可能完全不同。而且，CLIP的训练数据来自互联网，这意味着它不可避免地继承了互联网上的偏见和刻板印象。&lt;/p&gt;&#xA;&lt;p&gt;但无论如何，CLIP是一个里程碑。它第一次让AI真正理解了&amp;quot;图片&amp;quot;和&amp;quot;文字&amp;quot;之间的关系，不是通过死记硬背，而是通过建立语义连接。这背后隐藏着一个更深刻的启示：&lt;strong&gt;真正的智能，或许不在于某个单一能力的登峰造极，而在于不同能力之间的连接与融合&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;就像人类一样——我们之所以能理解这个世界，不是因为眼睛有多好、耳朵有多灵，而是因为视觉、听觉、语言、触觉、记忆这些不同的感知系统，在大脑中形成了一个统一的认知网络。&lt;strong&gt;AI的未来，或许也在于此&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Jia, C., et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.05918&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Alayrac, J. B., et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2204.14198&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ramesh, A., et al. (2021). Zero-Shot Text-to-Image Generation. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.12092&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
			<item>
				<title>AI的「感官」是如何连接的？——当AI同时学会看和读</title>
				<link>https://lingyu7.com/posts/ai-senses-connection-multimodal/</link>
				<pubDate>Fri, 31 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-senses-connection-multimodal/</guid>
				<description>&lt;h2 id=&#34;引言一场隐喻的看图说话&#34;&gt;引言：一场隐喻的「看图说话」&lt;/h2&gt;&#xA;&lt;p&gt;想象你在一场聚会上，有人递给你一张照片，上面画着一只橙色的猫蹲在红色的沙发上，旁边配了一行字：「一只猫在沙发上」。&lt;/p&gt;&#xA;&lt;p&gt;你看了，点了点头，觉得这没什么特别的——照片和文字对得上，很自然。&lt;/p&gt;&#xA;&lt;p&gt;但让我们停下来想一想：&lt;strong&gt;「一只猫在沙发上」这七个字，和照片中那些像素点之间，有什么本质联系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;没有。一个是由字母组成的符号序列，一个是由颜色和形状组成的光学信号。它们之间没有任何物理上的相似性。你之所以觉得「配得上」，是因为你的大脑在过去的几十年里，无数次将「看到的猫」和「听到/读到的猫」关联在一起，形成了某种跨感官的连接。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI要同时理解图像和文字，面对的就是这个根本问题：如何让两种完全不同形态的信息，在数学空间中「对上号」？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是多模态学习的核心挑战——也是近五年来AI领域最激动人心的故事之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一教ai看图说话有多难&#34;&gt;一、教AI「看图说话」，有多难？&lt;/h2&gt;&#xA;&lt;p&gt;在2021年之前，AI的视觉能力和语言能力基本上是「各玩各的」。&lt;/p&gt;&#xA;&lt;p&gt;一个图像识别模型，能从照片中识别出「猫」「沙发」「橙色」——但它只能输出这些标签，无法理解「猫蹲在沙发上」这个完整的场景描述。一个语言模型，能写出流畅的句子——但它对「猫」的理解全部来自文本，从未真正「见过」一只猫的视觉形象。&lt;/p&gt;&#xA;&lt;p&gt;两个系统各自在自己的领域里做得不错，但它们之间有一堵墙。&lt;strong&gt;这堵墙，就是「感官」之间的鸿沟。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，要打通这堵墙，需要人工标注数据集——让人类花大量时间，给每张图片写上描述文字。ImageNet数据集花了25,000人、标注了1,400万张图片，才勉强覆盖了1,000个类别。代价高昂，而且限制了AI只能在「人类已经标注过的概念」上工作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果AI只能识别人类告诉它的概念，那它永远无法超越人类的认知边界。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI的研究团队提出了一个大胆的想法：为什么不直接让AI从互联网上学习图文对应关系？互联网上有海量的图片和文字描述——虽然「质量」参差不齐，但「数量」是前所未有的。他们做了一个叫CLIP的模型，用4亿张图文对训练，结果震惊了AI界。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二clip的魔法一个巨型配对游戏&#34;&gt;二、CLIP的魔法：一个「巨型配对游戏」&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的工作原理，听起来像是一个简单的配对游戏。&lt;/p&gt;&#xA;&lt;p&gt;想象你有一大堆图片和一大堆文字描述，你的任务是把它们正确配对。你面前有N张图片和N条文字描述，你需要找出哪些图片和哪些文字是一对。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：&lt;strong&gt;训练两个「编码器」，一个看图片，一个读文字，然后把它们各自「编码」成一个数学向量（一串数字）。&lt;/strong&gt; 如果图片和文字是匹配的，让它们的向量在数学空间中「靠近」；如果不匹配，让它们「远离」。&lt;/p&gt;&#xA;&lt;p&gt;这个思路听起来很简单，但它的威力在于&lt;strong&gt;规模&lt;/strong&gt;和&lt;strong&gt;对比学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;规模&lt;/strong&gt;：4亿张图文对，覆盖了你能想象到的几乎所有视觉概念——猫、狗、汽车、建筑、食物、风景、艺术作品……互联网的多样性，在这里变成了AI的训练素材。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习&lt;/strong&gt;：每张图片不仅要和正确的文字描述配对，还要和N-1个错误的文字描述「对比」。这种「正负样本」的对比训练，迫使模型学会区分「细微的语义差异」——比如「一只猫在沙发上」和「一只狗在沙发上」的区别。&lt;/p&gt;&#xA;&lt;p&gt;训练完成后，CLIP拥有了一个神奇的能力：&lt;strong&gt;你给它一张从没见过的图片，它可以自己「猜」出这张图片的内容。&lt;/strong&gt; 比如你给它一张雪地里的哈士奇照片，它不需要看过任何标注数据，就能从文字描述列表中选出最匹配的——「雪地里的哈士奇」。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet上，CLIP的零样本准确率达到了76.2%，和传统需要人工标注数据的模型相当。这意味着什么？&lt;strong&gt;CLIP从来没有「见过」ImageNet的标注数据，却能和新数据「对上号」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三但ai真的理解了吗&#34;&gt;三、但AI真的「理解」了吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，故事似乎很完美——AI学会了同时看和读，打通了视觉和语言的壁垒。&lt;/p&gt;&#xA;&lt;p&gt;但如果你仔细看CLIP的表现，会发现一些有趣的现象。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象一：CLIP对「提示词」非常敏感。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;同样一张猫的图片，你问「这是一只猫吗？」和「这是一只家猫吗？」和「这看起来像什么动物？」，它可能给出完全不同的答案。换一个表达方式，准确率可能差10个百分点。&lt;/p&gt;&#xA;&lt;p&gt;为什么会这样？因为CLIP不是在「理解」你的问题，而是在&lt;strong&gt;匹配「你的问题文字」和「图片」在训练数据中的共现模式&lt;/strong&gt;。训练数据中「猫」和「猫的图片」经常一起出现，所以匹配度高；但「家猫」出现频率低，匹配度就低。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象二：CLIP在「没见过的场景」上表现很差。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;给CLIP一张医学X光片，问它「这是肺部感染吗？」——它可能答得一团糟。不是因为它不聪明，而是因为&lt;strong&gt;医学图像在4亿张训练数据中几乎不存在&lt;/strong&gt;。CLIP的能力边界，就是训练数据的分布边界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象三：CLIP会「作弊」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;有时候，CLIP不是通过「理解图片内容」来回答问题，而是通过&lt;strong&gt;发现文字和图片之间的统计相关性&lt;/strong&gt;。比如，一张海滩的照片，它可能不会认出「沙滩」「海浪」「太阳」这些元素，而是通过「图片整体色调偏蓝+文字中有&amp;rsquo;海滩&amp;rsquo;」这种统计捷径来「猜」答案。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个深刻的问题：&lt;strong&gt;CLIP真的「理解」了图像和文字之间的联系吗？还是只是发现了一个巨大的统计巧合？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四统计共现--语义理解&#34;&gt;四、统计共现 ≠ 语义理解&lt;/h2&gt;&#xA;&lt;p&gt;让我们用一个简单的思想实验来理解这个问题。&lt;/p&gt;&#xA;&lt;p&gt;假设你是一个从小生活在山洞里的外星人，从未见过外面的世界。有一天，你被带到地面，看到了一幅画面：太阳升起，鸟儿鸣叫。&lt;/p&gt;&#xA;&lt;p&gt;这时，有人告诉你两个词：「太阳」和「鸟」。&lt;/p&gt;&#xA;&lt;p&gt;你很快就学会了：「太阳」这个词总是和「发光的圆形物体」一起出现；「鸟」这个词总是和「有翅膀的飞行动物」一起出现。你能够完美地完成配对任务——看到「太阳」的图片，你选出「太阳」这个词；看到「鸟」的图片，你选出「鸟」这个词。&lt;/p&gt;&#xA;&lt;p&gt;但你真的「理解」太阳和鸟的区别吗？你知道太阳是恒星、鸟是动物吗？你知道太阳带来光和热、鸟会筑巢觅食吗？你不知道。&lt;strong&gt;你只是发现了统计上的共现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;CLIP就是这样。它不是「理解」了图片和文字之间的关系，而是&lt;strong&gt;学会了统计共现模式&lt;/strong&gt;——在4亿张图文对中，某些文字和某些图片特征「经常一起出现」，所以它记住了这些模式。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是在「钻牛角尖」——但结果确实好用，不是吗？&lt;/p&gt;&#xA;&lt;p&gt;是的，而且这正是CLIP的伟大之处。&lt;strong&gt;它证明了：当数据量足够大时，统计共现可以逼近甚至超越人类标注的效果。&lt;/strong&gt; 这不是AI的缺陷，而是AI的「另一种智能」——它不追求「理解」，只追求「预测」。&lt;/p&gt;&#xA;&lt;p&gt;但这也告诉我们：&lt;strong&gt;AI的「感官连接」和人类的感官连接，本质上是不同的。&lt;/strong&gt; 人类的连接是「体验式」的——你看到一只猫，同时听到「猫」这个声音，你是在一个完整的感知-行动循环中建立连接。AI的连接是「统计式」的——它只是从海量数据中提取了「像素排列」和「文字序列」之间的相关性。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五clip之后多模态ai的下一站&#34;&gt;五、CLIP之后：多模态AI的下一站&lt;/h2&gt;&#xA;&lt;p&gt;CLIP在2021年横空出世后，彻底改变了多模态AI的格局。它不再是「视觉模型」或「语言模型」，而是「视觉-语言模型」——两者的边界开始模糊。&lt;/p&gt;&#xA;&lt;p&gt;后续的工作迅速跟进：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BLIP&lt;/strong&gt; 和 &lt;strong&gt;BLIP-2&lt;/strong&gt; 试图解决CLIP的「数据质量问题」——通过自动生成高质量的图文描述，减少互联网噪声的影响。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;LLaVA&lt;/strong&gt; 将CLIP的视觉编码器和大语言模型直接连接，让AI不仅能看到图片，还能「谈论」它看到的内容。你问它「这张图片里有什么？」它可以用完整的句子回答你。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;DALL·E&lt;/strong&gt; 和 &lt;strong&gt;Stable Diffusion&lt;/strong&gt; 更是逆向操作——不是从图片到文字，而是从文字到图片。你说「一只橙色猫在红色沙发上」，它就能生成一张图片。&lt;/p&gt;&#xA;&lt;p&gt;这些模型有一个共同点：&lt;strong&gt;它们都是CLIP的继承者。&lt;/strong&gt; CLIP的视觉编码器成为了「视觉的通用语言」，后续模型只需要学会「翻译」这种语言，就能完成各种视觉-语言任务。&lt;/p&gt;&#xA;&lt;p&gt;但问题依旧存在：&lt;strong&gt;统计共现和语义理解之间的鸿沟，仍然没有被真正跨越。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个真正的「感官连接」——像人类那样，看到一只猫，同时「理解」猫是什么、猫的行为、猫与人的关系——需要的不是更多的数据，而是&lt;strong&gt;更深刻的认知架构&lt;/strong&gt;。它需要感知-行动循环，需要世界模型，需要因果推理。&lt;/p&gt;&#xA;&lt;p&gt;CLIP告诉我们：&lt;strong&gt;统计共现可以走很远，但「理解」是另一回事。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语一个开始不是终点&#34;&gt;结语：一个开始，不是终点&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那张照片——「一只猫在沙发上」。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
