<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI基础理论 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E5%9F%BA%E7%A1%80%E7%90%86%E8%AE%BA/</link>
		<description>Recent content in AI基础理论 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 25 Jul 2026 02:29:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E5%9F%BA%E7%A1%80%E7%90%86%E8%AE%BA/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的「遗忘」艺术——为什么学会丢掉信息，才是真正的智能</title>
				<link>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</link>
				<pubDate>Sat, 25 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</guid>
				<description>&lt;h2 id=&#34;引言你的大脑是一个遗忘大师&#34;&gt;引言：你的大脑，是一个&amp;quot;遗忘大师&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;我们来做一个小实验。&lt;/p&gt;&#xA;&lt;p&gt;回想一下，上周三的午饭你吃了什么？如果你能立刻回答出来，那你属于少数人。大多数人需要想一会儿，甚至根本想不起来。&lt;/p&gt;&#xA;&lt;p&gt;但这不是问题——&lt;strong&gt;这是优点。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你每天摄入海量的信息：看到的、听到的、闻到的、触摸到的、思考到的。如果全部记住，你的大脑会迅速被撑爆。所以你的大脑做了一个极其聪明的选择：&lt;strong&gt;只保留&amp;quot;可能有用&amp;quot;的信息，扔掉其余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以准确说出自己家的地址，但记不住昨天路过的那家便利店门口垃圾桶的颜色。&lt;/p&gt;&#xA;&lt;p&gt;你可以认出朋友的脸，但记不住他上周三穿的是什么颜色的袜子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你之所以智能，不是因为你会记住，而是因为你学会了遗忘。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的道理，其实是AI领域最深刻的理论之一。它有一个名字，叫&lt;strong&gt;信息瓶颈（Information Bottleneck）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一信息瓶颈是什么一个抄笔记的隐喻&#34;&gt;一、信息瓶颈是什么？——一个&amp;quot;抄笔记&amp;quot;的隐喻&lt;/h2&gt;&#xA;&lt;p&gt;想象你在上数学课。&lt;/p&gt;&#xA;&lt;p&gt;老师讲了一道很复杂的微积分题，你需要在有限的时间内记笔记。&lt;/p&gt;&#xA;&lt;p&gt;你有两种记法：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：逐字逐句地记。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;老师说的每一个字你都记下来——&amp;ldquo;好，我们来看这道题，第一步，先求导……&amp;ldquo;你连老师的语气词都没放过。下课后，你的笔记本比老师的教案还厚。&lt;/p&gt;&#xA;&lt;p&gt;但问题是，你记了这么多，&lt;strong&gt;真正有用的信息被淹没在大量废话里了。&lt;/strong&gt; 考试的时候，你根本找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：只记关键步骤。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你快速判断：这道题的核心是&amp;quot;链式法则&amp;rdquo;。你只记下关键公式和两个关键步骤，其他的都忽略。笔记只有三行，但每一行都是精华。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论要回答的，就是这个问题：如何找到&amp;quot;最优的笔记&amp;rdquo;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它正式的定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;给定输入X（老师讲的全部内容）和输出Y（考试要考的知识点），找到一个压缩表示Z（你的笔记），使得：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Z尽可能小（压缩率高，笔记简洁）&lt;/li&gt;&#xA;&lt;li&gt;Z尽可能保留关于Y的信息（预测能力强，考试能拿分）&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;这两个目标相互矛盾。&lt;/strong&gt; 笔记越简洁，丢失的信息越多，预测能力可能下降；笔记越详细，预测能力越强，但压缩率差。&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论的核心贡献是：&lt;strong&gt;它给出了这个权衡的数学最优解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个公式道尽智能的本质&#34;&gt;二、一个公式，道尽智能的本质&lt;/h2&gt;&#xA;&lt;p&gt;信息瓶颈的核心公式，其实只有一行：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最小化：I(X;Z) — β × I(Z;Y)&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不要被公式吓到——它表达的是一种我们每天都在做的直觉判断。&lt;/p&gt;&#xA;&lt;p&gt;让我们拆解一下：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(X;Z)&lt;/strong&gt;：你的笔记（Z）包含的原始信息（X）的量。这个值越小，说明你的笔记越&amp;quot;压缩&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(Z;Y)&lt;/strong&gt;：你的笔记（Z）能预测考试内容（Y）的能力。这个值越大，说明你的笔记越&amp;quot;有用&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;β&lt;/strong&gt;：一个调节旋钮，控制你更看重&amp;quot;简洁&amp;quot;还是&amp;quot;准确&amp;quot;。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个公式的哲学是：最优的智能，不是&amp;quot;记住最多信息&amp;quot;，而是&amp;quot;用最少的信息，保留最多的价值&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;β=0时，你只关心压缩，笔记只有一行&amp;quot;今天上了数学课&amp;quot;——考试肯定挂。&lt;/p&gt;&#xA;&lt;p&gt;β=很大时，你只关心预测，笔记有几万字——信息过载，考试时找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;β=最优值时，你的笔记刚好记下关键点——考试时思路清晰，效率最高。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;最优值&amp;quot;对应的笔记，就是信息瓶颈理论所说的&amp;quot;最优表征&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三深度学习本质上就在做这件事&#34;&gt;三、深度学习，本质上就在做这件事&lt;/h2&gt;&#xA;&lt;p&gt;2015年，信息论专家纳夫塔利·蒂什比（Naftali Tishby）提出了一个大胆的观点：&lt;strong&gt;深度神经网络训练的过程，本质上就是在解信息瓶颈问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他做了一个实验，让一个神经网络在手写数字识别任务上训练，然后观察每一层神经元在训练过程中的变化。&lt;/p&gt;&#xA;&lt;p&gt;结果非常有趣：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：拟合（Fitting）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;刚开始训练时，网络在&amp;quot;记住&amp;quot;训练数据。每一层的神经元都在努力获取关于输入X的信息——I(X;Z)迅速上升。&lt;/p&gt;&#xA;&lt;p&gt;这就像你刚开始听课时的状态——拼命记笔记，生怕漏掉一个字。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：压缩（Compression）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;训练到一定阶段后，网络开始&amp;quot;遗忘&amp;quot;。它不再关注输入中的无关细节，而是只保留对分类有用的特征。&lt;/p&gt;&#xA;&lt;p&gt;I(X;Z)下降，但I(Z;Y)保持不变甚至上升——&lt;strong&gt;你丢掉了废话，留下了精华。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是深度学习成功的秘密：它不是在学习&amp;quot;记住所有东西&amp;quot;，而是在学习&amp;quot;忘记不重要的东西&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有经过充分训练的AI，就像那个逐字逐句记笔记的学生——它记住了训练数据的每一个细节，但换一个场景就不知所措了（这就是我们说的&amp;quot;过拟合&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;一个训练充分的AI，就像那个只记关键点的学生——它抓住了问题的本质，即使面对新情况也能灵活应对（这就是&amp;quot;泛化能力&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论告诉我们：泛化能力，本质上就是压缩能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么忘记比记住更难&#34;&gt;四、为什么&amp;quot;忘记&amp;quot;比&amp;quot;记住&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然压缩这么重要，那让AI使劲压缩不就行了？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;没那么简单。因为压缩的前提是：你知道什么该保留，什么该丢弃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个刚出生的婴儿，分不清&amp;quot;妈妈的脸&amp;quot;和&amp;quot;天花板的颜色&amp;quot;哪个更重要。他需要大量的学习和经验，才能建立起&amp;quot;哪些信息值得保留&amp;quot;的判断力。&lt;/p&gt;&#xA;&lt;p&gt;同样，AI在训练初期也不知道什么特征重要。它需要反复试错，才能学会&amp;quot;压缩&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么深度学习需要海量数据——不是为了让AI记住更多，而是为了让AI学会该忘记什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论揭示了另一个惊人的事实：&lt;strong&gt;最优的压缩，会自然地出现在神经网络的不同层之间。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果你把神经网络看成一个流水线：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第一层：处理最原始的信息（像素级别的颜色、边缘）&lt;/li&gt;&#xA;&lt;li&gt;中间层：开始提取有意义的模式（形状、纹理）&lt;/li&gt;&#xA;&lt;li&gt;最后一层：只保留最&amp;quot;有用&amp;quot;的特征（&amp;ldquo;这是一只猫&amp;quot;的判断）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;每一层都在做一次信息瓶颈——压缩输入，保留对下一层有用的信息。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI真的「理解」文字吗？——符号接地问题的百年追问</title>
				<link>https://lingyu7.com/posts/symbol-grounding-problem/</link>
				<pubDate>Fri, 24 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/symbol-grounding-problem/</guid>
				<description>&lt;h2 id=&#34;引言你和一个ai的对话和真正的理解有多远&#34;&gt;引言：你和一个AI的对话，和真正的「理解」有多远？&lt;/h2&gt;&#xA;&lt;p&gt;假设你和一个AI聊了五分钟。&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;猫会抓老鼠吗？&amp;rdquo;&#xA;AI答：&amp;ldquo;会的，猫是老鼠的天敌，猫科动物的捕猎本能很强。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;那猫为什么喜欢玩毛线球？&amp;rdquo;&#xA;AI答：&amp;ldquo;因为毛线球的滚动和跳跃模拟了老鼠的运动轨迹，触发了猫的捕猎本能。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你说：&amp;ldquo;帮我写一个关于猫和老鼠的童话故事。&amp;rdquo;&#xA;AI很快写了一个汤姆和杰瑞式的有趣故事。&lt;/p&gt;&#xA;&lt;p&gt;看起来，这个AI很理解&amp;quot;猫&amp;quot;和&amp;quot;老鼠&amp;quot;是什么，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但如果我问你：&lt;strong&gt;这个AI见过猫吗？摸过猫吗？听过猫叫吗？被猫抓过吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：没有。&lt;/p&gt;&#xA;&lt;p&gt;它只在&amp;quot;文字的世界&amp;quot;里存在。它读过海量的文本，知道&amp;quot;猫&amp;quot;和&amp;quot;毛线球&amp;quot;、&amp;ldquo;喵喵叫&amp;rdquo;、&amp;ldquo;抓老鼠&amp;quot;这些词经常一起出现。但它从未——永远无法——真正地&amp;quot;看到&amp;quot;一只猫从窗台上跳下来。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;那么问题来了：一个从未接触过真实世界的系统，能真正&amp;quot;理解&amp;quot;关于世界的语言吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个问题，不是哲学家的玄想。它是一个被正式命名的科学问题，叫&lt;strong&gt;符号接地问题&lt;/strong&gt;。它已经存在了三十多年，到今天依然没有定论。&lt;/p&gt;&#xA;&lt;p&gt;而2026年的AI发展，让这个问题变得更加紧迫。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一符号接地问题一个词典里的死循环&#34;&gt;一、符号接地问题：一个&amp;quot;词典里的死循环&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;1990年，认知科学家史蒂文·哈纳德（Stevan Harnad）提出了这个问题。&lt;/p&gt;&#xA;&lt;p&gt;他用一个简单的比喻来说明：&lt;/p&gt;&#xA;&lt;p&gt;想象你是一个外星人，来到地球。你捡到一本英汉词典，想通过它学习中文。你翻开第一页，看到&amp;quot;猫&amp;quot;这个字，旁边的解释是：&amp;ldquo;一种小型哺乳动物，善捕鼠。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你不懂&amp;quot;哺乳动物&amp;quot;是什么，于是查这个词——&amp;ldquo;哺乳动物：用乳汁哺育幼崽的脊椎动物。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你不懂&amp;quot;脊椎动物&amp;quot;是什么，又往下查——&amp;ldquo;脊椎动物：有脊柱的动物。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你不懂&amp;quot;脊柱&amp;quot;是什么，再查——&amp;ldquo;脊柱：脊椎动物的中轴骨骼。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你发现了吗？你陷入了一个死循环。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;每个词的定义，都是用其他词来写的。你翻来翻去，永远在符号的圈子里打转，永远找不到一个词和一个&amp;quot;真实世界的东西&amp;quot;之间的直接连接。&lt;/p&gt;&#xA;&lt;p&gt;哈纳德说，这就是纯符号系统面临的根本困境：&lt;strong&gt;符号之间的无限循环。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类之所以能跳出这个循环，是因为我们有身体、有感官——我们见过猫、摸过猫、被猫抓过、听过猫打呼噜。这些非符号的感官经验，为&amp;quot;猫&amp;quot;这个符号提供了&amp;quot;接地&amp;quot;（grounding）的基础。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;而一个纯文本的AI，本质上就是那个外星人。&lt;/strong&gt; 它只拥有词典，没有身体，没有感官，没有真实世界的体验。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二哈纳德的三层方案从感知到符号的阶梯&#34;&gt;二、哈纳德的三层方案：从感知到符号的阶梯&lt;/h2&gt;&#xA;&lt;p&gt;哈纳德没有只提出问题，他给出了一个解决方案的框架，分三层：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一层：图像式表征（iconic representations）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是最底层，直接与感知经验对应。你看到一只猫的视觉形象，听到猫的叫声，感受到猫毛的柔软——这些都是&amp;quot;图像式表征&amp;quot;。它们不是抽象符号，而是对感官输入的&amp;quot;模拟&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二层：类别表征（categorical representations）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你见过很多不同的猫：橘猫、黑猫、白猫、胖猫、瘦猫、长毛猫、短毛猫……虽然它们各不相同，但你能把它们归为&amp;quot;猫&amp;quot;这个类别。这就是&amp;quot;类别表征&amp;quot;——从具体感知到抽象概念的中间层。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三层：符号表征（symbolic representations）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;基于类别，你构建了关于&amp;quot;猫&amp;quot;的知识体系：&amp;ldquo;猫是哺乳动物&amp;rdquo;、&amp;ldquo;猫会抓老鼠&amp;rdquo;、&amp;ldquo;猫的平均寿命是12-15年&amp;rdquo;……这一层就是我们通常说的&amp;quot;知识&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;哈纳德的核心观点是：符号必须从下往上、从感知到类别再到符号，逐层接地，才能获得真正的意义。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果只有最上层的符号层（就像现在的LLM），没有下层的感知基础，符号就是&amp;quot;空转&amp;quot;的——它们彼此连接，但从未触达真实世界。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三争议ai到底是随机鹦鹉还是真的有理解&#34;&gt;三、争议：AI到底是&amp;quot;随机鹦鹉&amp;quot;还是真的有理解？&lt;/h2&gt;&#xA;&lt;p&gt;这个问题在AI界引发了激烈的争论，形成了三种主要立场。&lt;/p&gt;&#xA;&lt;h3 id=&#34;立场一随机鹦鹉论&#34;&gt;立场一：「随机鹦鹉」论&lt;/h3&gt;&#xA;&lt;p&gt;2020年，语言学家艾米丽·本德（Emily Bender）和她的同事提出了一个尖锐的批评：&lt;strong&gt;大语言模型只是在&amp;quot;随机鹦鹉&amp;quot;——它们能模仿语言的模式，但并不真正理解内容。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像一个会说话的鹦鹉，它能模仿你说&amp;quot;你好&amp;quot;，但它并不理解&amp;quot;你好&amp;quot;是什么意思。LLM只是在海量文本中学习到&amp;quot;猫&amp;quot;和&amp;quot;老鼠&amp;quot;经常一起出现，所以当你说&amp;quot;猫&amp;quot;的时候，它知道下一个词可能是&amp;quot;老鼠&amp;quot;——但这不等于它&amp;quot;理解&amp;quot;了猫和老鼠的关系。&lt;/p&gt;&#xA;&lt;h3 id=&#34;立场二肯定论llm确实有某种理解&#34;&gt;立场二：肯定论——LLM确实有某种理解&lt;/h3&gt;&#xA;&lt;p&gt;另一派研究者认为，LLM在训练中构建了关于世界的&amp;quot;心理模型&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;支持这一观点的证据在增加：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;2023年，Anthropic的研究发现，LLM的内部神经元确实编码了具体的概念——比如&amp;quot;金门大桥&amp;quot;的神经元，在提到金门大桥时会激活，不管语境是&amp;quot;金门大桥在哪&amp;quot;还是&amp;quot;金门大桥有多长&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;更近期的研究表明，LLM能进行推理、类比、计划——这些能力很难用&amp;quot;随机鹦鹉&amp;quot;来解释。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;立场三中间路线有局限的理解&#34;&gt;立场三：中间路线——&amp;ldquo;有局限的理解&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;目前最受支持的立场是中间路线：&lt;strong&gt;LLM具备&amp;quot;推理语义&amp;quot;——理解符号之间的逻辑关系；但缺乏完整的&amp;quot;指称语义&amp;quot;——符号与真实世界对象的对应。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;简单说：AI知道&amp;quot;猫&amp;quot;和&amp;quot;毛线球&amp;quot;之间的概念关系，但它不知道&amp;quot;猫&amp;quot;这个符号对应着一个真实的、毛茸茸的、会呼噜呼噜叫的生物。&lt;/p&gt;&#xA;&lt;p&gt;这就像一个人从物理课本上学会了所有关于&amp;quot;火&amp;quot;的知识——火的化学方程式、燃烧的条件、火的温度——但他从未真正见过火、靠近过火、被火烫过。你说他&amp;quot;理解&amp;quot;火吗？理解了一些。但和真正摸过火的人比，他的理解是&amp;quot;残缺的&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四多模态是答案吗当ai开始看世界&#34;&gt;四、多模态是答案吗？——当AI开始&amp;quot;看&amp;quot;世界&lt;/h2&gt;&#xA;&lt;p&gt;如果问题的根源在于AI只有文字没有感官，那么一个自然的解决方案就是：&lt;strong&gt;给AI装上&amp;quot;眼睛&amp;quot;和&amp;quot;耳朵&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就引出了多模态模型——同时处理文本、图像、音频、视频的AI模型。&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI的CLIP模型首次展示了语言和视觉的联合学习。CLIP在4亿张图片-文字对上进行训练，学会了将&amp;quot;猫&amp;quot;这个单词和猫的图片联系起来。&lt;/p&gt;&#xA;&lt;p&gt;2023年之后的GPT-4V、Gemini、以及2025-2026年的多模态模型，进一步将这种能力推向了新的高度。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;问题是：多模态解决了符号接地问题吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;部分解决，但没有完全解决。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;多模态确实让AI多了一层&amp;quot;接地&amp;quot;——&amp;ldquo;猫&amp;quot;这个符号不再只是和其他文本符号关联，还和猫的视觉特征关联。但这仍然不是&amp;quot;真正的接地&amp;rdquo;：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;AI看到的图片是二维的，不是真实的猫&lt;/li&gt;&#xA;&lt;li&gt;AI没有触觉、没有嗅觉、没有身体与世界的互动&lt;/li&gt;&#xA;&lt;li&gt;AI没有&amp;quot;被猫抓过&amp;quot;的痛感，没有&amp;quot;猫毛蹭到腿上&amp;quot;的触感&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;真正的接地，可能需要具身——一个能感知、能行动、能与环境互动的物理身体。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正是具身智能（Embodied AI）研究的方向。2024-2026年，具身智能领域取得了显著进展：机器人学会了在复杂环境中导航、操作物体、与人类协作。但距离&amp;quot;拥有真正的感知经验&amp;quot;，还有很长的路要走。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI不需要你教它——它自己就从例子中学会了，甚至连DNA都不放过</title>
				<link>https://lingyu7.com/posts/ai%E4%B8%8D%E9%9C%80%E8%A6%81%E4%BD%A0%E6%95%99%E5%AE%83-%E5%AE%83%E8%87%AA%E5%B7%B1%E5%B0%B1%E4%BB%8E%E4%BE%8B%E5%AD%90%E4%B8%AD%E5%AD%A6%E4%BC%9A%E4%BA%86-%E7%94%9A%E8%87%B3%E8%BF%9Edna%E9%83%BD%E4%B8%8D%E6%94%BE%E8%BF%87/</link>
				<pubDate>Wed, 22 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai%E4%B8%8D%E9%9C%80%E8%A6%81%E4%BD%A0%E6%95%99%E5%AE%83-%E5%AE%83%E8%87%AA%E5%B7%B1%E5%B0%B1%E4%BB%8E%E4%BE%8B%E5%AD%90%E4%B8%AD%E5%AD%A6%E4%BC%9A%E4%BA%86-%E7%94%9A%E8%87%B3%E8%BF%9Edna%E9%83%BD%E4%B8%8D%E6%94%BE%E8%BF%87/</guid>
				<description>&lt;h2 id=&#34;引言你教ai的方式可能彻底错了&#34;&gt;引言：你教AI的方式，可能彻底错了&lt;/h2&gt;&#xA;&lt;p&gt;想象你要教一个朋友认识一种新水果。&lt;/p&gt;&#xA;&lt;p&gt;你拿出了一个芒果，说：&amp;ldquo;这是芒果。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;然后你拿出第二个芒果，说：&amp;ldquo;这也是芒果。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;到第三个的时候，你朋友自己就学会了——&amp;ldquo;我懂了，芒果是这种黄色的、有甜味的东西。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这不神奇。人类每天都在做这种事。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但AI也能做同样的事，而且方式比人类更不可思议。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你给它几个例子，它就能&amp;quot;学会&amp;quot;一个新任务——不用重新训练，不用调整参数，不用更新模型权重。你只是把几个例子放在它的&amp;quot;输入框&amp;quot;里，它就能按照你的意图去执行。&lt;/p&gt;&#xA;&lt;p&gt;这种能力，叫做&lt;strong&gt;上下文学习（In-Context Learning, ICL）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;你可能会想：&amp;ldquo;这有什么了不起的？不就是让AI记住几个例子然后模仿吗？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;但问题在于——&lt;strong&gt;没有人知道它为什么能做到。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2020年GPT-3横空出世时，1750亿参数规模让ICL能力&amp;quot;涌现&amp;quot;了。但六年过去了，我们对这个问题的理解，才刚刚开始触及核心。&lt;/p&gt;&#xA;&lt;p&gt;而2026年的一项新发现，把这个问题推向了更深的层次：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;ICL不仅仅是人类语言的专属能力。它在DNA序列模型上，同样涌现了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一什么是上下文学习它比你想象的更奇怪&#34;&gt;一、什么是&amp;quot;上下文学习&amp;quot;？——它比你想象的更奇怪&lt;/h2&gt;&#xA;&lt;p&gt;先理解ICL到底是什么。&lt;/p&gt;&#xA;&lt;p&gt;想象你是一个大模型，被训练来&amp;quot;预测下一个词&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;训练时，你读了整个互联网——从维基百科到Reddit论坛，从学术论文到菜谱。你学会的是：&lt;strong&gt;给定前面的话，猜出后面的话最可能是什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;然后有一天，有人给你看了一段话：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;把英文翻译成中文：&#xA;hello -&amp;gt; 你好&#xA;good morning -&amp;gt; 早上好&#xA;I love AI -&amp;gt; &amp;quot;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;你还记得吗？你从来没被专门训练过&amp;quot;翻译任务&amp;rdquo;。你只是被训练来&amp;quot;预测下一个词&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但你的内部机制做了一件奇怪的事：&lt;strong&gt;你从给出的例子中&amp;quot;提取&amp;quot;了一个模式，然后把&amp;quot;翻译任务&amp;quot;转化成了&amp;quot;预测下一个词&amp;quot;任务。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你看到三个英文-中文配对后，自动推断出：哦，这个上下文的规则是&amp;quot;把英文翻译成中文&amp;quot;。所以当看到&amp;quot;I love AI&amp;quot;时，你预测下一个词是&amp;quot;我爱人工智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是ICL——不需要额外训练，不需要梯度更新，仅仅通过几个例子，模型就学会了新任务。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;听起来很神奇，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但更神奇的事情是：&lt;strong&gt;这个能力不是任何人有意识设计出来的。&lt;/strong&gt; 没有人写代码说&amp;quot;让GPT-3学会从例子中学习&amp;quot;。它只是被训练来预测下一个词，然后这个能力就自己涌现了。&lt;/p&gt;&#xA;&lt;p&gt;就像你种了一棵苹果树，结果它不仅长了苹果，还长出了柠檬——你完全不确定它是怎么做到的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二传统的解释icl是语言的副产品&#34;&gt;二、传统的解释：ICL是语言的&amp;quot;副产品&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;对于ICL为什么会出现，最初的主流解释是：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;ICL是语言模型在语言数据上训练的&amp;quot;副产品&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;逻辑是这样的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;人类语言中充满了&amp;quot;类比&amp;quot;和&amp;quot;模式&amp;quot;——比如我们经常会说&amp;quot;就像……一样&amp;quot;、&amp;ldquo;例如……&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;语言模型在训练时见过了无数这样的例子&lt;/li&gt;&#xA;&lt;li&gt;所以它学会了&amp;quot;从例子中推测规则&amp;quot;的通用能力&lt;/li&gt;&#xA;&lt;li&gt;这个能力被&amp;quot;迁移&amp;quot;到了所有任务上&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这个解释听起来很合理，对吧？甚至有点&amp;quot;理所当然&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但2026年，这个解释被彻底推翻了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三颠覆性的发现icl在dna模型上同样涌现&#34;&gt;三、颠覆性的发现：ICL在DNA模型上同样涌现&lt;/h2&gt;&#xA;&lt;p&gt;Johns Hopkins大学的研究团队做了一个实验。&lt;/p&gt;&#xA;&lt;p&gt;他们选择了Evo2——一个被训练来预测DNA序列的模型。DNA序列由A、C、G、T四个碱基组成，像一本用四个字母写成的天书。&lt;/p&gt;&#xA;&lt;p&gt;Evo2的训练目标很简单：给定一段DNA序列，预测下一个碱基是什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;注意：Evo2从来没有见过任何人类语言数据。&lt;/strong&gt; 它不知道&amp;quot;你好&amp;quot;是什么意思，没见过&amp;quot;翻译任务&amp;quot;，也没读过&amp;quot;例子&amp;quot;这个概念的任何一个字。&lt;/p&gt;&#xA;&lt;p&gt;但研究团队做了以下测试：&lt;/p&gt;&#xA;&lt;p&gt;他们给Evo2看一些&amp;quot;例子&amp;quot;——比如，给出一段DNA序列，然后在末尾加上对应的功能标注。然后再给一段新的DNA序列，问Evo2：&amp;ldquo;根据前面的例子，这段序列的功能标注应该是什么？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;结果：Evo2展现出了和GPT-3完全一样的ICL模式——随示例数量增加，性能稳定提升。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;DNA模型，没有接触过任何人类语言，没有&amp;quot;类比&amp;quot;概念，没有&amp;quot;例子&amp;quot;这个训练数据——但它仍然学会了&amp;quot;从例子中学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个发现彻底改变了我们对ICL的理解：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;ICL不是人类语言的副产品。&#xA;ICL不是&amp;quot;类比推理&amp;quot;的产物。&#xA;ICL甚至不是&amp;quot;文本&amp;quot;的专属能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;ICL是——当一个模型被训练预测足够复杂的序列数据中的下一个元素时，自然涌现的通用能力。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
