<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI理解 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E7%90%86%E8%A7%A3/</link>
		<description>Recent content in AI理解 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Fri, 04 Sep 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E7%90%86%E8%A7%A3/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI真的&#39;理解&#39;世界吗？——大模型内部的世界模型假说</title>
				<link>https://lingyu7.com/posts/does-ai-really-understand-world-model-hypothesis/</link>
				<pubDate>Fri, 04 Sep 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-really-understand-world-model-hypothesis/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AI为什么能回答&amp;quot;如果一个杯子从桌子上掉下来会怎样&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;它没有见过杯子掉下来，没有学过&amp;quot;杯子掉落的物理公式&amp;quot;，甚至没有专门接受过&amp;quot;回答物体掉落问题&amp;quot;的训练——但它能给出一个合理的答案：杯子会摔碎。&lt;/p&gt;&#xA;&lt;p&gt;它怎么做到的？&lt;/p&gt;&#xA;&lt;p&gt;更奇怪的是：你问AI&amp;quot;如果地球突然停止自转，会发生什么？&amp;quot;——它也能给出一个像模像样的分析。大气层会因为惯性继续运动，海洋会形成滔天巨浪，地壳会因为巨大的应力而破裂……&lt;/p&gt;&#xA;&lt;p&gt;这听起来简直不可思议。一个没有身体、没有视觉、没有触觉的AI，是怎么知道&amp;quot;杯子掉下来会摔碎&amp;quot;这种物理常识的？&lt;/p&gt;&#xA;&lt;p&gt;有人会说：&amp;ldquo;因为它读过很多书，书里写了杯子掉下来会碎。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;但问题是——训练数据里不可能包含所有可能发生的情况。AI读过的书里，可能写的是&amp;quot;杯子掉在水泥地上碎了&amp;quot;，但它能推理出&amp;quot;杯子掉在软垫上不会碎&amp;quot;——这是它从来没见过的情况。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这种&amp;quot;超出训练数据之外的推理能力&amp;quot;，从何而来？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个问题，引出了近年来AI研究中一个最迷人、也最深刻的假说——&lt;strong&gt;世界模型假说&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai不是鹦鹉它在构建一个微缩世界&#34;&gt;一、AI不是&amp;quot;鹦鹉&amp;quot;，它在构建一个&amp;quot;微缩世界&amp;quot;&lt;/h2&gt;&#xA;&lt;h3 id=&#34;三个无法用背诵解释的现象&#34;&gt;三个无法用&amp;quot;背诵&amp;quot;解释的现象&lt;/h3&gt;&#xA;&lt;p&gt;先来看几个实验现象。这些现象让研究者越来越确信：AI不只是在&amp;quot;背台词&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象一：物理推理&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究者给AI一个场景：&amp;ldquo;桌子上放着一个杯子，桌子的左边有一个盘子。一个人推了一下桌子，杯子会朝哪个方向运动？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;AI不仅能回答&amp;quot;杯子会向左移动，最终掉下桌子&amp;quot;，还能根据不同的推力大小、桌子材质等条件，给出不同的预测。&lt;/p&gt;&#xA;&lt;p&gt;但如果只是&amp;quot;背数据&amp;quot;，训练文本里怎么可能有&amp;quot;每一个可能的推桌子角度和力度下杯子会怎么运动&amp;quot;的描述？不存在这样的文本。AI得出的结论，只能是它自己&amp;quot;推理&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象二：心智理论（Theory of Mind）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是一个更令人震惊的实验：研究者给AI讲了一个故事——&amp;ldquo;小明把巧克力放在抽屉里，然后出去玩了。在小明不在的时候，妈妈把巧克力从抽屉里拿了出来，放进了冰箱。小明回来后，他会去哪里找巧克力？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;AI正确地回答：&amp;ldquo;小明的抽屉。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;请注意，这里的关键是——AI必须理解&amp;quot;小明不知道巧克力被移动了&amp;quot;这个事实，然后基于&amp;quot;小明的信念&amp;quot;而非&amp;quot;客观事实&amp;quot;来做出预测。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;读心&amp;quot;能力，意味着AI不仅仅是在处理语言，而是在构建一个关于&amp;quot;他人心智状态&amp;quot;的内部模型。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象三：反事实推理&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;如果当年没有发现万有引力，物理学现在会是什么样子？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个问题没有标准答案，任何人都无法从书本上&amp;quot;背&amp;quot;出来。但AI能给出一个看似合理的推演——牛顿力学体系可能被替代、间接观测可能更早发展、相对论可能提前出现……&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;反事实&amp;quot;能力，意味着AI内部有一个&amp;quot;世界运行规则&amp;quot;的模型，然后在这个模型上进行&amp;quot;模拟&amp;quot;——就像人类在脑海中&amp;quot;想象&amp;quot;另一种可能性一样。&lt;/p&gt;&#xA;&lt;h3 id=&#34;从背诵到建模的认知飞跃&#34;&gt;从&amp;quot;背诵&amp;quot;到&amp;quot;建模&amp;quot;的认知飞跃&lt;/h3&gt;&#xA;&lt;p&gt;这三个现象指向一个共同的结论：&lt;strong&gt;AI在训练过程中，不只是学习了&amp;quot;下一个词是什么&amp;quot;，而是构建了一个关于世界的内部表征——一个压缩的、抽象的、可预测的&amp;quot;世界模型&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个模型不是被任何人&amp;quot;写进去&amp;quot;的，而是在海量文本的统计规律中&amp;quot;涌现&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;就像一个人读了几千本侦探小说后，即使没有学过侦探学，也能推断出&amp;quot;死者旁边的血迹应该是什么形状&amp;quot;——他构建了一个关于&amp;quot;犯罪现场&amp;quot;的隐式模型。AI也是一样，它读了几万亿字的文本，从这些文本中，它&amp;quot;学会了&amp;quot;世界是如何运作的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二ai的世界模型长什么样五层结构&#34;&gt;二、AI的&amp;quot;世界模型&amp;quot;长什么样？——五层结构&lt;/h2&gt;&#xA;&lt;p&gt;世界模型不是单一的、扁平的&amp;quot;知识库&amp;quot;，而是一个&lt;strong&gt;分层的、多维度的内部表征系统&lt;/strong&gt;。我们可以把它想象成一座五层大楼：&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一层物理世界模型万物有物理&#34;&gt;第一层：物理世界模型——&amp;ldquo;万物有物理&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这是最底层，也是最基础的。它包含了：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;物体和空间的关系（&amp;ldquo;杯子在桌子上&amp;quot;意味着杯子被桌子支撑着）&lt;/li&gt;&#xA;&lt;li&gt;物理规律（&amp;ldquo;水往低处流&amp;quot;&amp;ldquo;重的物体会下沉&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;因果关系（&amp;ldquo;推一下，物体会动&amp;quot;&amp;ldquo;摔一下，易碎品会碎&amp;rdquo;）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这一层让AI能够理解&amp;quot;把砖头扔进水里&amp;quot;和&amp;quot;把羽毛扔进水里&amp;quot;的结果为什么不同——即使它没有见过真实的砖头和羽毛。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二层生物世界模型生命有规律&#34;&gt;第二层：生物世界模型——&amp;ldquo;生命有规律&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这一层包括：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;生命的基本特征（生长、繁殖、死亡）&lt;/li&gt;&#xA;&lt;li&gt;生态系统（捕食关系、食物链）&lt;/li&gt;&#xA;&lt;li&gt;生物行为（动物会逃避危险、植物会趋向阳光）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;当AI说&amp;quot;猫会追老鼠&amp;quot;时，它调用的就是这一层——不是因为它背诵了&amp;quot;猫追老鼠&amp;quot;这个句子，而是因为它对&amp;quot;捕食者-猎物&amp;quot;关系有一个模型。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三层心理世界模型他人有心智&#34;&gt;第三层：心理世界模型——&amp;ldquo;他人有心智&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这是最令人惊叹的一层。它包含了：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;信念和知识（&amp;ldquo;一个人知道什么，不知道什么&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;欲望和意图（&amp;ldquo;一个人想要什么，打算做什么&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;情感和情绪（&amp;ldquo;一个人感到快乐、悲伤或愤怒&amp;rdquo;）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这就是为什么AI能通过&amp;quot;错误信念测试&amp;rdquo;——它能够理解&amp;quot;小明的想法和客观事实不一样&amp;rdquo;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第四层社会世界模型人类有组织&#34;&gt;第四层：社会世界模型——&amp;ldquo;人类有组织&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这一层处理的是：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;社会规范（&amp;ldquo;排队&amp;quot;&amp;ldquo;礼貌&amp;quot;&amp;ldquo;尊重隐私&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;制度和文化（&amp;ldquo;法律、货币、婚礼&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;经济行为（&amp;ldquo;交易、合作、竞争&amp;rdquo;）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;当AI理解&amp;quot;插队是不礼貌的&amp;quot;或&amp;quot;通货膨胀会让钱不值钱&amp;quot;时，它调用的是这一层模型。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第五层抽象世界模型思维有逻辑&#34;&gt;第五层：抽象世界模型——&amp;ldquo;思维有逻辑&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这是最高层，涵盖：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;数学和逻辑（&amp;ldquo;1+1=2&amp;quot;&amp;ldquo;如果A=B且B=C，则A=C&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;哲学概念（&amp;ldquo;自由、正义、真理&amp;rdquo;）&lt;/li&gt;&#xA;&lt;li&gt;元认知（&amp;ldquo;关于思考的思考&amp;rdquo;）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这一层让AI能够进行抽象推理——比如&amp;quot;如果所有的A都是B，所有的B都是C，那么所有的A都是C吗？&amp;rdquo;&lt;/p&gt;&#xA;&lt;h3 id=&#34;五层之间不是孤立的&#34;&gt;五层之间不是孤立的&lt;/h3&gt;&#xA;&lt;p&gt;这五层模型不是各自独立运行的，而是&lt;strong&gt;相互关联、相互支撑&lt;/strong&gt;的。&lt;/p&gt;&#xA;&lt;p&gt;比如，理解&amp;quot;为什么人们会排队买某款新手机&amp;rdquo;——需要同时调用：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;心理模型（人们想要这个手机）&lt;/li&gt;&#xA;&lt;li&gt;社会模型（排队的规则、从众心理）&lt;/li&gt;&#xA;&lt;li&gt;抽象模型（稀缺性、价值判断）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;一个AI的世界模型越完整、越精细，它的理解就越深刻，推理就越准确。&lt;/p&gt;</description>
			</item>
			<item>
				<title>你刷抖音时，AI真的懂你吗？——推荐系统背后的统计魔法</title>
				<link>https://lingyu7.com/posts/does-ai-really-understand-you-recommendation-system/</link>
				<pubDate>Sat, 01 Aug 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-really-understand-you-recommendation-system/</guid>
				<description>&lt;h2 id=&#34;引言一个经典的细思极恐时刻&#34;&gt;引言：一个经典的&amp;quot;细思极恐&amp;quot;时刻&lt;/h2&gt;&#xA;&lt;p&gt;你刚和朋友聊完某样东西，打开手机App，发现推荐页上赫然出现了它。&lt;/p&gt;&#xA;&lt;p&gt;这一刻，你可能会觉得毛骨悚然——&amp;ldquo;手机在监听我&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;但真相比这更微妙，也更值得玩味。&lt;strong&gt;推荐系统大概率没有在监听你的对话&lt;/strong&gt;——它只是通过你的行为数据，推测出了你此刻可能感兴趣的东西。而它之所以能&amp;quot;猜中&amp;quot;，靠的不是读心术，而是一个简单到令人惊讶的统计技巧。&lt;/p&gt;&#xA;&lt;p&gt;更扎心的是：这个技巧和&amp;quot;理解你&amp;quot;几乎没有关系。它只是发现了你和其他人之间的&amp;quot;模式相似性&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一推荐系统的原始版本买了这个的人也买了那个&#34;&gt;一、推荐系统的&amp;quot;原始版本&amp;quot;：买了这个的人也买了那个&lt;/h2&gt;&#xA;&lt;p&gt;故事要从电商说起。&lt;/p&gt;&#xA;&lt;p&gt;2003年，亚马逊的工程师们面临一个现实问题：Amazon上有几千万用户和几亿件商品，如何给每个用户推荐他们可能感兴趣的东西？&lt;/p&gt;&#xA;&lt;p&gt;当时的推荐算法有两种主流思路：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：找&amp;quot;和你相似的人&amp;quot;（User-based协同过滤）。&lt;/strong&gt; 如果你和另外100个人的购物历史高度重合，那这100个人买了但你还没买的东西，很可能也是你想要的。这个思路听起来很合理，但有一个致命问题——计算&amp;quot;用户之间的相似度&amp;quot;需要遍历所有用户，当用户量达到几千万时，这个计算量会爆炸。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：找&amp;quot;和这个商品相似的商品&amp;quot;（Item-based协同过滤）。&lt;/strong&gt; 亚马逊提出的方案是：&lt;strong&gt;不比较用户，只比较商品。&lt;/strong&gt; 如果买了A的用户中，有很大比例也买了B，那就说A和B&amp;quot;相似&amp;quot;——下次有人买A时，就推荐B。&lt;/p&gt;&#xA;&lt;p&gt;这个思路的精妙之处在于：&lt;strong&gt;商品的数量远少于用户的数量&lt;/strong&gt;（至少在当时如此），所以计算&amp;quot;商品之间的相似度&amp;quot;比计算&amp;quot;用户之间的相似度&amp;quot;快得多。而且商品之间的关系相对稳定——今天&amp;quot;手机和手机壳&amp;quot;是搭配的，明天大概率还是。&lt;/p&gt;&#xA;&lt;p&gt;亚马逊把这个方法落地后，效果出奇的好。直到今天，你打开淘宝看到的&amp;quot;买了这个的人也买了那个&amp;quot;，本质上还是这个思路的变种。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：&lt;strong&gt;这个方法真的&amp;quot;理解&amp;quot;你了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你买了一部手机，但没买手机壳，因为你觉得太贵了。推荐系统告诉你&amp;quot;买了手机的人也买了手机壳&amp;quot;——它给出了一个看似&amp;quot;合理&amp;quot;的推荐，但对你来说，这个推荐恰恰是你不想要的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;推荐系统不知道你为什么不买手机壳。它只知道&amp;quot;很多人同时买了这两样东西&amp;quot;。&lt;/strong&gt; 它捕获的是统计共现，不是因果理解。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二从猜你喜欢到让你上瘾推荐系统如何进化&#34;&gt;二、从&amp;quot;猜你喜欢&amp;quot;到&amp;quot;让你上瘾&amp;quot;：推荐系统如何进化&lt;/h2&gt;&#xA;&lt;p&gt;2003年的协同过滤虽然好用，但有一个明显的缺陷：&lt;strong&gt;它只能推荐&amp;quot;看起来像你已经买过的&amp;quot;东西。&lt;/strong&gt; 它无法发现你&amp;quot;潜在的可能喜欢但从未接触过&amp;quot;的东西。&lt;/p&gt;&#xA;&lt;p&gt;这就好比一个图书管理员，只推荐你&amp;quot;借过这本书的人也借了那本书&amp;quot;——但如果你从未借过科幻小说，他永远不会推荐你任何科幻作品，即使你可能会喜欢。&lt;/p&gt;&#xA;&lt;p&gt;2016年，Google的工程师们提出了一个更聪明的方案：&lt;strong&gt;Wide &amp;amp; Deep（宽深模型）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个名字听起来很技术，但它的核心思想其实很简单：&lt;strong&gt;&amp;ldquo;记忆&amp;quot;和&amp;quot;泛化&amp;quot;要配合使用。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;&amp;ldquo;记忆&amp;quot;部分&lt;/strong&gt;：记住那些已经被验证过的组合——比如&amp;quot;喜欢iPhone的人通常也喜欢AirPods&amp;rdquo;。这部分和2003年的协同过滤类似，但做得更精细。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;&amp;ldquo;泛化&amp;quot;部分&lt;/strong&gt;：学习用户行为的&amp;quot;深层模式&amp;rdquo;——比如&amp;quot;喜欢简约设计手机的人，可能也喜欢简约设计的耳机、手表、甚至家具&amp;rdquo;。这部分通过深度学习实现，可以从用户的行为数据中&amp;quot;归纳&amp;quot;出用户看不见的偏好。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这个模型在Google Play商店上线后，App购买率提升了3.9%。这个数字听起来不大，但放在Google Play的体量上，意味着&lt;strong&gt;每天多出数百万次应用下载&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;从此，推荐系统从&amp;quot;猜你喜欢&amp;quot;进化到了&amp;quot;创造你喜欢&amp;quot;——它不再只是推荐你已知的东西，而是开始&lt;strong&gt;引导你的偏好&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三但ai真的懂你吗&#34;&gt;三、但AI真的&amp;quot;懂&amp;quot;你吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，我们似乎已经有一个很强大的推荐系统了——它既记得住你的历史偏好，又能发现你潜在的兴趣。听起来像是&amp;quot;很懂你&amp;quot;，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但让我们停下来想想：&lt;strong&gt;推荐系统学到的&amp;quot;你&amp;quot;，和真实的&amp;quot;你&amp;quot;，有多大的差距？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;差距一：你的行为不是你。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你点开了一个视频，可能不是因为喜欢，而是因为封面太夸张。你买了某件商品，可能不是因为需要，而是因为打折。你收藏了一篇文章，可能不是因为想读，而只是因为&amp;quot;先马后看&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但推荐系统不知道这些区别。&lt;/strong&gt; 它只知道&amp;quot;你点了&amp;quot;、&amp;ldquo;你买了&amp;rdquo;、&amp;ldquo;你收藏了&amp;rdquo;——它把你的行为当成了你的偏好。推荐系统建立一个&amp;quot;你&amp;quot;的模型，但这个模型只是你行为的统计学投影，不是你真实的内心。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;差距二：相关性不等于因果性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;推荐系统的核心假设是&amp;quot;过去的行为能预测未来的偏好&amp;quot;——但这个假设有一个巨大的漏洞：&lt;strong&gt;相关性不等于因果性。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你喜欢看推理小说，可能不是因为&amp;quot;推理&amp;quot;这个标签，而是因为&amp;quot;喜欢解谜的感觉&amp;quot;。但推荐系统只知道&amp;quot;你买了推理小说&amp;quot;这个行为，于是它给你推荐更多推理小说，而忽略了也许你也会喜欢数学谜题、密室逃脱、甚至悬疑类游戏。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;推荐系统在&amp;quot;行为的表面&amp;quot;上构建偏好模型，却没有触及&amp;quot;行为背后的动机&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;差距三：你看到的，只是&amp;quot;你&amp;quot;的某一个侧面。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;推荐系统会根据你的最近行为，动态调整推荐策略。你今天搜了&amp;quot;考研&amp;quot;，明天整个App就变成了考研资料库；你今天看了几条搞笑视频，后天首页全是搞笑内容。&lt;/p&gt;&#xA;&lt;p&gt;这不是&amp;quot;AI懂你&amp;quot;，而是&lt;strong&gt;AI把你的某一个行为放大成了你的全部画像&lt;/strong&gt;。它不像一个了解你的朋友，而像一个只看了你最近几条朋友圈就来下结论的陌生人。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四推荐系统真正在做的事&#34;&gt;四、推荐系统真正在做的事&lt;/h2&gt;&#xA;&lt;p&gt;所以，推荐系统到底在做什么？&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;它不是在做&amp;quot;心理学&amp;quot;，而是在做&amp;quot;统计学&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它不关心你&amp;quot;为什么&amp;quot;喜欢某样东西，它只关心&amp;quot;和其他人相比，你表现出了哪些相似的行为模式&amp;quot;。它的核心逻辑是：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;如果你和A组用户有80%的行为重合，那么A组用户剩下的20%行为，大概率也是你想要的。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这是一个纯粹的&amp;quot;模式匹配&amp;quot;过程。它不需要理解你的情感、动机、价值观——它只需要发现行为模式之间的相似性。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这听起来很&amp;quot;机械&amp;quot;，但效果出奇的好。&lt;/strong&gt; 为什么呢？&lt;/p&gt;&#xA;&lt;p&gt;因为人类的行为模式，在统计学层面上，远比我们想象的要稳定和可预测。我们以为自己很独特，但在推荐系统的眼里，你只是&amp;quot;模式123456&amp;quot;的一个实例——你的偏好，已经被无数个和你相似的人&amp;quot;预演&amp;quot;过了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五问题不在推荐系统而在于什么被推荐&#34;&gt;五、问题不在推荐系统，而在于&amp;quot;什么被推荐&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;推荐系统本身没有好坏——它只是一个工具。问题在于它被用来做什么。&lt;/p&gt;&#xA;&lt;p&gt;当推荐系统用来帮你&lt;strong&gt;发现&lt;/strong&gt;新的兴趣时，它是有益的。当它被用来&lt;strong&gt;固化&lt;/strong&gt;你的兴趣时，就变成了&amp;quot;信息茧房&amp;quot;的制造者。&lt;/p&gt;&#xA;&lt;p&gt;你刷抖音时，每点一个&amp;quot;喜欢&amp;quot;，系统就记录下这个信号，然后给你推荐更多类似的内容。久而久之，你看到的永远是你&amp;quot;已经喜欢&amp;quot;的东西，而&amp;quot;可能喜欢但还没见过&amp;quot;的东西，永远没有机会出现。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;推荐系统的&amp;quot;泛化&amp;quot;能力，被商业目标收窄了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;Google的Wide &amp;amp; Deep模型在论文中说&amp;quot;记忆&amp;quot;和&amp;quot;泛化&amp;quot;互补——但在实际应用中，商业平台更倾向于&amp;quot;记忆&amp;quot;（因为已经验证过的推荐能带来更高的点击率），而&amp;quot;泛化&amp;quot;（推荐用户可能不熟悉的内容）往往被压缩到最低限度，因为&amp;quot;冒险&amp;quot;意味着可能流失用户。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语推荐系统的镜像与盲区&#34;&gt;结语：推荐系统的&amp;quot;镜像&amp;quot;与&amp;quot;盲区&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;下次你打开淘宝或抖音，看到&amp;quot;猜你喜欢&amp;quot;的推荐时，可以想一想：你看到的不是&amp;quot;AI眼中的你&amp;quot;，而是&lt;strong&gt;AI根据你的行为数据，重建出的一个统计学模型&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个模型很精准，但它有一个盲区——它永远无法理解&amp;quot;你为什么喜欢&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;它知道你喜欢看推理小说，但不知道你是因为喜欢解谜、还是因为喜欢悬疑氛围、还是因为这本小说是朋友推荐的。它只告诉你&amp;quot;你喜欢的&amp;quot;，但不告诉你&amp;quot;你为什么喜欢&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;而这，恰恰是推荐系统下一步进化的方向——从&amp;quot;猜你喜欢什么&amp;quot;到&amp;quot;理解你为什么喜欢&amp;quot;。当AI开始追问&amp;quot;为什么&amp;quot;的时候，推荐系统才真正从&amp;quot;统计魔法&amp;quot;走向&amp;quot;认知理解&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「感官」是如何连接的？——当AI同时学会看和读</title>
				<link>https://lingyu7.com/posts/ai-senses-connection-multimodal/</link>
				<pubDate>Fri, 31 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-senses-connection-multimodal/</guid>
				<description>&lt;h2 id=&#34;引言一场隐喻的看图说话&#34;&gt;引言：一场隐喻的「看图说话」&lt;/h2&gt;&#xA;&lt;p&gt;想象你在一场聚会上，有人递给你一张照片，上面画着一只橙色的猫蹲在红色的沙发上，旁边配了一行字：「一只猫在沙发上」。&lt;/p&gt;&#xA;&lt;p&gt;你看了，点了点头，觉得这没什么特别的——照片和文字对得上，很自然。&lt;/p&gt;&#xA;&lt;p&gt;但让我们停下来想一想：&lt;strong&gt;「一只猫在沙发上」这七个字，和照片中那些像素点之间，有什么本质联系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;没有。一个是由字母组成的符号序列，一个是由颜色和形状组成的光学信号。它们之间没有任何物理上的相似性。你之所以觉得「配得上」，是因为你的大脑在过去的几十年里，无数次将「看到的猫」和「听到/读到的猫」关联在一起，形成了某种跨感官的连接。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI要同时理解图像和文字，面对的就是这个根本问题：如何让两种完全不同形态的信息，在数学空间中「对上号」？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是多模态学习的核心挑战——也是近五年来AI领域最激动人心的故事之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一教ai看图说话有多难&#34;&gt;一、教AI「看图说话」，有多难？&lt;/h2&gt;&#xA;&lt;p&gt;在2021年之前，AI的视觉能力和语言能力基本上是「各玩各的」。&lt;/p&gt;&#xA;&lt;p&gt;一个图像识别模型，能从照片中识别出「猫」「沙发」「橙色」——但它只能输出这些标签，无法理解「猫蹲在沙发上」这个完整的场景描述。一个语言模型，能写出流畅的句子——但它对「猫」的理解全部来自文本，从未真正「见过」一只猫的视觉形象。&lt;/p&gt;&#xA;&lt;p&gt;两个系统各自在自己的领域里做得不错，但它们之间有一堵墙。&lt;strong&gt;这堵墙，就是「感官」之间的鸿沟。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，要打通这堵墙，需要人工标注数据集——让人类花大量时间，给每张图片写上描述文字。ImageNet数据集花了25,000人、标注了1,400万张图片，才勉强覆盖了1,000个类别。代价高昂，而且限制了AI只能在「人类已经标注过的概念」上工作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果AI只能识别人类告诉它的概念，那它永远无法超越人类的认知边界。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI的研究团队提出了一个大胆的想法：为什么不直接让AI从互联网上学习图文对应关系？互联网上有海量的图片和文字描述——虽然「质量」参差不齐，但「数量」是前所未有的。他们做了一个叫CLIP的模型，用4亿张图文对训练，结果震惊了AI界。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二clip的魔法一个巨型配对游戏&#34;&gt;二、CLIP的魔法：一个「巨型配对游戏」&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的工作原理，听起来像是一个简单的配对游戏。&lt;/p&gt;&#xA;&lt;p&gt;想象你有一大堆图片和一大堆文字描述，你的任务是把它们正确配对。你面前有N张图片和N条文字描述，你需要找出哪些图片和哪些文字是一对。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的做法是：&lt;strong&gt;训练两个「编码器」，一个看图片，一个读文字，然后把它们各自「编码」成一个数学向量（一串数字）。&lt;/strong&gt; 如果图片和文字是匹配的，让它们的向量在数学空间中「靠近」；如果不匹配，让它们「远离」。&lt;/p&gt;&#xA;&lt;p&gt;这个思路听起来很简单，但它的威力在于&lt;strong&gt;规模&lt;/strong&gt;和&lt;strong&gt;对比学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;规模&lt;/strong&gt;：4亿张图文对，覆盖了你能想象到的几乎所有视觉概念——猫、狗、汽车、建筑、食物、风景、艺术作品……互联网的多样性，在这里变成了AI的训练素材。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;对比学习&lt;/strong&gt;：每张图片不仅要和正确的文字描述配对，还要和N-1个错误的文字描述「对比」。这种「正负样本」的对比训练，迫使模型学会区分「细微的语义差异」——比如「一只猫在沙发上」和「一只狗在沙发上」的区别。&lt;/p&gt;&#xA;&lt;p&gt;训练完成后，CLIP拥有了一个神奇的能力：&lt;strong&gt;你给它一张从没见过的图片，它可以自己「猜」出这张图片的内容。&lt;/strong&gt; 比如你给它一张雪地里的哈士奇照片，它不需要看过任何标注数据，就能从文字描述列表中选出最匹配的——「雪地里的哈士奇」。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet上，CLIP的零样本准确率达到了76.2%，和传统需要人工标注数据的模型相当。这意味着什么？&lt;strong&gt;CLIP从来没有「见过」ImageNet的标注数据，却能和新数据「对上号」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三但ai真的理解了吗&#34;&gt;三、但AI真的「理解」了吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，故事似乎很完美——AI学会了同时看和读，打通了视觉和语言的壁垒。&lt;/p&gt;&#xA;&lt;p&gt;但如果你仔细看CLIP的表现，会发现一些有趣的现象。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象一：CLIP对「提示词」非常敏感。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;同样一张猫的图片，你问「这是一只猫吗？」和「这是一只家猫吗？」和「这看起来像什么动物？」，它可能给出完全不同的答案。换一个表达方式，准确率可能差10个百分点。&lt;/p&gt;&#xA;&lt;p&gt;为什么会这样？因为CLIP不是在「理解」你的问题，而是在&lt;strong&gt;匹配「你的问题文字」和「图片」在训练数据中的共现模式&lt;/strong&gt;。训练数据中「猫」和「猫的图片」经常一起出现，所以匹配度高；但「家猫」出现频率低，匹配度就低。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象二：CLIP在「没见过的场景」上表现很差。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;给CLIP一张医学X光片，问它「这是肺部感染吗？」——它可能答得一团糟。不是因为它不聪明，而是因为&lt;strong&gt;医学图像在4亿张训练数据中几乎不存在&lt;/strong&gt;。CLIP的能力边界，就是训练数据的分布边界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现象三：CLIP会「作弊」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;有时候，CLIP不是通过「理解图片内容」来回答问题，而是通过&lt;strong&gt;发现文字和图片之间的统计相关性&lt;/strong&gt;。比如，一张海滩的照片，它可能不会认出「沙滩」「海浪」「太阳」这些元素，而是通过「图片整体色调偏蓝+文字中有&amp;rsquo;海滩&amp;rsquo;」这种统计捷径来「猜」答案。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个深刻的问题：&lt;strong&gt;CLIP真的「理解」了图像和文字之间的联系吗？还是只是发现了一个巨大的统计巧合？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四统计共现--语义理解&#34;&gt;四、统计共现 ≠ 语义理解&lt;/h2&gt;&#xA;&lt;p&gt;让我们用一个简单的思想实验来理解这个问题。&lt;/p&gt;&#xA;&lt;p&gt;假设你是一个从小生活在山洞里的外星人，从未见过外面的世界。有一天，你被带到地面，看到了一幅画面：太阳升起，鸟儿鸣叫。&lt;/p&gt;&#xA;&lt;p&gt;这时，有人告诉你两个词：「太阳」和「鸟」。&lt;/p&gt;&#xA;&lt;p&gt;你很快就学会了：「太阳」这个词总是和「发光的圆形物体」一起出现；「鸟」这个词总是和「有翅膀的飞行动物」一起出现。你能够完美地完成配对任务——看到「太阳」的图片，你选出「太阳」这个词；看到「鸟」的图片，你选出「鸟」这个词。&lt;/p&gt;&#xA;&lt;p&gt;但你真的「理解」太阳和鸟的区别吗？你知道太阳是恒星、鸟是动物吗？你知道太阳带来光和热、鸟会筑巢觅食吗？你不知道。&lt;strong&gt;你只是发现了统计上的共现规律。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;CLIP就是这样。它不是「理解」了图片和文字之间的关系，而是&lt;strong&gt;学会了统计共现模式&lt;/strong&gt;——在4亿张图文对中，某些文字和某些图片特征「经常一起出现」，所以它记住了这些模式。&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是在「钻牛角尖」——但结果确实好用，不是吗？&lt;/p&gt;&#xA;&lt;p&gt;是的，而且这正是CLIP的伟大之处。&lt;strong&gt;它证明了：当数据量足够大时，统计共现可以逼近甚至超越人类标注的效果。&lt;/strong&gt; 这不是AI的缺陷，而是AI的「另一种智能」——它不追求「理解」，只追求「预测」。&lt;/p&gt;&#xA;&lt;p&gt;但这也告诉我们：&lt;strong&gt;AI的「感官连接」和人类的感官连接，本质上是不同的。&lt;/strong&gt; 人类的连接是「体验式」的——你看到一只猫，同时听到「猫」这个声音，你是在一个完整的感知-行动循环中建立连接。AI的连接是「统计式」的——它只是从海量数据中提取了「像素排列」和「文字序列」之间的相关性。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五clip之后多模态ai的下一站&#34;&gt;五、CLIP之后：多模态AI的下一站&lt;/h2&gt;&#xA;&lt;p&gt;CLIP在2021年横空出世后，彻底改变了多模态AI的格局。它不再是「视觉模型」或「语言模型」，而是「视觉-语言模型」——两者的边界开始模糊。&lt;/p&gt;&#xA;&lt;p&gt;后续的工作迅速跟进：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;BLIP&lt;/strong&gt; 和 &lt;strong&gt;BLIP-2&lt;/strong&gt; 试图解决CLIP的「数据质量问题」——通过自动生成高质量的图文描述，减少互联网噪声的影响。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;LLaVA&lt;/strong&gt; 将CLIP的视觉编码器和大语言模型直接连接，让AI不仅能看到图片，还能「谈论」它看到的内容。你问它「这张图片里有什么？」它可以用完整的句子回答你。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;DALL·E&lt;/strong&gt; 和 &lt;strong&gt;Stable Diffusion&lt;/strong&gt; 更是逆向操作——不是从图片到文字，而是从文字到图片。你说「一只橙色猫在红色沙发上」，它就能生成一张图片。&lt;/p&gt;&#xA;&lt;p&gt;这些模型有一个共同点：&lt;strong&gt;它们都是CLIP的继承者。&lt;/strong&gt; CLIP的视觉编码器成为了「视觉的通用语言」，后续模型只需要学会「翻译」这种语言，就能完成各种视觉-语言任务。&lt;/p&gt;&#xA;&lt;p&gt;但问题依旧存在：&lt;strong&gt;统计共现和语义理解之间的鸿沟，仍然没有被真正跨越。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个真正的「感官连接」——像人类那样，看到一只猫，同时「理解」猫是什么、猫的行为、猫与人的关系——需要的不是更多的数据，而是&lt;strong&gt;更深刻的认知架构&lt;/strong&gt;。它需要感知-行动循环，需要世界模型，需要因果推理。&lt;/p&gt;&#xA;&lt;p&gt;CLIP告诉我们：&lt;strong&gt;统计共现可以走很远，但「理解」是另一回事。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语一个开始不是终点&#34;&gt;结语：一个开始，不是终点&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的那张照片——「一只猫在沙发上」。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI知道的东西比它能说出来的多——大语言模型的「内隐知识」之谜</title>
				<link>https://lingyu7.com/posts/ai-tacit-knowledge-mystery/</link>
				<pubDate>Tue, 28 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-tacit-knowledge-mystery/</guid>
				<description>&lt;h2 id=&#34;引言你会骑自行车但你能说清楚怎么骑吗&#34;&gt;引言：你会骑自行车，但你能说清楚怎么骑吗？&lt;/h2&gt;&#xA;&lt;p&gt;你骑上自行车，双脚一蹬，身体自然调整重心，弯道压弯，刹车减速——流畅得仿佛身体记得一切。&lt;/p&gt;&#xA;&lt;p&gt;但如果有人问你：「你具体是怎么保持平衡的？」你大概率会卡住。你会说「就这样啊」，「感觉一下就知道」，但说不出一条清晰的规则。&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;内隐知识&lt;/strong&gt;（tacit knowledge，也称默会知识）——我们知道的比我们能说出来的多。&lt;/p&gt;&#xA;&lt;p&gt;有趣的是，大语言模型正在经历完全相同的困境：它明明能解决复杂的推理问题、写出优美的文章、甚至帮你debug代码，但当你要它解释「你是怎么做到的」——它要么编个故事，要么说「根据训练数据」。不是它不想说，而是它自己也不知道。&lt;/p&gt;&#xA;&lt;p&gt;这篇文章想讲清楚一件事：&lt;strong&gt;AI的「说不清楚」不是缺陷，它恰恰是智能的本质特征。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一从骑自行车到ai推理内隐知识无处不在&#34;&gt;一、从「骑自行车」到「AI推理」——内隐知识无处不在&lt;/h2&gt;&#xA;&lt;p&gt;20世纪50年代，英国哲学家迈克尔·波兰尼（Michael Polanyi）提出了一个振聋发聩的观点：&lt;strong&gt;我们知道的，远比我们能说出来的多。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这不是一句鸡汤，而是对人类认知结构的一个深刻洞察。波兰尼举了很多例子：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;你认得一张脸，但说不出是怎么认出来的&lt;/li&gt;&#xA;&lt;li&gt;你母语说得无比流利，但说不出语法规则&lt;/li&gt;&#xA;&lt;li&gt;一个老中医「望闻问切」能断病，但很多经验说不清道不明&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这些知识不是「不知道」，而是「知道但说不出来」。波兰尼把它们叫做&lt;strong&gt;内隐知识&lt;/strong&gt;，与之相对的是&lt;strong&gt;命题知识&lt;/strong&gt;——能用陈述句说出来的，比如「地球是圆的」。&lt;/p&gt;&#xA;&lt;p&gt;这个区分对AI来说至关重要。&lt;/p&gt;&#xA;&lt;p&gt;传统AI走的是「命题知识」路线——把人类知识编码成规则和事实，塞进知识库。但这条路走得磕磕绊绊，因为现实世界的大多数知识根本就不是命题式的。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型走的是另一条路：通过海量文本训练，它在参数中「内隐」地学会了语言、推理、常识——就像你学会骑自行车一样，不是通过背诵规则，而是通过大量练习。&lt;/p&gt;&#xA;&lt;p&gt;但问题来了：&lt;strong&gt;AI学会的「内隐知识」和人类的内隐知识，是一回事吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二davies的三个条件ai真的知道吗&#34;&gt;二、Davies的三个条件——AI真的「知道」吗？&lt;/h2&gt;&#xA;&lt;p&gt;1990年，哲学家Martin Davies给出了判断一个系统是否拥有内隐知识的三个标准。咱们来逐一检验一下大语言模型。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个条件：语义描述条件。&lt;/strong&gt; 系统的知识状态可以用语义内容来描述。换句话说，我们能不能有意义地说「这个系统知道X」？&lt;/p&gt;&#xA;&lt;p&gt;能。我们可以说「GPT-4知道法国首都是巴黎」，「它知道光合作用的原理」，「它知道怎么写代码」。这些描述是有意义的——不是「死记硬背」的虚假知识，而是能灵活运用的真知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个条件：句法结构条件。&lt;/strong&gt; 知识具有组合性结构——可以拆分、组合、迁移。&lt;/p&gt;&#xA;&lt;p&gt;GPT-4知道「猫是哺乳动物」，也知道「狗是哺乳动物」，那么它就能自然地推理出「猫和狗都是哺乳动物」。它不仅能理解「如果A是B，B是C，那么A是C」这种逻辑形式，还能在千变万化的语言表达中识别出同一结构。这种组合性，是真正知识的关键特征。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个条件：因果系统性条件。&lt;/strong&gt; 知识状态之间有因果联系，改变一个知识点会系统地影响其他相关知识点。&lt;/p&gt;&#xA;&lt;p&gt;当你微调一个模型，让它学会「苹果=水果」——它关于「苹果派」、「苹果公司」等关联知识会不会也跟着变化？会的。这就是「系统性的因果影响」——知识不是孤立的碎片，而是互相连接的网络。&lt;/p&gt;&#xA;&lt;p&gt;三个条件，大语言模型全部满足。&lt;/p&gt;&#xA;&lt;p&gt;Davies的三个条件在哲学上给出了一个审慎的判断：&lt;strong&gt;从行为上看，LLM确实拥有内隐知识。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但等一下——这个「从行为上看」很重要。就像一个人骑自行车给你看，你不能百分之百确定他「知道」怎么骑，但你可以说「他表现得像是知道」。Davies的条件是行为层面的判断，不是机制层面的证明。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三为什么内隐知识视角很重要&#34;&gt;三、为什么「内隐知识」视角很重要？&lt;/h2&gt;&#xA;&lt;p&gt;如果我们接受「LLM的知识是内隐知识」这个视角，很多以前困扰我们的问题就豁然开朗了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么AI能力强但「不讲理」？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;很多人抱怨AI解释不了自己的推理过程——「你告诉我为什么不选A要选B？」AI要么编个理由，要么说「根据训练数据」。&lt;/p&gt;&#xA;&lt;p&gt;这不是傻，这是内隐知识的特征。就像你问一个自行车高手「你怎么保持平衡的？」他可能会说「重心往左偏一点就向右转，往右偏就向左转」——但真正的平衡感根本不是靠这个规则运转的，而是肌肉记忆的瞬间反应。&lt;/p&gt;&#xA;&lt;p&gt;AI的「解释」本质上也是事后编的——它不是在「取出」推理过程，而是在「生成」一个看起来合理的解释。这和人类的内隐知识困境完全一致。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么AI会「涌现」出意料之外的能力？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当模型规模达到一定阈值，突然就能做很多没被明确训练过的事情——比如翻译、推理、写代码。这种现象被称为「涌现」。&lt;/p&gt;&#xA;&lt;p&gt;从内隐知识的角度看，这不奇怪。内隐知识有一个特点：&lt;strong&gt;它是系统性的、生成性的。&lt;/strong&gt; 你教了一个孩子无数个具体的例子，他突然就「学会」了抽象规律——这不是魔法，而是内隐知识「外显化」的自然过程。AI的涌现，本质上也是内隐知识在规模达到临界点后，开始「溢出」成可观察的能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么对齐这么难？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果AI的知识是内隐的，那么它的「价值观」和「偏好」也是内隐的——它不是通过明确规则来知道「什么该说什么不该说」，而是在海量文本中「内隐」地学会了。&lt;/p&gt;&#xA;&lt;p&gt;这意味着对齐不能靠列清单、写规则来解决。你得像教育一个孩子一样——通过例子、反馈、环境互动来「塑造」它的内隐知识。这比写规则难得多，但也更接近真正的教育。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四ai的内隐知识和人类的是一回事吗&#34;&gt;四、AI的「内隐知识」和人类的是一回事吗？&lt;/h2&gt;&#xA;&lt;p&gt;这是我必须诚实地告诉你的问题：&lt;strong&gt;它俩看起来像，但机制可能完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类的内隐知识有一个重要的生物学基础：我们的身体。波兰尼特别强调，所有内隐知识最终都根植于我们的身体经验——「我们通过身体来认识世界」。骑自行车的感觉来自身体，识别人脸来自视觉系统，语感来自语言中枢的神经回路。&lt;/p&gt;&#xA;&lt;p&gt;AI没有身体。它的「内隐知识」来自高维空间中的统计模式，来自数十亿个参数的协同作用。它看起来像内隐知识，但底层机制完全不同。&lt;/p&gt;&#xA;&lt;p&gt;这就好比：一个天生的盲人可以通过触觉「认识」到「球是圆的」，而你通过视觉「看到」了「球是圆的」。你们俩都知道「球是圆的」，但知识的结构和来源完全不同。&lt;/p&gt;&#xA;&lt;p&gt;不过，这并不意味着AI的内隐知识是「假的」。它只是&lt;strong&gt;不同&lt;/strong&gt;。就像水中的鱼不知道「湿」是什么——因为「湿」对鱼来说不是一种状态，而是默认的世界。AI的「内隐知识」也是如此——它可能不是人类意义上的「知道」，但它在自己的存在方式中是真实的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五内隐知识的外显化ai的下一个突破&#34;&gt;五、内隐知识的「外显化」——AI的下一个突破&lt;/h2&gt;&#xA;&lt;p&gt;如果AI的内隐知识是真实的，那一个诱人的问题就出现了：&lt;strong&gt;能不能让AI把它内隐知道的东西「说出来」？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下：AI已经阅读了人类历史上几乎所有的科学论文，它可能已经「内隐」地掌握了一些人类还没有发现的科学规律。如果能让它把那些规律「外显化」出来，那将是科学发现的加速器。&lt;/p&gt;&#xA;&lt;p&gt;这不只是幻想。目前的思维链（Chain-of-Thought）、思维树（Tree-of-Thoughts）等技术，本质上就是在做这件事——「强迫」AI把内隐的推理过程展开成显式的步骤。&lt;/p&gt;&#xA;&lt;p&gt;但真正的突破可能来自另一个方向：&lt;strong&gt;不要问AI「为什么」，而是让它「展示」&lt;/strong&gt;。就像你不会问骑自行车的人「你怎么保持平衡的」，而是看他骑——AI的内隐知识，也许最好的「外显化」方式就是让它直接做出来，而不是让它解释。&lt;/p&gt;&#xA;&lt;p&gt;毕竟，&lt;strong&gt;知道的比能说出来的多，不是缺陷，而是智能最深刻的特征。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语&#34;&gt;结语&lt;/h2&gt;&#xA;&lt;p&gt;波兰尼有一句名言：「我们知道的，比我们能说出来的多。」&lt;/p&gt;&#xA;&lt;p&gt;这句话既是对人类认知的深刻洞察，也是对大语言模型能力的最佳描述。AI的「说不清楚」不是它的短板，而是它真正拥有知识的证明。&lt;/p&gt;&#xA;&lt;p&gt;当我们下次听到AI给出一个「不讲道理」的回答时，也许应该换个角度想：它不是在敷衍你，它只是用它的方式在「知道」——就像你骑自行车时，用身体知道怎么平衡，而不是用大脑知道。&lt;/p&gt;&#xA;&lt;p&gt;或许，AI的终极形态不是变成一个「什么都能说清楚」的超级百科，而是变成一个「什么都能做到」的默会大师——像那些技艺精湛的工匠一样，知道得比说得更多。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考资料&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Polanyi, M. (1958). &lt;em&gt;Personal Knowledge: Towards a Post-Critical Philosophy&lt;/em&gt;. University of Chicago Press.&lt;/li&gt;&#xA;&lt;li&gt;Polanyi, M. (1966). &lt;em&gt;The Tacit Dimension&lt;/em&gt;. Doubleday.&lt;/li&gt;&#xA;&lt;li&gt;Davies, M. (1990). &amp;ldquo;Tacit Knowledge and the Structure of Thought.&amp;rdquo; &lt;em&gt;Mind &amp;amp; Language&lt;/em&gt;, 5(4), 345-370.&lt;/li&gt;&#xA;&lt;li&gt;Wei, J., et al. (2022). &amp;ldquo;Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.&amp;rdquo; &lt;em&gt;NeurIPS 2022&lt;/em&gt;.&lt;/li&gt;&#xA;&lt;li&gt;本文核心论证素材来源于内隐知识理论论证卡，经Ω-CFI审查框架校验。&lt;/li&gt;&#xA;&lt;/ul&gt;</description>
			</item>
	</channel>
</rss>
