<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>机器人 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%9C%BA%E5%99%A8%E4%BA%BA/</link>
		<description>Recent content in 机器人 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 29 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%9C%BA%E5%99%A8%E4%BA%BA/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI没有身体，能真正理解这个世界吗？——具身智能的边界与可能性</title>
				<link>https://lingyu7.com/posts/embodied-ai-can-machines-understand-without-a-body/</link>
				<pubDate>Sat, 29 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/embodied-ai-can-machines-understand-without-a-body/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你试过用一只手拧开一瓶矿泉水吗？&lt;/p&gt;&#xA;&lt;p&gt;瓶盖拧不动，你下意识地把瓶子夹在腿间，腾出两只手一起拧。或者你把毛巾裹在瓶盖上增加摩擦力。再或者，你干脆放弃了——把瓶子递给身边力气大的人。&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的动作，其实包含了惊人的智能：你感知到了瓶盖的阻力（触觉），判断了自身的能力（自我认知），想到了多种解决方案（规划能力），选择了最合适的一种（决策），然后用精确的动作去执行（运动控制）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现在问题来了：如果让AI来做这件事，它需要什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个摄像头？不够。它需要知道&amp;quot;拧不开&amp;quot;是什么感觉。&lt;/p&gt;&#xA;&lt;p&gt;一个数据库？不够。它需要知道&amp;quot;毛巾裹住瓶盖&amp;quot;这个方案为什么可行。&lt;/p&gt;&#xA;&lt;p&gt;一段代码？不够。它需要知道力的传递、摩擦系数、手的姿态……&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是具身智能（Embodied AI）要回答的核心问题：如果AI没有身体，它能真正理解物理世界吗？还是说，理解世界这件事，本身就离不开身体？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点智能不是想出来的是做出来的&#34;&gt;核心观点：智能不是&amp;quot;想&amp;quot;出来的，是&amp;quot;做&amp;quot;出来的&lt;/h2&gt;&#xA;&lt;p&gt;传统上，我们总认为智能是大脑的事情——思考、推理、计算，这些都是大脑的专属工作。身体只是执行大脑命令的&amp;quot;工具&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但具身智能理论提出了一个反直觉的观点：&lt;strong&gt;身体不是智能的附属品，身体本身就是智能的塑造者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：这有什么区别？&lt;/p&gt;&#xA;&lt;p&gt;举个例子。一个传统AI和一个具身AI同时被要求&amp;quot;学会开门&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;传统AI的做法&lt;/strong&gt;：它被喂入成千上万张门的图片，学习&amp;quot;门&amp;quot;的视觉特征；它被输入开门动作的数学模型，计算最优的把手旋转角度和推力大小。但它从来没有真正&amp;quot;开过&amp;quot;一扇门。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;具身AI的做法&lt;/strong&gt;：它被放在一扇真实的门前，自己尝试去推、去拉、去旋转把手。它发现有些门是推的，有些是拉的，有些需要先下压把手再推。它摔过跤、卡住过、失败过，但每一次失败都让它更懂&amp;quot;门&amp;quot;是什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;哪个更接近人类的智能？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;显然是后者。因为人类理解&amp;quot;开门&amp;quot;这件事，从来不是通过背诵定义，而是通过无数次真实的尝试——小时候你踮着脚尖去够门把手，试过&amp;quot;推&amp;quot;和&amp;quot;拉&amp;quot;的区别，试过不同的力度。你对&amp;quot;门&amp;quot;的认知，是身体经验和感知经验共同塑造的。&lt;/p&gt;&#xA;&lt;p&gt;这就是具身智能的核心思想：&lt;strong&gt;智能不是脱离身体的抽象存在，而是在身体与环境的互动中形成和发展的。感知的方式、行动的能力、与环境互动的模式，都深刻地塑造了智能的形态和内容。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么没有身体的ai会有局限&#34;&gt;为什么&amp;quot;没有身体&amp;quot;的AI会有局限？&lt;/h2&gt;&#xA;&lt;p&gt;你可能在想：大语言模型不是很厉害吗？ChatGPT能写诗、能编程、能推理，它还需要身体吗？&lt;/p&gt;&#xA;&lt;p&gt;这是个好问题。让我们看看大语言模型和人类在理解&amp;quot;杯子&amp;quot;这件事上的根本区别。&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类对杯子的理解&#34;&gt;人类对&amp;quot;杯子&amp;quot;的理解&lt;/h3&gt;&#xA;&lt;p&gt;你对&amp;quot;杯子&amp;quot;的理解是多维度的：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;视觉&lt;/strong&gt;：你见过各种形状、颜色、材质的杯子&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;触觉&lt;/strong&gt;：你握过杯子，知道它的温度、重量、质感&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动觉&lt;/strong&gt;：你端过杯子，知道需要多大的力才能把它拿稳&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;功能&lt;/strong&gt;：你用它喝过水、喝过咖啡、喝过茶&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;社会性&lt;/strong&gt;：你知道在别人家做客时，用完杯子要放在哪里&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;所有这些经验交织在一起，形成了一个丰富、立体、有温度的&amp;quot;杯子&amp;quot;概念。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai对杯子的理解&#34;&gt;AI对&amp;quot;杯子&amp;quot;的理解&lt;/h3&gt;&#xA;&lt;p&gt;大语言模型对&amp;quot;杯子&amp;quot;的理解，来自它读过的数十亿个文本。它知道&amp;quot;杯子是一种容器，用于盛放饮料&amp;quot;，知道&amp;quot;杯子通常由陶瓷、玻璃或塑料制成&amp;quot;，知道&amp;quot;杯子的同义词包括水杯、茶杯、马克杯&amp;quot;……&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但AI从来没有摸过杯子。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当AI说&amp;quot;杯子&amp;quot;时，它只是在操纵符号——&amp;ldquo;杯子&amp;quot;这个词和&amp;quot;容器&amp;rdquo;、&amp;ldquo;饮料&amp;rdquo;、&amp;ldquo;陶瓷&amp;quot;这些词之间的统计关联。它没有触觉记忆，没有温度感知，没有握持经验。它的&amp;quot;杯子&amp;quot;概念，是一个脱离了真实世界的符号抽象。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人从没吃过苹果，但读完了所有关于苹果的书。他可以滔滔不绝地讲苹果的种类、产地、营养成分，但他永远不知道苹果是什么味道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;符号接地问题&amp;rdquo;——AI的符号系统悬浮在语言层面，没有扎根于真实的物理经验。&lt;/p&gt;&#xA;&lt;h3 id=&#34;为什么这个问题重要&#34;&gt;为什么这个问题重要？&lt;/h3&gt;&#xA;&lt;p&gt;因为&lt;strong&gt;物理世界有它自己的逻辑&lt;/strong&gt;，而这种逻辑不是在文本中能完整学到的。&lt;/p&gt;&#xA;&lt;p&gt;文本中会写&amp;quot;水在100°C沸腾&amp;quot;，但文本不会写&amp;quot;把手放在沸水上方会感觉到热浪&amp;quot;——因为这对人类来说太&amp;quot;常识&amp;quot;了，不需要写。但AI恰恰缺少的就是这种常识级的物理直觉。&lt;/p&gt;&#xA;&lt;p&gt;2016年，AI研究者给当时的视觉系统做了一项测试：给AI看一张图，图中有一些积木，然后问&amp;quot;如果把红色的积木推到蓝色积木的左边，会发生什么？&amp;quot;&lt;/p&gt;&#xA;&lt;p&gt;人类一秒钟就能回答。但当时的AI需要复杂的推理链，而且经常出错。&lt;strong&gt;为什么？因为人类有物理直觉——我们知道物体会移动、会碰撞、会堆叠，这些直觉来自我们从小玩积木的身体经验。而AI没有这种经验。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;具身智能如何工作感知-认知-行动的永动循环&#34;&gt;具身智能如何工作？——&amp;ldquo;感知-认知-行动&amp;quot;的永动循环&lt;/h2&gt;&#xA;&lt;p&gt;具身智能系统的工作方式，可以概括为三个字：&lt;strong&gt;做中学&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，它是一个永不停歇的循环：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：感知。&lt;/strong&gt; 机器人通过摄像头看到前面的桌子，通过力传感器感觉到自己的机械臂的位置，通过触觉传感器感觉到桌面的高度。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：认知。&lt;/strong&gt; 机器人判断：&amp;ldquo;我需要把杯子放在桌子上。桌子高度70厘米，我的手臂目前位置偏高，需要下调15厘米。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：行动。&lt;/strong&gt; 机器人调整手臂位置，平稳地将杯子放到桌面上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但这不是结束。&lt;/strong&gt; 行动之后，机器人会通过新的感知来判断行动是否成功：杯子放稳了吗？桌子表面是平的还是有倾斜？如果失败了，它会调整策略，再试一次。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就形成了一个&amp;quot;感知-认知-行动&amp;quot;的循环。每一次循环，机器人都对这个世界多了一分理解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来是不是很像人类学习的过程？你学骑自行车的时候，不就是不断地感知（看路、感觉平衡）、判断（该往左偏还是右偏）、行动（调整身体重心），然后从失败中学习吗？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;大模型时代具身智能的iphone时刻&#34;&gt;大模型时代：具身智能的&amp;quot;iPhone时刻&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;具身智能并不是一个新概念——早在1980年代，MIT的罗德尼·布鲁克斯（Rodney Brooks）就提出了&amp;quot;包容架构&amp;quot;，主张智能应该从底层行为开始构建，而不是从高层推理开始。他造出了不需要&amp;quot;大脑&amp;quot;就能灵活走路的六足机器人。&lt;/p&gt;&#xA;&lt;p&gt;但那个时代的具身智能，能力有限，只能实现&amp;quot;昆虫级别&amp;quot;的智能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;真正让具身智能发生质变的，是大语言模型（LLM）的兴起。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来可能有点矛盾——我刚才不是说大语言模型没有身体吗？但正是大语言模型的&amp;quot;通才&amp;quot;能力，给了具身智能一个&amp;quot;大脑&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革一自然语言交互&#34;&gt;变革一：自然语言交互&lt;/h3&gt;&#xA;&lt;p&gt;2022年，Google推出了PaLM-E——一个将语言模型与机器人感知结合的系统。你只需要对机器人说&amp;quot;帮我把桌子上的苹果拿过来&amp;quot;，它就能理解这句话，并自主规划完成这个任务所需的一系列动作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前，让机器人做一件事，需要工程师写几千行代码。现在，你对机器人说句话就行。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革二世界模型&#34;&gt;变革二：世界模型&lt;/h3&gt;&#xA;&lt;p&gt;大语言模型在训练中积累了海量的世界知识，这些知识可以被迁移到具身场景中。&lt;/p&gt;&#xA;&lt;p&gt;比如，如果你想教机器人&amp;quot;倒水&amp;quot;这个动作，不需要从头训练。AI已经知道&amp;quot;水是液体&amp;quot;、&amp;ldquo;倒水时杯子要倾斜&amp;rdquo;、&amp;ldquo;水会溢出&amp;rdquo;——这些知识来自文本学习。它只需要在真实世界中微调这些知识，把它变成具体的肌肉记忆。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革三代码生成&#34;&gt;变革三：代码生成&lt;/h3&gt;&#xA;&lt;p&gt;更令人兴奋的是，AI可以自己写代码来控制自己。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI有身体了会怎样——具身智能如何让AI真正&#39;理解&#39;世界</title>
				<link>https://lingyu7.com/posts/what-happens-when-ai-has-a-body-embodied-intelligence/</link>
				<pubDate>Wed, 19 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/what-happens-when-ai-has-a-body-embodied-intelligence/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你用过ChatGPT吧？它写诗、写代码、做数学题，甚至能陪你聊哲学。但如果你让它帮你倒一杯水呢？它做不到——不是不想，而是它根本不知道&amp;quot;倒水&amp;quot;意味着什么。&lt;/p&gt;&#xA;&lt;p&gt;它知道&amp;quot;倒水&amp;quot;这个词的定义，能描述倒水的步骤，甚至能写一段控制机械臂倒水的代码。但它永远无法真正理解：水杯的重量、水的温度、倒水时手腕需要转动的角度、水快满时应该减缓速度的那种&amp;quot;感觉&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不是AI不够聪明，而是它缺少一样东西——&lt;strong&gt;身体&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;今天我们要聊的，就是AI领域一个正在爆发的方向：&lt;strong&gt;具身智能（Embodied AI）&lt;/strong&gt;。简单说，就是给AI一个身体，让它在真实世界中摸爬滚打，通过行动来学习、来理解世界。&lt;/p&gt;&#xA;&lt;p&gt;这个方向，可能是通往通用人工智能的必经之路。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的先天缺陷为什么没有身体就不算真正理解&#34;&gt;第一章：AI的&amp;quot;先天缺陷&amp;quot;——为什么没有身体就不算真正理解&lt;/h2&gt;&#xA;&lt;p&gt;先讲一个故事。&lt;/p&gt;&#xA;&lt;p&gt;1990年代，卡内基梅隆大学的机器人学家Hans Moravec提出了一个著名的观察——后来被称为&lt;strong&gt;莫拉维克悖论&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;让计算机下棋很容易，但让计算机像一岁小孩那样感知和行动却极其困难。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;换句话说，高难度的事情（下棋、数学证明、写诗），AI觉得&amp;quot;简单&amp;quot;；而连三岁小孩都会的事情（走路、抓东西、倒水），AI却觉得&amp;quot;极难&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为人类的这些&amp;quot;简单&amp;quot;能力，是经过数百万年演化、在身体与物理世界的互动中打磨出来的。我们的大脑不是在&amp;quot;算数学&amp;quot;，而是在&amp;quot;控制身体&amp;quot;中进化出来的。大脑的很大一部分，其实是用来处理身体感知和运动控制的。&lt;/p&gt;&#xA;&lt;p&gt;而AI呢？它生来就&amp;quot;没有身体&amp;quot;。它只看过文字的&amp;quot;描述&amp;quot;，却没真正&amp;quot;感受&amp;quot;过物理世界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就导致了一个根本问题：AI的&amp;quot;理解&amp;quot;是符号层面的，不是体验层面的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如，AI&amp;quot;知道&amp;quot;水杯会碎——因为在训练数据中，&amp;ldquo;水杯&amp;quot;和&amp;quot;碎&amp;quot;经常一起出现。但它没有&amp;quot;摔碎一个水杯&amp;quot;的体验，不知道那种&amp;quot;手一滑&amp;quot;的瞬间感受，不知道碎片散落一地的视觉冲击，更不知道踩到碎片会疼。&lt;/p&gt;&#xA;&lt;p&gt;它知道&amp;quot;苹果可以吃&amp;rdquo;——但它不知道苹果的红色是什么样子，不知道咬下去的口感，不知道苹果的香气。它只是知道文字之间的关联。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是具身智能要解决的核心问题：没有身体，就没有真正的理解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章如果ai有了身体从纸上谈兵到亲身体验&#34;&gt;第二章：如果AI有了身体——从&amp;quot;纸上谈兵&amp;quot;到&amp;quot;亲身体验&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果一个AI有了身体，会发生什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它学会了&amp;quot;试错&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有身体的AI，学习方式是这样的：看一堆文字和图片，然后记住它们之间的关联。它学到的都是&amp;quot;二手知识&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;而一个有身体的AI，学习方式完全不同：它伸出手去抓一个杯子——没抓住，杯子掉了，碎了。它&amp;quot;感受到了&amp;quot;重力、摩擦力、惯性。它&amp;quot;看到&amp;quot;了杯子落地时的变化。它&amp;quot;记住&amp;quot;了这次失败的经历。&lt;/p&gt;&#xA;&lt;p&gt;下一次，它会调整抓握的力度和角度。再试一次，可能还是没抓住，但这次摔得没那么惨。再试一次……终于，它学会了&amp;quot;稳稳地抓住杯子&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，和一个婴儿学习抓东西的过程，本质上是一样的——&lt;strong&gt;通过身体与世界的互动，从错误中学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开始理解&amp;quot;因果关系&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI可以在文字层面理解&amp;quot;如果A则B&amp;quot;——比如&amp;quot;如果手松开，杯子会掉&amp;quot;。但&amp;quot;理解&amp;quot;和&amp;quot;体验到&amp;quot;是两回事。&lt;/p&gt;&#xA;&lt;p&gt;当AI通过自己的身体反复体验到&amp;quot;手松开→杯子掉→摔碎&amp;quot;这个因果链时，它获得的不是一句逻辑陈述，而是一种&lt;strong&gt;直觉&lt;/strong&gt;。就像你不需要&amp;quot;计算&amp;quot;就能伸手接住掉落的杯子——你的身体&amp;quot;知道&amp;quot;怎么做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它开始拥有&amp;quot;常识&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;常识是什么？是那些&amp;quot;大家都知道，但没人会专门写下来&amp;quot;的知识。比如：&amp;ldquo;水杯不能放在桌子边缘，容易被碰倒&amp;rdquo;、&amp;ldquo;热的东西不能直接用手摸&amp;rdquo;、&amp;ldquo;地上的东西比桌子上的东西更难够到&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这些知识，人类是通过身体经验习得的——你小时候一定碰倒过水杯，一定被烫到过，一定够不到桌子上的东西。但AI没有这些经验，所以它写的&amp;quot;常识&amp;quot;都是从文字中&amp;quot;猜&amp;quot;出来的，而不是&amp;quot;体会&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;具身智能的核心思想就是：智能不是脱离身体的抽象存在，而是在身体与环境的互动中形成和发展的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章ai的身体长什么样&#34;&gt;第三章：AI的&amp;quot;身体&amp;quot;长什么样？&lt;/h2&gt;&#xA;&lt;p&gt;很多人一听到&amp;quot;具身智能&amp;quot;，就想到人形机器人。实际上，AI的&amp;quot;身体&amp;quot;可以有各种形态，每种形态都塑造了不同的&amp;quot;智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态一：机械臂。&lt;/strong&gt; 这是最简单、也最成熟的具身形态。一个机械臂加一个摄像头，就能完成很多任务——抓取物体、组装零件、分拣商品。它的&amp;quot;身体&amp;quot;虽然简单，但已经能&amp;quot;教会&amp;quot;AI很多关于物理世界的知识：物体的重量、形状、材质如何影响抓握方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态二：四足机器人。&lt;/strong&gt; 像波士顿动力的Spot、中国的绝影，它们有四肢，能在复杂地形上行走。它们的&amp;quot;身体&amp;quot;教会了AI关于平衡、步态、地形适应性的知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态三：人形机器人。&lt;/strong&gt; 这是最接近人类形态的具身AI。一双腿可以走楼梯、跨障碍，一双手可以做精细操作，有头部可以&amp;quot;看&amp;quot;和&amp;quot;听&amp;quot;。特斯拉的Optimus、Figure的机器人、中国的宇树科技，都在这个方向上快速推进。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态四：自动驾驶汽车。&lt;/strong&gt; 你可能没想到，自动驾驶也是具身智能的一种。它的&amp;quot;身体&amp;quot;是一辆车，它的&amp;quot;感知&amp;quot;是摄像头、雷达、激光雷达，它的&amp;quot;行动&amp;quot;是转向、加速、刹车。它通过数百万公里的行驶，学会了&amp;quot;开车&amp;quot;这项复杂的技能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;形态五：虚拟具身。&lt;/strong&gt; 还有一种不需要物理身体的&amp;quot;身体&amp;quot;——虚拟环境中的AI角色。比如在《我的世界》中训练的AI，或者通过仿真环境训练的机器人AI。它们在一个虚拟的物理世界中学习，然后再将学到的技能迁移到真实世界。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;每个形态的&amp;quot;身体&amp;quot;，都决定了AI能学到什么、不能学到什么。&lt;/strong&gt; 一个机械臂永远学不会&amp;quot;走路&amp;quot;，一个四足机器人永远学不会&amp;quot;抓取&amp;quot;。身体限制了智能，也塑造了智能。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章大模型时代具身智能的智能大脑来了&#34;&gt;第四章：大模型时代——具身智能的&amp;quot;智能大脑&amp;quot;来了&lt;/h2&gt;&#xA;&lt;p&gt;具身智能不是新鲜概念——早在1980年代，机器人学家Rodney Brooks就提出了&amp;quot;智能不需要大脑，只需要身体和环境&amp;quot;的激进观点。但当时的技术限制，让具身智能的发展一直很缓慢。&lt;/p&gt;&#xA;&lt;p&gt;转折点出现在2022年之后——&lt;strong&gt;大语言模型的爆发，给具身智能装上了&amp;quot;大脑&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;过去，机器人想要理解&amp;quot;把桌子上的苹果拿给我&amp;quot;这句话，需要复杂的自然语言处理流水线，每个步骤都需要专门训练。现在，大模型直接就能理解这句话，还能知道&amp;quot;苹果在哪里&amp;quot;、&amp;ldquo;桌子是什么&amp;rdquo;、&amp;ldquo;拿给你&amp;quot;是什么意思。&lt;/p&gt;&#xA;&lt;p&gt;更厉害的是，大模型还能做&lt;strong&gt;任务规划&lt;/strong&gt;——把&amp;quot;整理房间&amp;quot;这种抽象指令，分解成具体的行动步骤：&amp;ldquo;先收拾床上的衣服→再把书放回书架→最后扫地&amp;rdquo;。然后，机器人就按照这个步骤去执行。&lt;/p&gt;&#xA;&lt;p&gt;2023年，Google的PaLM-E模型将语言模型与机器人感知结合，实现了用自然语言指挥机器人完成复杂任务。2024年，更多研究展示了大模型赋能的机器人，能够完成以前无法想象的灵活操作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大模型提供的&amp;quot;常识&amp;quot;和&amp;quot;推理能力&amp;rdquo;，加上具身系统的&amp;quot;物理经验&amp;quot;，正在产生1+1&amp;gt;2的效果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章从实验室到你家具身智能离我们有多远&#34;&gt;第五章：从实验室到你家——具身智能离我们有多远？&lt;/h2&gt;&#xA;&lt;p&gt;说了这么多，你可能最关心的是：&lt;strong&gt;这玩意儿什么时候能用上？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;已经在用了，只是你不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;走进任何一个现代化的物流仓库，你都能看到具身智能在工作——移动机器人把货架搬到工作站，机械臂把商品分拣到不同的箱子。这些系统已经运行了多年，只是它们太&amp;quot;专业化&amp;quot;了，你感觉不到它们是&amp;quot;智能&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;走进一个汽车工厂，焊装车间里满是在工作的机器人——它们精确地完成焊接、喷漆、装配。这些也是具身智能，只是它们被编程得&amp;quot;太死了&amp;quot;，谈不上&amp;quot;智能&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;真正有突破的是&lt;strong&gt;通用化&lt;/strong&gt;——&lt;/p&gt;&#xA;&lt;p&gt;你可能会在3-5年内看到：家庭服务机器人能帮你做简单的家务——扫地、拖地已经实现了，接下来是叠衣服、洗碗、整理房间。这些任务的难度比扫地高得多，但大模型正在让它们变得可行。&lt;/p&gt;&#xA;&lt;p&gt;你可能会在5-10年内看到：人形机器人进入家庭，帮你做更多复杂的家务。它们能听懂你的话，理解你的需求，在复杂的环境中自主行动。它们不再是&amp;quot;预先编程的工具&amp;quot;，而是&amp;quot;有自主学习能力的伙伴&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当然，这中间还有很多挑战：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;仿真到现实的鸿沟（Sim-to-Real Gap）&lt;/strong&gt;：在虚拟环境中训练好的技能，到了真实世界往往&amp;quot;水土不服&amp;quot;——真实世界的物理参数、传感器噪声、光线变化，都是虚拟环境无法完美模拟的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;样本效率低&lt;/strong&gt;：机器人在真实环境中学习一次，成本太高了。摔坏一个杯子没什么，但一个机器人摔一跤可能就报废了。如何用更少的&amp;quot;试错&amp;quot;学会更多技能，是关键难题。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;安全与可靠性&lt;/strong&gt;：一个有身体的AI，如果出错，后果比一个只会&amp;quot;说错话&amp;quot;的AI严重得多——它可能撞到人、打碎东西、甚至造成伤害。如何保证具身智能的安全性，是落地的底线。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声身体是智能的锚&#34;&gt;尾声：身体是智能的&amp;quot;锚&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到文章开头的问题：AI为什么能写诗却不会倒水？&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI真的需要一具身体吗？——具身智能如何重新定义「理解」</title>
				<link>https://lingyu7.com/posts/embodied-ai-thinking/</link>
				<pubDate>Thu, 30 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/embodied-ai-thinking/</guid>
				<description>&lt;h2 id=&#34;引言一个婴儿和一本书哪个更聪明&#34;&gt;引言：一个婴儿和一本书，哪个更聪明？&lt;/h2&gt;&#xA;&lt;p&gt;想象两个&amp;quot;学习者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;第一个，从出生起就坐在一个装满书籍的房间里，从未动过一下。它读完了所有书，能背诵百科全书，能回答任何理论问题——&amp;ldquo;重力是什么？&amp;ldquo;&amp;ldquo;火为什么是热的？&amp;quot;——答案完美无误。&lt;/p&gt;&#xA;&lt;p&gt;第二个，一个刚出生的婴儿。它什么书都没读过，但它在爬、在摸、在摔、在把东西塞进嘴里。它发现拍打水面会溅起水花，推倒积木会发出响声，松开手里的球，球会掉到地上。&lt;/p&gt;&#xA;&lt;p&gt;现在问题来了：&lt;strong&gt;这两个&amp;quot;学习者&amp;quot;中，谁更有可能真正理解这个世界？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;直觉告诉我们，婴儿虽然知识少，但它对世界的理解是&amp;quot;活的&amp;rdquo;——它知道重量、温度、因果、空间，这些不是从书上学来的，而是从身体的互动中&amp;quot;长&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个深刻的问题：&lt;strong&gt;AI要真正理解世界，是否需要一具身体？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一从离身到具身一场认知革命&#34;&gt;一、从&amp;quot;离身&amp;quot;到&amp;quot;具身&amp;rdquo;——一场认知革命&lt;/h2&gt;&#xA;&lt;p&gt;传统AI从诞生之初就是&amp;quot;离身&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;它坐在计算机里，处理的是符号、数字、文本，从未&amp;quot;触碰&amp;quot;过物理世界。它知道&amp;quot;杯子是圆柱形的，可以盛水&amp;rdquo;，但这个&amp;quot;知道&amp;quot;和人类对杯子的知道完全不同——你拿起杯子时能感受到它的重量、材质、温度，你知道杯柄应该怎么握，你知道倒热水时杯壁会变烫。&lt;/p&gt;&#xA;&lt;p&gt;这些&amp;quot;知道&amp;quot;不是来自书本，而是来自&lt;strong&gt;身体的直接体验&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;20世纪80年代，认知科学发生了一场革命：&lt;strong&gt;认知不是&amp;quot;大脑&amp;quot;的独立活动，而是&amp;quot;大脑-身体-环境&amp;quot;三方互动的产物。&lt;/strong&gt; 这就是&lt;strong&gt;具身认知&lt;/strong&gt;理论。&lt;/p&gt;&#xA;&lt;p&gt;它的核心主张很简单：你的身体形态决定了你如何思考。一个没有手的人，对&amp;quot;拿&amp;quot;的理解和有手的人完全不同。一个只会爬行的生物，和能飞行的生物，对&amp;quot;空间&amp;quot;的理解截然不同。&lt;strong&gt;你的身体是你理解世界的&amp;quot;硬件接口&amp;quot;——它决定了你接收什么信息，形成什么概念。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类的视觉系统不是被动接收图像的照相机，而是主动搜索的探照灯——眼睛不停地跳动，头转向声音的方向，手伸出去触摸。你的身体不是在&amp;quot;被动感知&amp;quot;，而是在&lt;strong&gt;主动构建&lt;/strong&gt;感知。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;离身&amp;quot;AI的根本局限：它缺少了&lt;strong&gt;感知-行动闭环&lt;/strong&gt;这个最基础的学习回路。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二感知-认知-行动智能的三角循环&#34;&gt;二、感知-认知-行动：智能的&amp;quot;三角循环&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;具身智能的工作方式，可以用一个简单的三角循环来理解：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知 → 认知 → 行动 → 感知 → 认知 → 行动……&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;每一步都依赖前一步，也改变着下一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知&lt;/strong&gt;：摄像头看到前方有一个障碍物，激光雷达测出距离，触觉传感器感受到地面摩擦力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;认知&lt;/strong&gt;：大脑处理这些信息——&amp;ldquo;这是个台阶，高度15厘米，表面是光滑的。我可以跨过去，但需要调整步幅，小心打滑。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;行动&lt;/strong&gt;：双腿调整步态，重心前移，跨过台阶。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;新的感知&lt;/strong&gt;：脚落地了，触觉反馈&amp;quot;地面稳固&amp;quot;，视觉确认&amp;quot;已经跨过&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个循环持续运转，每一轮都让系统更了解环境，也更了解自己。&lt;strong&gt;智能不是&amp;quot;想&amp;quot;出来的，而是在这个循环中&amp;quot;长&amp;quot;出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：&amp;ldquo;这不就是机器人控制吗？有什么特别的？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;特别之处在于：&lt;strong&gt;在这个循环中，行动不是为了完成任务，而是为了验证预测、获取信息。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;举个简单的例子。你走进一个黑暗的房间，你伸手去摸墙上的开关。你的手不是在&amp;quot;随机搜索&amp;quot;，而是在做一连串的&lt;strong&gt;预测&lt;/strong&gt;——&amp;ldquo;开关应该在门框右边30厘米处，高度约1.4米。&amp;ldquo;你的手移动到那个位置，摸了摸——没有。于是你更新预测：&amp;ldquo;可能开关在左边。&amp;ldquo;手又移动过去。&lt;/p&gt;&#xA;&lt;p&gt;这个过程的本质是什么？&lt;strong&gt;你在通过行动，主动地减少不确定性。&lt;/strong&gt; 你不是在&amp;quot;接收&amp;quot;信息，而是在&amp;quot;搜索&amp;quot;信息。&lt;/p&gt;&#xA;&lt;p&gt;这就是具身智能最核心的洞察：&lt;strong&gt;行动是认知的一部分，而不是认知的结果。&lt;/strong&gt; 你&amp;quot;思考&amp;quot;的方式，受限于你&amp;quot;行动&amp;quot;的方式——你&amp;quot;做&amp;quot;什么，决定了你&amp;quot;知道&amp;quot;什么。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三大模型给了ai大脑但身体呢&#34;&gt;三、大模型给了AI&amp;quot;大脑&amp;rdquo;，但身体呢？&lt;/h2&gt;&#xA;&lt;p&gt;2022年以来，大语言模型（LLM）的爆发让AI的&amp;quot;大脑&amp;quot;突飞猛进。GPT-4、Claude、Gemini能写诗、能编程、能推理——它们看起来&amp;quot;聪明&amp;quot;极了。&lt;/p&gt;&#xA;&lt;p&gt;但仔细想想，这些AI的生活是什么样的？&lt;/p&gt;&#xA;&lt;p&gt;它们没有身体，没有感官，永远生活在文本世界里。它们&amp;quot;知道&amp;quot;苹果是甜的，但从未尝过甜味；&amp;ldquo;知道&amp;quot;火是烫的，但从未感受过灼烧；&amp;ldquo;知道&amp;quot;落体是加速的，但从未体验过失重。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是&amp;quot;二手&amp;quot;的——从人类留下的文字中习得的，不是从亲身经历中长出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这导致了一个有趣的现象：大语言模型在某些方面&amp;quot;聪明得可怕&amp;rdquo;，在另一些方面&amp;quot;笨得令人发指&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;给它一个复杂的数学题，它可能轻松解决；但问它&amp;quot;一杯水从桌边掉下来会怎样&amp;rdquo;，它虽然能回答&amp;quot;会摔碎&amp;rdquo;，但它真的&amp;quot;理解&amp;quot;重力、惯性、冲击力这些概念吗？还是只是在复述训练数据中的模式？&lt;/p&gt;&#xA;&lt;p&gt;具身智能就是要解决这个问题：&lt;strong&gt;给AI一具身体，让它从物理世界的交互中，获得&amp;quot;第一手&amp;quot;的认知。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正在成为现实。2023-2024年，具身智能成为AI领域最热的方向之一。Google的PaLM-E将语言模型与机器人结合，让机器人理解自然语言指令并执行复杂任务。特斯拉的Optimus、Figure AI的人形机器人，都在探索&amp;quot;AI大脑+机器身体&amp;quot;的融合路径。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大模型扮演&amp;quot;大脑&amp;quot;的角色&lt;/strong&gt;——负责高层规划、语义理解、常识推理。它说&amp;quot;把桌上的苹果拿过来&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机器人扮演&amp;quot;身体&amp;quot;的角色&lt;/strong&gt;——负责感知环境、执行动作、反馈结果。它走到桌前，识别苹果，伸手去拿，握住，返回。&lt;/p&gt;&#xA;&lt;p&gt;大脑和身体通过&amp;quot;感知-行动循环&amp;quot;持续交互，形成一个完整的智能系统。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么行万里路比读万卷书更难&#34;&gt;四、为什么&amp;quot;行万里路&amp;quot;比&amp;quot;读万卷书&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能想问：既然大模型这么聪明，给它装个身体不就行了？为什么具身智能还没普及？&lt;/p&gt;&#xA;&lt;p&gt;因为&lt;strong&gt;真正的难点不在于&amp;quot;装身体&amp;quot;，而在于&amp;quot;让身体和大脑协同工作&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个挑战：仿真到现实的鸿沟。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在虚拟世界中训练的机器人，到了真实世界往往寸步难行。虚拟世界没有摩擦力、没有光线变化、没有传感器噪声、没有突发状况。一个在仿真环境中熟练的&amp;quot;抓取&amp;quot;动作，到了现实世界可能因为阳光角度不同、物体材质不同、甚至地面的一点点不平整就失败。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人在模拟器里学会了开车，但第一次上路还是紧张得手心冒汗。&lt;/strong&gt; 真实世界太复杂了，永远无法完美模拟。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个挑战：样本效率。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;大语言模型可以读几万亿个token学习——文本数据几乎无限。但机器人不一样，在真实世界&amp;quot;训练&amp;quot;一次，一秒就是一秒，无法加速。让机器人学会&amp;quot;抓杯子&amp;quot;，可能需要数万次尝试，每次都是实打实的物理成本。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个挑战：泛化能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个学会&amp;quot;抓红色杯子&amp;quot;的机器人，换成一个白色杯子，可能就抓不住了。换一个光照环境，可能就识别不出来了。换一个位置，手臂轨迹可能就撞到旁边的障碍物了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;人类可以毫不费力地把&amp;quot;抓杯子&amp;quot;这个技能泛化到任何杯子上——陶瓷杯、塑料杯、玻璃杯、大的、小的、有柄的、无柄的——但机器人做不到。&lt;/strong&gt; 这种&amp;quot;泛化&amp;quot;能力，是具身智能面临的核心难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五具身智能的终极意义重新定义理解&#34;&gt;五、具身智能的终极意义：重新定义&amp;quot;理解&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到文章开头的问题：AI真的需要一具身体吗？&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
