<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>智能体 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%99%BA%E8%83%BD%E4%BD%93/</link>
		<description>Recent content in 智能体 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 15 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%99%BA%E8%83%BD%E4%BD%93/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI再聪明，没有&#39;手&#39;也白搭——工具使用如何把AI从书呆子变成实干家</title>
				<link>https://lingyu7.com/posts/ai-tool-use-from-brain-to-agent/</link>
				<pubDate>Tue, 15 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-tool-use-from-brain-to-agent/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一下：&lt;/p&gt;&#xA;&lt;p&gt;你是世界上最聪明的人。你读过所有书，知道所有知识。但——你没有双手，无法触碰任何东西，也不能用任何工具。&lt;/p&gt;&#xA;&lt;p&gt;有人问你：&amp;ldquo;鱼香肉丝怎么做？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你能把步骤背得一字不差。&amp;ldquo;猪肉切丝腌制，泡椒剁碎，调好糖醋汁…&amp;ldquo;每一步都说得清清楚楚。&lt;/p&gt;&#xA;&lt;p&gt;但你没法真的走进厨房。&lt;/p&gt;&#xA;&lt;p&gt;你没法拿起菜刀、打开燃气灶、尝一口咸淡。你知道一切，却做不了任何事。&lt;/p&gt;&#xA;&lt;p&gt;听起来很荒谬？但这恰恰是目前大多数AI的真实处境。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型就像这个&amp;quot;天才书呆子&amp;rdquo;——它们读过海量文本，知道多得惊人的知识，但如果没有工具的帮助，它们永远只能停留在&amp;quot;说话&amp;quot;的层面。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;工具使用（Tool Use），是AI从&amp;quot;知道分子&amp;quot;走向&amp;quot;实干家&amp;quot;的关键一跃。&lt;/strong&gt; 这篇文章，我要带你看看这一跃是怎么发生的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai的五个先天缺陷为什么光有知识不够&#34;&gt;一、AI的五个&amp;quot;先天缺陷&amp;rdquo;——为什么光有知识不够&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：AI不已经能写文章、写代码、回答问题了吗？这还不够？&lt;/p&gt;&#xA;&lt;p&gt;不够。因为纯语言模型有五个无法绕过的天花板：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，知识的保质期。&lt;/strong&gt; 一个模型的训练数据截止于某一天。那之后发生的事情，它一概不知。去年的大选结果、今天的热搜、刚刚发布的财报——它要么不知道，要么只能编一个。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，事实的不确定性。&lt;/strong&gt; 模型经常&amp;quot;编故事&amp;quot;——这就是AI幻觉（Hallucination）。一个没有数据库、搜索引擎可以查证的语言模型，就像一个参加闭卷考试的学生：遇到不会的题，它只能硬编一个答案，还假装很确定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，数学的短板。&lt;/strong&gt; 大模型对语言很擅长，但对精确计算却很笨。你让它算&amp;quot;3857×926&amp;quot;，它可能给出一个接近但不准确的数字。它靠的是&amp;quot;猜&amp;quot;而不是&amp;quot;算&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四，与真实世界的隔离。&lt;/strong&gt; 模型只能读写文本。它没法打开网页查询实时信息，没法发送邮件，没法操作你的日历，没法控制智能家居。它生活在&amp;quot;语言的世界&amp;quot;里，不是&amp;quot;物理的世界&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第五，专业知识的深度限制。&lt;/strong&gt; 一个模型可以&amp;quot;懂&amp;quot;很多领域，但在任何一个垂直领域，都不如该领域的专业工具。金融领域的彭博终端、医疗领域的影像诊断系统、工程领域的CAD软件——每个领域都有比通用AI更强大的专用工具。&lt;/p&gt;&#xA;&lt;p&gt;你发现了吗？这五个缺陷都有一个共同的解决方案——&lt;strong&gt;给AI装上手和脚，让它学会使用工具。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个你每天在用的ai工具使用案例&#34;&gt;二、一个你每天在用的&amp;quot;AI工具使用&amp;quot;案例&lt;/h2&gt;&#xA;&lt;p&gt;在深入技术之前，先看一个你很可能已经体验过的场景。&lt;/p&gt;&#xA;&lt;p&gt;你正在用某个AI助手。你问它：&amp;ldquo;帮我查一下今天北京的天气。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;它怎么做的？&lt;/p&gt;&#xA;&lt;p&gt;第一步，它意识到&lt;strong&gt;自己不知道今天的天气&lt;/strong&gt;（因为训练数据不包含实时信息）。&lt;/p&gt;&#xA;&lt;p&gt;第二步，它&lt;strong&gt;主动选择&lt;/strong&gt;使用一个搜索或天气API工具。&lt;/p&gt;&#xA;&lt;p&gt;第三步，它&lt;strong&gt;构造正确的参数&lt;/strong&gt;——把&amp;quot;北京&amp;quot;&amp;ldquo;今天&amp;quot;转换成API能理解的格式（比如城市代码和日期）。&lt;/p&gt;&#xA;&lt;p&gt;第四步，它&lt;strong&gt;调用工具&lt;/strong&gt;，获取返回结果：&amp;ldquo;多云，15-25°C&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;第五步，它&lt;strong&gt;理解工具返回的结果&lt;/strong&gt;，把它组织成一句通顺的话告诉你。&lt;/p&gt;&#xA;&lt;p&gt;这个过程看起来很简单，但每一步都是一个巨大的技术跨越。&lt;/p&gt;&#xA;&lt;p&gt;在2020年之前，没有任何AI能做到这种&amp;quot;主动判断自己不知道什么→决定用工具→正确使用工具→理解工具返回结果&amp;quot;的完整流程。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这是AI从&amp;quot;被动回答问题&amp;quot;到&amp;quot;主动解决问题&amp;quot;的分水岭。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三思考-行动-观察ai干活的三步循环&#34;&gt;三、&amp;ldquo;思考-行动-观察&amp;rdquo;：AI干活的三步循环&lt;/h2&gt;&#xA;&lt;p&gt;AI使用工具的背后，有一个非常优雅的核心架构——&lt;strong&gt;ReAct循环&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个名字是两个词的组合：&lt;strong&gt;Rea&lt;/strong&gt;soning（推理）+ &lt;strong&gt;Act&lt;/strong&gt;ion（行动）。它模仿了人类解决问题时最自然的方式：边想边做，边做边看，边看边调整。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步thought思考&#34;&gt;第一步：Thought（思考）&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;我知道什么？我还需要什么？哪种工具可以帮我获取我需要的信息？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是AI的&amp;quot;大脑&amp;quot;在工作。不是立刻回答，而是先规划。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步action行动&#34;&gt;第二步：Action（行动）&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;好，我用搜索引擎查这个关键词。&amp;rdquo;&#xA;&amp;ldquo;我用计算器算这个结果。&amp;rdquo;&#xA;&amp;ldquo;我调数据库里的这条记录。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是AI的&amp;quot;手&amp;quot;在工作。它调用工具，改变外部环境。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步observation观察&#34;&gt;第三步：Observation（观察）&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;嗯，搜索返回了三条结果。第一第二条似乎相关，第三条不太对。&amp;rdquo;&#xA;&amp;ldquo;计算器给我了一个数字：3571822。&amp;rdquo;&#xA;&amp;ldquo;数据库找到了我要的记录。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是AI的&amp;quot;眼睛&amp;quot;在工作。工具返回的信息被感知和理解。&lt;/p&gt;&#xA;&lt;p&gt;然后，循环继续：&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;基于刚才的搜索结果，我好像理解错了用户的问题，需要重新搜索……&amp;rdquo;&#xA;&amp;ldquo;有了新信息，我再想一下……&amp;rdquo;&#xA;&amp;ldquo;确认了，现在我可以给出最终答案了。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;思考→行动→观察→再思考&amp;quot;的循环，让AI不再是一个&amp;quot;一次性的答题机器&amp;rdquo;，而变成了一个&lt;strong&gt;可以持续探索、不断迭代的智能工作者&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;在一项实验中，使用ReAct循环的AI在ALFWorld（一个模拟家庭环境的测试）中的任务完成率达到了71%，而普通方法只有37%。换句话说，光是加上这个&amp;quot;想→做→看&amp;quot;的循环，AI的实用能力就能翻倍。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四工具使用的五个层次你的ai到哪一级了&#34;&gt;四、工具使用的五个层次——你的AI到哪一级了？&lt;/h2&gt;&#xA;&lt;p&gt;不是所有&amp;quot;工具使用&amp;quot;都是一回事。从笨拙到老练，AI的工具使用能力可以分成五个层次：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L1：被动调用。&lt;/strong&gt; 人类告诉AI&amp;quot;用计算器算这个&amp;quot;，AI才去算。这是最低层次，AI没有主动性。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L2：主动选择。&lt;/strong&gt; AI自己判断&amp;quot;这个问题我答不了，我需要查资料&amp;quot;。它自己决定什么时候该用什么工具。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L3：参数构造。&lt;/strong&gt; 不只是选对了工具，还能正确填入参数。比如调用天气API时，知道要把&amp;quot;北京&amp;quot;转成&amp;quot;beijing&amp;quot;，把&amp;quot;今天&amp;quot;转成今天的日期。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L4：多步编排。&lt;/strong&gt; 能组合多个工具完成复杂任务。先搜索背景信息，再调用分析工具处理数据，最后用图表工具生成可视化。就像人类完成一个项目时，会使用多种工具协同工作。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI真的需要一具身体吗？——具身智能如何重新定义「理解」</title>
				<link>https://lingyu7.com/posts/embodied-ai-thinking/</link>
				<pubDate>Thu, 30 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/embodied-ai-thinking/</guid>
				<description>&lt;h2 id=&#34;引言一个婴儿和一本书哪个更聪明&#34;&gt;引言：一个婴儿和一本书，哪个更聪明？&lt;/h2&gt;&#xA;&lt;p&gt;想象两个&amp;quot;学习者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;第一个，从出生起就坐在一个装满书籍的房间里，从未动过一下。它读完了所有书，能背诵百科全书，能回答任何理论问题——&amp;ldquo;重力是什么？&amp;ldquo;&amp;ldquo;火为什么是热的？&amp;quot;——答案完美无误。&lt;/p&gt;&#xA;&lt;p&gt;第二个，一个刚出生的婴儿。它什么书都没读过，但它在爬、在摸、在摔、在把东西塞进嘴里。它发现拍打水面会溅起水花，推倒积木会发出响声，松开手里的球，球会掉到地上。&lt;/p&gt;&#xA;&lt;p&gt;现在问题来了：&lt;strong&gt;这两个&amp;quot;学习者&amp;quot;中，谁更有可能真正理解这个世界？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;直觉告诉我们，婴儿虽然知识少，但它对世界的理解是&amp;quot;活的&amp;rdquo;——它知道重量、温度、因果、空间，这些不是从书上学来的，而是从身体的互动中&amp;quot;长&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个深刻的问题：&lt;strong&gt;AI要真正理解世界，是否需要一具身体？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一从离身到具身一场认知革命&#34;&gt;一、从&amp;quot;离身&amp;quot;到&amp;quot;具身&amp;rdquo;——一场认知革命&lt;/h2&gt;&#xA;&lt;p&gt;传统AI从诞生之初就是&amp;quot;离身&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;它坐在计算机里，处理的是符号、数字、文本，从未&amp;quot;触碰&amp;quot;过物理世界。它知道&amp;quot;杯子是圆柱形的，可以盛水&amp;rdquo;，但这个&amp;quot;知道&amp;quot;和人类对杯子的知道完全不同——你拿起杯子时能感受到它的重量、材质、温度，你知道杯柄应该怎么握，你知道倒热水时杯壁会变烫。&lt;/p&gt;&#xA;&lt;p&gt;这些&amp;quot;知道&amp;quot;不是来自书本，而是来自&lt;strong&gt;身体的直接体验&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;20世纪80年代，认知科学发生了一场革命：&lt;strong&gt;认知不是&amp;quot;大脑&amp;quot;的独立活动，而是&amp;quot;大脑-身体-环境&amp;quot;三方互动的产物。&lt;/strong&gt; 这就是&lt;strong&gt;具身认知&lt;/strong&gt;理论。&lt;/p&gt;&#xA;&lt;p&gt;它的核心主张很简单：你的身体形态决定了你如何思考。一个没有手的人，对&amp;quot;拿&amp;quot;的理解和有手的人完全不同。一个只会爬行的生物，和能飞行的生物，对&amp;quot;空间&amp;quot;的理解截然不同。&lt;strong&gt;你的身体是你理解世界的&amp;quot;硬件接口&amp;quot;——它决定了你接收什么信息，形成什么概念。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类的视觉系统不是被动接收图像的照相机，而是主动搜索的探照灯——眼睛不停地跳动，头转向声音的方向，手伸出去触摸。你的身体不是在&amp;quot;被动感知&amp;quot;，而是在&lt;strong&gt;主动构建&lt;/strong&gt;感知。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;离身&amp;quot;AI的根本局限：它缺少了&lt;strong&gt;感知-行动闭环&lt;/strong&gt;这个最基础的学习回路。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二感知-认知-行动智能的三角循环&#34;&gt;二、感知-认知-行动：智能的&amp;quot;三角循环&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;具身智能的工作方式，可以用一个简单的三角循环来理解：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知 → 认知 → 行动 → 感知 → 认知 → 行动……&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;每一步都依赖前一步，也改变着下一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知&lt;/strong&gt;：摄像头看到前方有一个障碍物，激光雷达测出距离，触觉传感器感受到地面摩擦力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;认知&lt;/strong&gt;：大脑处理这些信息——&amp;ldquo;这是个台阶，高度15厘米，表面是光滑的。我可以跨过去，但需要调整步幅，小心打滑。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;行动&lt;/strong&gt;：双腿调整步态，重心前移，跨过台阶。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;新的感知&lt;/strong&gt;：脚落地了，触觉反馈&amp;quot;地面稳固&amp;quot;，视觉确认&amp;quot;已经跨过&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个循环持续运转，每一轮都让系统更了解环境，也更了解自己。&lt;strong&gt;智能不是&amp;quot;想&amp;quot;出来的，而是在这个循环中&amp;quot;长&amp;quot;出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：&amp;ldquo;这不就是机器人控制吗？有什么特别的？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;特别之处在于：&lt;strong&gt;在这个循环中，行动不是为了完成任务，而是为了验证预测、获取信息。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;举个简单的例子。你走进一个黑暗的房间，你伸手去摸墙上的开关。你的手不是在&amp;quot;随机搜索&amp;quot;，而是在做一连串的&lt;strong&gt;预测&lt;/strong&gt;——&amp;ldquo;开关应该在门框右边30厘米处，高度约1.4米。&amp;ldquo;你的手移动到那个位置，摸了摸——没有。于是你更新预测：&amp;ldquo;可能开关在左边。&amp;ldquo;手又移动过去。&lt;/p&gt;&#xA;&lt;p&gt;这个过程的本质是什么？&lt;strong&gt;你在通过行动，主动地减少不确定性。&lt;/strong&gt; 你不是在&amp;quot;接收&amp;quot;信息，而是在&amp;quot;搜索&amp;quot;信息。&lt;/p&gt;&#xA;&lt;p&gt;这就是具身智能最核心的洞察：&lt;strong&gt;行动是认知的一部分，而不是认知的结果。&lt;/strong&gt; 你&amp;quot;思考&amp;quot;的方式，受限于你&amp;quot;行动&amp;quot;的方式——你&amp;quot;做&amp;quot;什么，决定了你&amp;quot;知道&amp;quot;什么。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三大模型给了ai大脑但身体呢&#34;&gt;三、大模型给了AI&amp;quot;大脑&amp;rdquo;，但身体呢？&lt;/h2&gt;&#xA;&lt;p&gt;2022年以来，大语言模型（LLM）的爆发让AI的&amp;quot;大脑&amp;quot;突飞猛进。GPT-4、Claude、Gemini能写诗、能编程、能推理——它们看起来&amp;quot;聪明&amp;quot;极了。&lt;/p&gt;&#xA;&lt;p&gt;但仔细想想，这些AI的生活是什么样的？&lt;/p&gt;&#xA;&lt;p&gt;它们没有身体，没有感官，永远生活在文本世界里。它们&amp;quot;知道&amp;quot;苹果是甜的，但从未尝过甜味；&amp;ldquo;知道&amp;quot;火是烫的，但从未感受过灼烧；&amp;ldquo;知道&amp;quot;落体是加速的，但从未体验过失重。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是&amp;quot;二手&amp;quot;的——从人类留下的文字中习得的，不是从亲身经历中长出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这导致了一个有趣的现象：大语言模型在某些方面&amp;quot;聪明得可怕&amp;rdquo;，在另一些方面&amp;quot;笨得令人发指&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;给它一个复杂的数学题，它可能轻松解决；但问它&amp;quot;一杯水从桌边掉下来会怎样&amp;rdquo;，它虽然能回答&amp;quot;会摔碎&amp;rdquo;，但它真的&amp;quot;理解&amp;quot;重力、惯性、冲击力这些概念吗？还是只是在复述训练数据中的模式？&lt;/p&gt;&#xA;&lt;p&gt;具身智能就是要解决这个问题：&lt;strong&gt;给AI一具身体，让它从物理世界的交互中，获得&amp;quot;第一手&amp;quot;的认知。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正在成为现实。2023-2024年，具身智能成为AI领域最热的方向之一。Google的PaLM-E将语言模型与机器人结合，让机器人理解自然语言指令并执行复杂任务。特斯拉的Optimus、Figure AI的人形机器人，都在探索&amp;quot;AI大脑+机器身体&amp;quot;的融合路径。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大模型扮演&amp;quot;大脑&amp;quot;的角色&lt;/strong&gt;——负责高层规划、语义理解、常识推理。它说&amp;quot;把桌上的苹果拿过来&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机器人扮演&amp;quot;身体&amp;quot;的角色&lt;/strong&gt;——负责感知环境、执行动作、反馈结果。它走到桌前，识别苹果，伸手去拿，握住，返回。&lt;/p&gt;&#xA;&lt;p&gt;大脑和身体通过&amp;quot;感知-行动循环&amp;quot;持续交互，形成一个完整的智能系统。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么行万里路比读万卷书更难&#34;&gt;四、为什么&amp;quot;行万里路&amp;quot;比&amp;quot;读万卷书&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能想问：既然大模型这么聪明，给它装个身体不就行了？为什么具身智能还没普及？&lt;/p&gt;&#xA;&lt;p&gt;因为&lt;strong&gt;真正的难点不在于&amp;quot;装身体&amp;quot;，而在于&amp;quot;让身体和大脑协同工作&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个挑战：仿真到现实的鸿沟。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在虚拟世界中训练的机器人，到了真实世界往往寸步难行。虚拟世界没有摩擦力、没有光线变化、没有传感器噪声、没有突发状况。一个在仿真环境中熟练的&amp;quot;抓取&amp;quot;动作，到了现实世界可能因为阳光角度不同、物体材质不同、甚至地面的一点点不平整就失败。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人在模拟器里学会了开车，但第一次上路还是紧张得手心冒汗。&lt;/strong&gt; 真实世界太复杂了，永远无法完美模拟。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个挑战：样本效率。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;大语言模型可以读几万亿个token学习——文本数据几乎无限。但机器人不一样，在真实世界&amp;quot;训练&amp;quot;一次，一秒就是一秒，无法加速。让机器人学会&amp;quot;抓杯子&amp;quot;，可能需要数万次尝试，每次都是实打实的物理成本。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个挑战：泛化能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个学会&amp;quot;抓红色杯子&amp;quot;的机器人，换成一个白色杯子，可能就抓不住了。换一个光照环境，可能就识别不出来了。换一个位置，手臂轨迹可能就撞到旁边的障碍物了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;人类可以毫不费力地把&amp;quot;抓杯子&amp;quot;这个技能泛化到任何杯子上——陶瓷杯、塑料杯、玻璃杯、大的、小的、有柄的、无柄的——但机器人做不到。&lt;/strong&gt; 这种&amp;quot;泛化&amp;quot;能力，是具身智能面临的核心难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五具身智能的终极意义重新定义理解&#34;&gt;五、具身智能的终极意义：重新定义&amp;quot;理解&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到文章开头的问题：AI真的需要一具身体吗？&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
