<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>大模型 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B/</link>
		<description>Recent content in 大模型 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sun, 30 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;举一反三&#39;——迁移学习如何让AI学会触类旁通</title>
				<link>https://lingyu7.com/posts/transfer-learning-ai-learns-to-learn/</link>
				<pubDate>Sun, 30 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/transfer-learning-ai-learns-to-learn/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你肯定有过这样的经历：&lt;/p&gt;&#xA;&lt;p&gt;学完骑自行车，再学骑电动车，几分钟就上手了。不是因为电动车更简单，而是因为你的身体已经记住了怎么保持平衡、怎么转弯、怎么刹车——这些技能从自行车&amp;quot;迁移&amp;quot;到了电动车。&lt;/p&gt;&#xA;&lt;p&gt;或者，你学会做番茄炒蛋之后，第一次做番茄鸡蛋面，虽然没做过，但你知道番茄要炒出汁、鸡蛋要滑嫩、火候要够——这些经验从一道菜&amp;quot;迁移&amp;quot;到了另一道菜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这种&amp;quot;举一反三&amp;quot;的能力，人类天生就有。但AI呢？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统上，AI的学习方式更像是&amp;quot;从零开始&amp;quot;。学完识别猫，如果要识别狗，它需要重新学习——用成千上万张狗的照片重新训练。它不会把&amp;quot;识别猫&amp;quot;的经验迁移到&amp;quot;识别狗&amp;quot;上。&lt;/p&gt;&#xA;&lt;p&gt;但这种情况正在改变。&lt;strong&gt;迁移学习（Transfer Learning），正是让AI学会&amp;quot;举一反三&amp;quot;的技术。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai不需要每次都从零开始&#34;&gt;核心观点：AI不需要每次都&amp;quot;从零开始&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你想让孩子学会辨认各种鸟类，你会怎么做？&lt;/p&gt;&#xA;&lt;p&gt;最笨的办法：给他一本厚厚的鸟类图鉴，让他把每一种鸟的图片、名字、特征都背下来。但更聪明的方式是：先教他&amp;quot;鸟&amp;quot;的概念——有翅膀、会飞、有喙。然后教他&amp;quot;鸟的类别&amp;quot;——鸣禽、猛禽、水鸟。等他掌握了这些基础，再教他识别具体的种类。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;迁移学习的思路，和&amp;quot;先教基础，再教具体&amp;quot;如出一辙。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统的AI训练方式，就像让一个孩子每次学新东西都从零开始。今天学猫，明天学狗，但学狗的时候已经把猫忘光了。这显然不是&amp;quot;智能&amp;quot;该有的样子。&lt;/p&gt;&#xA;&lt;p&gt;迁移学习改变了这一切。它的核心思想很简单：&lt;strong&gt;让AI先在一个大任务上学习通用知识，然后把这些知识迁移到具体的小任务上。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像一个学生先学基础数学，再去学微积分；先学编程基础，再去学深度学习。基础打好了，学什么都快。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么从零开始训练ai很傻&#34;&gt;为什么&amp;quot;从零开始&amp;quot;训练AI很傻？&lt;/h2&gt;&#xA;&lt;p&gt;你可能觉得&amp;quot;从零开始训练也没什么大不了的&amp;quot;，但现实中，从零训练一个AI模型，成本和代价高得惊人。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价一数据饥渴&#34;&gt;代价一：数据饥渴&lt;/h3&gt;&#xA;&lt;p&gt;一个典型的图像识别模型，需要数百万张标注好的图片。一张图片的标注成本大约0.5-2元人民币——也就是说，训练一个模型，光标注费用就可能上百万。&lt;/p&gt;&#xA;&lt;p&gt;更夸张的是语言模型。GPT-3的训练数据达到了45TB的文本，相当于整个英文维基百科的几十倍。这些文本的采集、清洗、标注，成本以亿计。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价二计算天价&#34;&gt;代价二：计算天价&lt;/h3&gt;&#xA;&lt;p&gt;训练一个大模型，需要成千上万块GPU同时运行数周甚至数月。GPT-3的单次训练成本据估计超过1200万美元。而像GPT-4这样的更大模型，成本只会更高。&lt;/p&gt;&#xA;&lt;h3 id=&#34;代价三时间成本&#34;&gt;代价三：时间成本&lt;/h3&gt;&#xA;&lt;p&gt;从零训练一个模型，不是几天，而是几个月。更关键的是，如果每次有新任务都要从头开始，AI的迭代速度会被严重拖慢。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;那迁移学习是怎么解决这些问题的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;很简单：&lt;strong&gt;让AI先&amp;quot;上一次大学&amp;quot;，然后&amp;quot;再去上班&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;上大学&amp;quot;阶段——在大规模通用数据上训练一个&amp;quot;基础模型&amp;rdquo;（也叫预训练模型）。这个阶段成本确实高，但只需要做一次。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;上班&amp;quot;阶段——在具体任务上&amp;quot;微调&amp;quot;这个基础模型。因为基础模型已经掌握了通用知识，所以微调只需要少量数据、少量计算、少量时间。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个比喻，其实就是迁移学习的精髓。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;迁移学习的三种武功从大改到微调到精调&#34;&gt;迁移学习的三种&amp;quot;武功&amp;rdquo;——从&amp;quot;大改&amp;quot;到&amp;quot;微调&amp;quot;到&amp;quot;精调&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;迁移学习不是一种单一的技术，而是一整套方法。根据&amp;quot;改动的程度&amp;quot;，可以分为三个层次。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一层全参数微调fine-tuning&#34;&gt;第一层：全参数微调（Fine-tuning）&lt;/h3&gt;&#xA;&lt;p&gt;这是最&amp;quot;简单粗暴&amp;quot;的迁移学习方法，也是最常用的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法&lt;/strong&gt;：拿到一个已经训练好的基础模型（比如BERT、GPT），然后在你自己的任务数据上继续训练，模型的所有参数都会跟着调整。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你请了一个顶级厨师（基础模型），他本来擅长做西餐。你让他到你的中餐馆上班，他需要重新学习怎么用炒锅、怎么调酱汁——但刀工、火候、对食材的理解这些基本功还在，所以学得很快。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果&lt;/strong&gt;：在大多数任务上，微调的效果都很好。比如在GLUE（自然语言理解基准测试）上，微调后的BERT在所有任务上都超过了从零训练的模型，平均高出13%以上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;代价&lt;/strong&gt;：但全参数微调有一个问题——如果模型很大，成本依然很高。微调一个175B参数的GPT-3，虽然比从头训练便宜，但依然需要数千美元的计算资源。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二层参数高效微调loraadapter&#34;&gt;第二层：参数高效微调（LoRA、Adapter）&lt;/h3&gt;&#xA;&lt;p&gt;既然全参数微调还是贵，那能不能只改一小部分参数？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;LoRA（Low-Rank Adaptation）&lt;/strong&gt; 就是答案。它的思路非常巧妙：&lt;/p&gt;&#xA;&lt;p&gt;研究发现，大模型在微调时，参数的变化量其实很小，而且这些变化可以用一个&amp;quot;低秩矩阵&amp;quot;来近似。简单说就是：&lt;strong&gt;你不需要动整个模型，只需要加一个小小的&amp;quot;适配器&amp;quot;，然后只训练这个适配器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：你买的手机，出厂时系统是标准的。但你可以安装一些&amp;quot;插件&amp;quot;——比如一个拍照增强插件、一个电池优化插件。这些插件不改变手机系统本身，但能大幅提升特定功能的表现。&lt;/p&gt;&#xA;&lt;p&gt;LoRA就是给大模型安装&amp;quot;插件&amp;quot;——只训练不到0.01%的参数，就能达到全参数微调95-99%的效果。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前要几万美元的微调，现在只需要几十美元。而且因为改动很小，同一个基础模型可以同时&amp;quot;服务&amp;quot;多个不同的任务——只需为每个任务准备一个轻量级的LoRA插件。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三层少样本学习maml原型网络&#34;&gt;第三层：少样本学习（MAML、原型网络）&lt;/h3&gt;&#xA;&lt;p&gt;如果连微调数据都没有，只有几个样本怎么办？&lt;/p&gt;&#xA;&lt;p&gt;这就是&lt;strong&gt;少样本学习&lt;/strong&gt;的用武之地。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAML（Model-Agnostic Meta-Learning）&lt;/strong&gt; 的思路是：不直接训练一个模型来解决某个任务，而是训练一个&amp;quot;学习算法&amp;quot;——让模型学会&amp;quot;如何快速学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像教一个人&amp;quot;如何学习&amp;quot;而不是教他&amp;quot;某个具体知识&amp;quot;。你教他记忆方法、信息检索技巧、逻辑推理框架——然后不管让他学什么，他都能快速上手。&lt;/p&gt;&#xA;&lt;p&gt;MAML训练出来的模型，在一个新任务上只需要看5个样本，就能快速适应。在Omniglot（手写字符识别）数据集上，MAML的5-shot准确率达到了98.8%——几乎和人类不相上下。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个真实的奇迹clip的零样本迁移&#34;&gt;一个真实的奇迹：CLIP的&amp;quot;零样本迁移&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;如果说上面这些方法还需要&amp;quot;一点数据&amp;quot;，那CLIP（Contrastive Language-Image Pre-training）直接把迁移学习推向了极致——&lt;strong&gt;零样本迁移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP是OpenAI在2021年发布的一个模型。它的训练方式很特别：不是像传统模型那样给每张图片打标签（&amp;ldquo;这是猫&amp;rdquo;、&amp;ldquo;这是狗&amp;rdquo;），而是让模型学习&amp;quot;图片&amp;quot;和&amp;quot;文字描述&amp;quot;之间的对应关系。&lt;/p&gt;&#xA;&lt;p&gt;它看了4亿张图片和对应的文字描述（比如一张猫的照片对应&amp;quot;一只橘猫在窗台上晒太阳&amp;quot;），然后学会了把&amp;quot;图片的含义&amp;quot;和&amp;quot;文字的含义&amp;quot;映射到同一个&amp;quot;语义空间&amp;quot;中。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;意味着你不需要给CLIP准备任何训练数据，直接问它：&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;这张图片里是猫还是狗？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;CLIP会自己把图片转换成&amp;quot;语义向量&amp;quot;，把&amp;quot;猫&amp;quot;和&amp;quot;狗&amp;quot;也转换成向量，然后比较谁更接近——就能直接回答你。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet（1000类图像分类基准）上，CLIP的零样本准确率达到了76.2%，而传统的有监督ResNet-50（用120万张标注图片训练的模型）的准确率也不过76.3%。&lt;strong&gt;CLIP没看过一张ImageNet的训练图片，就达到了和看过120万张图片的模型几乎一样的水平。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是迁移学习的终极形态：&lt;strong&gt;学一次，用遍天下。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不只是ai迁移学习和大模型时代的范式革命&#34;&gt;不只是AI——迁移学习和大模型时代的&amp;quot;范式革命&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;迁移学习的兴起，从根本上改变了AI的开发方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2018年之前&lt;/strong&gt;，做AI就像&amp;quot;手工作坊&amp;quot;——每个任务都要从头采集数据、设计模型、训练部署。做一个猫狗识别系统，需要几个月；做一个情感分析系统，又需要几个月。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI真的需要一具身体吗？——具身智能如何重新定义「理解」</title>
				<link>https://lingyu7.com/posts/embodied-ai-thinking/</link>
				<pubDate>Thu, 30 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/embodied-ai-thinking/</guid>
				<description>&lt;h2 id=&#34;引言一个婴儿和一本书哪个更聪明&#34;&gt;引言：一个婴儿和一本书，哪个更聪明？&lt;/h2&gt;&#xA;&lt;p&gt;想象两个&amp;quot;学习者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;第一个，从出生起就坐在一个装满书籍的房间里，从未动过一下。它读完了所有书，能背诵百科全书，能回答任何理论问题——&amp;ldquo;重力是什么？&amp;ldquo;&amp;ldquo;火为什么是热的？&amp;quot;——答案完美无误。&lt;/p&gt;&#xA;&lt;p&gt;第二个，一个刚出生的婴儿。它什么书都没读过，但它在爬、在摸、在摔、在把东西塞进嘴里。它发现拍打水面会溅起水花，推倒积木会发出响声，松开手里的球，球会掉到地上。&lt;/p&gt;&#xA;&lt;p&gt;现在问题来了：&lt;strong&gt;这两个&amp;quot;学习者&amp;quot;中，谁更有可能真正理解这个世界？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;直觉告诉我们，婴儿虽然知识少，但它对世界的理解是&amp;quot;活的&amp;rdquo;——它知道重量、温度、因果、空间，这些不是从书上学来的，而是从身体的互动中&amp;quot;长&amp;quot;出来的。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个深刻的问题：&lt;strong&gt;AI要真正理解世界，是否需要一具身体？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一从离身到具身一场认知革命&#34;&gt;一、从&amp;quot;离身&amp;quot;到&amp;quot;具身&amp;rdquo;——一场认知革命&lt;/h2&gt;&#xA;&lt;p&gt;传统AI从诞生之初就是&amp;quot;离身&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;它坐在计算机里，处理的是符号、数字、文本，从未&amp;quot;触碰&amp;quot;过物理世界。它知道&amp;quot;杯子是圆柱形的，可以盛水&amp;rdquo;，但这个&amp;quot;知道&amp;quot;和人类对杯子的知道完全不同——你拿起杯子时能感受到它的重量、材质、温度，你知道杯柄应该怎么握，你知道倒热水时杯壁会变烫。&lt;/p&gt;&#xA;&lt;p&gt;这些&amp;quot;知道&amp;quot;不是来自书本，而是来自&lt;strong&gt;身体的直接体验&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;20世纪80年代，认知科学发生了一场革命：&lt;strong&gt;认知不是&amp;quot;大脑&amp;quot;的独立活动，而是&amp;quot;大脑-身体-环境&amp;quot;三方互动的产物。&lt;/strong&gt; 这就是&lt;strong&gt;具身认知&lt;/strong&gt;理论。&lt;/p&gt;&#xA;&lt;p&gt;它的核心主张很简单：你的身体形态决定了你如何思考。一个没有手的人，对&amp;quot;拿&amp;quot;的理解和有手的人完全不同。一个只会爬行的生物，和能飞行的生物，对&amp;quot;空间&amp;quot;的理解截然不同。&lt;strong&gt;你的身体是你理解世界的&amp;quot;硬件接口&amp;quot;——它决定了你接收什么信息，形成什么概念。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;人类的视觉系统不是被动接收图像的照相机，而是主动搜索的探照灯——眼睛不停地跳动，头转向声音的方向，手伸出去触摸。你的身体不是在&amp;quot;被动感知&amp;quot;，而是在&lt;strong&gt;主动构建&lt;/strong&gt;感知。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;离身&amp;quot;AI的根本局限：它缺少了&lt;strong&gt;感知-行动闭环&lt;/strong&gt;这个最基础的学习回路。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二感知-认知-行动智能的三角循环&#34;&gt;二、感知-认知-行动：智能的&amp;quot;三角循环&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;具身智能的工作方式，可以用一个简单的三角循环来理解：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知 → 认知 → 行动 → 感知 → 认知 → 行动……&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;每一步都依赖前一步，也改变着下一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;感知&lt;/strong&gt;：摄像头看到前方有一个障碍物，激光雷达测出距离，触觉传感器感受到地面摩擦力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;认知&lt;/strong&gt;：大脑处理这些信息——&amp;ldquo;这是个台阶，高度15厘米，表面是光滑的。我可以跨过去，但需要调整步幅，小心打滑。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;行动&lt;/strong&gt;：双腿调整步态，重心前移，跨过台阶。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;新的感知&lt;/strong&gt;：脚落地了，触觉反馈&amp;quot;地面稳固&amp;quot;，视觉确认&amp;quot;已经跨过&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个循环持续运转，每一轮都让系统更了解环境，也更了解自己。&lt;strong&gt;智能不是&amp;quot;想&amp;quot;出来的，而是在这个循环中&amp;quot;长&amp;quot;出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：&amp;ldquo;这不就是机器人控制吗？有什么特别的？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;特别之处在于：&lt;strong&gt;在这个循环中，行动不是为了完成任务，而是为了验证预测、获取信息。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;举个简单的例子。你走进一个黑暗的房间，你伸手去摸墙上的开关。你的手不是在&amp;quot;随机搜索&amp;quot;，而是在做一连串的&lt;strong&gt;预测&lt;/strong&gt;——&amp;ldquo;开关应该在门框右边30厘米处，高度约1.4米。&amp;ldquo;你的手移动到那个位置，摸了摸——没有。于是你更新预测：&amp;ldquo;可能开关在左边。&amp;ldquo;手又移动过去。&lt;/p&gt;&#xA;&lt;p&gt;这个过程的本质是什么？&lt;strong&gt;你在通过行动，主动地减少不确定性。&lt;/strong&gt; 你不是在&amp;quot;接收&amp;quot;信息，而是在&amp;quot;搜索&amp;quot;信息。&lt;/p&gt;&#xA;&lt;p&gt;这就是具身智能最核心的洞察：&lt;strong&gt;行动是认知的一部分，而不是认知的结果。&lt;/strong&gt; 你&amp;quot;思考&amp;quot;的方式，受限于你&amp;quot;行动&amp;quot;的方式——你&amp;quot;做&amp;quot;什么，决定了你&amp;quot;知道&amp;quot;什么。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三大模型给了ai大脑但身体呢&#34;&gt;三、大模型给了AI&amp;quot;大脑&amp;rdquo;，但身体呢？&lt;/h2&gt;&#xA;&lt;p&gt;2022年以来，大语言模型（LLM）的爆发让AI的&amp;quot;大脑&amp;quot;突飞猛进。GPT-4、Claude、Gemini能写诗、能编程、能推理——它们看起来&amp;quot;聪明&amp;quot;极了。&lt;/p&gt;&#xA;&lt;p&gt;但仔细想想，这些AI的生活是什么样的？&lt;/p&gt;&#xA;&lt;p&gt;它们没有身体，没有感官，永远生活在文本世界里。它们&amp;quot;知道&amp;quot;苹果是甜的，但从未尝过甜味；&amp;ldquo;知道&amp;quot;火是烫的，但从未感受过灼烧；&amp;ldquo;知道&amp;quot;落体是加速的，但从未体验过失重。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是&amp;quot;二手&amp;quot;的——从人类留下的文字中习得的，不是从亲身经历中长出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这导致了一个有趣的现象：大语言模型在某些方面&amp;quot;聪明得可怕&amp;rdquo;，在另一些方面&amp;quot;笨得令人发指&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;给它一个复杂的数学题，它可能轻松解决；但问它&amp;quot;一杯水从桌边掉下来会怎样&amp;rdquo;，它虽然能回答&amp;quot;会摔碎&amp;rdquo;，但它真的&amp;quot;理解&amp;quot;重力、惯性、冲击力这些概念吗？还是只是在复述训练数据中的模式？&lt;/p&gt;&#xA;&lt;p&gt;具身智能就是要解决这个问题：&lt;strong&gt;给AI一具身体，让它从物理世界的交互中，获得&amp;quot;第一手&amp;quot;的认知。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正在成为现实。2023-2024年，具身智能成为AI领域最热的方向之一。Google的PaLM-E将语言模型与机器人结合，让机器人理解自然语言指令并执行复杂任务。特斯拉的Optimus、Figure AI的人形机器人，都在探索&amp;quot;AI大脑+机器身体&amp;quot;的融合路径。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;大模型扮演&amp;quot;大脑&amp;quot;的角色&lt;/strong&gt;——负责高层规划、语义理解、常识推理。它说&amp;quot;把桌上的苹果拿过来&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机器人扮演&amp;quot;身体&amp;quot;的角色&lt;/strong&gt;——负责感知环境、执行动作、反馈结果。它走到桌前，识别苹果，伸手去拿，握住，返回。&lt;/p&gt;&#xA;&lt;p&gt;大脑和身体通过&amp;quot;感知-行动循环&amp;quot;持续交互，形成一个完整的智能系统。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么行万里路比读万卷书更难&#34;&gt;四、为什么&amp;quot;行万里路&amp;quot;比&amp;quot;读万卷书&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能想问：既然大模型这么聪明，给它装个身体不就行了？为什么具身智能还没普及？&lt;/p&gt;&#xA;&lt;p&gt;因为&lt;strong&gt;真正的难点不在于&amp;quot;装身体&amp;quot;，而在于&amp;quot;让身体和大脑协同工作&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个挑战：仿真到现实的鸿沟。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在虚拟世界中训练的机器人，到了真实世界往往寸步难行。虚拟世界没有摩擦力、没有光线变化、没有传感器噪声、没有突发状况。一个在仿真环境中熟练的&amp;quot;抓取&amp;quot;动作，到了现实世界可能因为阳光角度不同、物体材质不同、甚至地面的一点点不平整就失败。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人在模拟器里学会了开车，但第一次上路还是紧张得手心冒汗。&lt;/strong&gt; 真实世界太复杂了，永远无法完美模拟。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个挑战：样本效率。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;大语言模型可以读几万亿个token学习——文本数据几乎无限。但机器人不一样，在真实世界&amp;quot;训练&amp;quot;一次，一秒就是一秒，无法加速。让机器人学会&amp;quot;抓杯子&amp;quot;，可能需要数万次尝试，每次都是实打实的物理成本。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个挑战：泛化能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个学会&amp;quot;抓红色杯子&amp;quot;的机器人，换成一个白色杯子，可能就抓不住了。换一个光照环境，可能就识别不出来了。换一个位置，手臂轨迹可能就撞到旁边的障碍物了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;人类可以毫不费力地把&amp;quot;抓杯子&amp;quot;这个技能泛化到任何杯子上——陶瓷杯、塑料杯、玻璃杯、大的、小的、有柄的、无柄的——但机器人做不到。&lt;/strong&gt; 这种&amp;quot;泛化&amp;quot;能力，是具身智能面临的核心难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五具身智能的终极意义重新定义理解&#34;&gt;五、具身智能的终极意义：重新定义&amp;quot;理解&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到文章开头的问题：AI真的需要一具身体吗？&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
