<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Agent on 灵语AI</title>
		<link>https://lingyu7.com/tags/agent/</link>
		<description>Recent content in Agent on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 15 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/agent/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI再聪明，没有&#39;手&#39;也白搭——工具使用如何把AI从书呆子变成实干家</title>
				<link>https://lingyu7.com/posts/ai-tool-use-from-brain-to-agent/</link>
				<pubDate>Tue, 15 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-tool-use-from-brain-to-agent/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一下：&lt;/p&gt;&#xA;&lt;p&gt;你是世界上最聪明的人。你读过所有书，知道所有知识。但——你没有双手，无法触碰任何东西，也不能用任何工具。&lt;/p&gt;&#xA;&lt;p&gt;有人问你：&amp;ldquo;鱼香肉丝怎么做？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你能把步骤背得一字不差。&amp;ldquo;猪肉切丝腌制，泡椒剁碎，调好糖醋汁…&amp;ldquo;每一步都说得清清楚楚。&lt;/p&gt;&#xA;&lt;p&gt;但你没法真的走进厨房。&lt;/p&gt;&#xA;&lt;p&gt;你没法拿起菜刀、打开燃气灶、尝一口咸淡。你知道一切，却做不了任何事。&lt;/p&gt;&#xA;&lt;p&gt;听起来很荒谬？但这恰恰是目前大多数AI的真实处境。&lt;/p&gt;&#xA;&lt;p&gt;大语言模型就像这个&amp;quot;天才书呆子&amp;rdquo;——它们读过海量文本，知道多得惊人的知识，但如果没有工具的帮助，它们永远只能停留在&amp;quot;说话&amp;quot;的层面。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;工具使用（Tool Use），是AI从&amp;quot;知道分子&amp;quot;走向&amp;quot;实干家&amp;quot;的关键一跃。&lt;/strong&gt; 这篇文章，我要带你看看这一跃是怎么发生的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai的五个先天缺陷为什么光有知识不够&#34;&gt;一、AI的五个&amp;quot;先天缺陷&amp;rdquo;——为什么光有知识不够&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：AI不已经能写文章、写代码、回答问题了吗？这还不够？&lt;/p&gt;&#xA;&lt;p&gt;不够。因为纯语言模型有五个无法绕过的天花板：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，知识的保质期。&lt;/strong&gt; 一个模型的训练数据截止于某一天。那之后发生的事情，它一概不知。去年的大选结果、今天的热搜、刚刚发布的财报——它要么不知道，要么只能编一个。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，事实的不确定性。&lt;/strong&gt; 模型经常&amp;quot;编故事&amp;quot;——这就是AI幻觉（Hallucination）。一个没有数据库、搜索引擎可以查证的语言模型，就像一个参加闭卷考试的学生：遇到不会的题，它只能硬编一个答案，还假装很确定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，数学的短板。&lt;/strong&gt; 大模型对语言很擅长，但对精确计算却很笨。你让它算&amp;quot;3857×926&amp;quot;，它可能给出一个接近但不准确的数字。它靠的是&amp;quot;猜&amp;quot;而不是&amp;quot;算&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四，与真实世界的隔离。&lt;/strong&gt; 模型只能读写文本。它没法打开网页查询实时信息，没法发送邮件，没法操作你的日历，没法控制智能家居。它生活在&amp;quot;语言的世界&amp;quot;里，不是&amp;quot;物理的世界&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第五，专业知识的深度限制。&lt;/strong&gt; 一个模型可以&amp;quot;懂&amp;quot;很多领域，但在任何一个垂直领域，都不如该领域的专业工具。金融领域的彭博终端、医疗领域的影像诊断系统、工程领域的CAD软件——每个领域都有比通用AI更强大的专用工具。&lt;/p&gt;&#xA;&lt;p&gt;你发现了吗？这五个缺陷都有一个共同的解决方案——&lt;strong&gt;给AI装上手和脚，让它学会使用工具。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个你每天在用的ai工具使用案例&#34;&gt;二、一个你每天在用的&amp;quot;AI工具使用&amp;quot;案例&lt;/h2&gt;&#xA;&lt;p&gt;在深入技术之前，先看一个你很可能已经体验过的场景。&lt;/p&gt;&#xA;&lt;p&gt;你正在用某个AI助手。你问它：&amp;ldquo;帮我查一下今天北京的天气。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;它怎么做的？&lt;/p&gt;&#xA;&lt;p&gt;第一步，它意识到&lt;strong&gt;自己不知道今天的天气&lt;/strong&gt;（因为训练数据不包含实时信息）。&lt;/p&gt;&#xA;&lt;p&gt;第二步，它&lt;strong&gt;主动选择&lt;/strong&gt;使用一个搜索或天气API工具。&lt;/p&gt;&#xA;&lt;p&gt;第三步，它&lt;strong&gt;构造正确的参数&lt;/strong&gt;——把&amp;quot;北京&amp;quot;&amp;ldquo;今天&amp;quot;转换成API能理解的格式（比如城市代码和日期）。&lt;/p&gt;&#xA;&lt;p&gt;第四步，它&lt;strong&gt;调用工具&lt;/strong&gt;，获取返回结果：&amp;ldquo;多云，15-25°C&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;第五步，它&lt;strong&gt;理解工具返回的结果&lt;/strong&gt;，把它组织成一句通顺的话告诉你。&lt;/p&gt;&#xA;&lt;p&gt;这个过程看起来很简单，但每一步都是一个巨大的技术跨越。&lt;/p&gt;&#xA;&lt;p&gt;在2020年之前，没有任何AI能做到这种&amp;quot;主动判断自己不知道什么→决定用工具→正确使用工具→理解工具返回结果&amp;quot;的完整流程。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这是AI从&amp;quot;被动回答问题&amp;quot;到&amp;quot;主动解决问题&amp;quot;的分水岭。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三思考-行动-观察ai干活的三步循环&#34;&gt;三、&amp;ldquo;思考-行动-观察&amp;rdquo;：AI干活的三步循环&lt;/h2&gt;&#xA;&lt;p&gt;AI使用工具的背后，有一个非常优雅的核心架构——&lt;strong&gt;ReAct循环&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个名字是两个词的组合：&lt;strong&gt;Rea&lt;/strong&gt;soning（推理）+ &lt;strong&gt;Act&lt;/strong&gt;ion（行动）。它模仿了人类解决问题时最自然的方式：边想边做，边做边看，边看边调整。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步thought思考&#34;&gt;第一步：Thought（思考）&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;我知道什么？我还需要什么？哪种工具可以帮我获取我需要的信息？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是AI的&amp;quot;大脑&amp;quot;在工作。不是立刻回答，而是先规划。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步action行动&#34;&gt;第二步：Action（行动）&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;好，我用搜索引擎查这个关键词。&amp;rdquo;&#xA;&amp;ldquo;我用计算器算这个结果。&amp;rdquo;&#xA;&amp;ldquo;我调数据库里的这条记录。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是AI的&amp;quot;手&amp;quot;在工作。它调用工具，改变外部环境。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步observation观察&#34;&gt;第三步：Observation（观察）&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;嗯，搜索返回了三条结果。第一第二条似乎相关，第三条不太对。&amp;rdquo;&#xA;&amp;ldquo;计算器给我了一个数字：3571822。&amp;rdquo;&#xA;&amp;ldquo;数据库找到了我要的记录。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这是AI的&amp;quot;眼睛&amp;quot;在工作。工具返回的信息被感知和理解。&lt;/p&gt;&#xA;&lt;p&gt;然后，循环继续：&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;基于刚才的搜索结果，我好像理解错了用户的问题，需要重新搜索……&amp;rdquo;&#xA;&amp;ldquo;有了新信息，我再想一下……&amp;rdquo;&#xA;&amp;ldquo;确认了，现在我可以给出最终答案了。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;思考→行动→观察→再思考&amp;quot;的循环，让AI不再是一个&amp;quot;一次性的答题机器&amp;rdquo;，而变成了一个&lt;strong&gt;可以持续探索、不断迭代的智能工作者&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;在一项实验中，使用ReAct循环的AI在ALFWorld（一个模拟家庭环境的测试）中的任务完成率达到了71%，而普通方法只有37%。换句话说，光是加上这个&amp;quot;想→做→看&amp;quot;的循环，AI的实用能力就能翻倍。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四工具使用的五个层次你的ai到哪一级了&#34;&gt;四、工具使用的五个层次——你的AI到哪一级了？&lt;/h2&gt;&#xA;&lt;p&gt;不是所有&amp;quot;工具使用&amp;quot;都是一回事。从笨拙到老练，AI的工具使用能力可以分成五个层次：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L1：被动调用。&lt;/strong&gt; 人类告诉AI&amp;quot;用计算器算这个&amp;quot;，AI才去算。这是最低层次，AI没有主动性。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L2：主动选择。&lt;/strong&gt; AI自己判断&amp;quot;这个问题我答不了，我需要查资料&amp;quot;。它自己决定什么时候该用什么工具。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L3：参数构造。&lt;/strong&gt; 不只是选对了工具，还能正确填入参数。比如调用天气API时，知道要把&amp;quot;北京&amp;quot;转成&amp;quot;beijing&amp;quot;，把&amp;quot;今天&amp;quot;转成今天的日期。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;L4：多步编排。&lt;/strong&gt; 能组合多个工具完成复杂任务。先搜索背景信息，再调用分析工具处理数据，最后用图表工具生成可视化。就像人类完成一个项目时，会使用多种工具协同工作。&lt;/p&gt;</description>
			</item>
			<item>
				<title>当AI和AI聊天时，谁在「以讹传讹」？——多智能体系统中的级联幻觉</title>
				<link>https://lingyu7.com/posts/ai-cascading-hallucinations-multi-agent/</link>
				<pubDate>Tue, 04 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-cascading-hallucinations-multi-agent/</guid>
				<description>&lt;h2 id=&#34;引言传话游戏里的ai&#34;&gt;引言：「传话游戏」里的AI&lt;/h2&gt;&#xA;&lt;p&gt;小时候玩过一个游戏：几个人排成一排，第一个人悄悄说一句话，然后依次往后传。传到最后一个的时候，原话往往已经面目全非——&amp;ldquo;明天下午三点开会&amp;quot;可能变成了&amp;quot;明天晚上吃山竹开会&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个游戏的学名叫&amp;quot;传话游戏&amp;quot;（Telephone Game），它完美地揭示了人类信息传递中的一个核心问题：&lt;strong&gt;每个环节都会引入误差，而这些误差会累积、放大，最终让信息完全变样。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2024年到2026年，AI研究者在做一件听起来很酷的事情——让多个AI智能体（Agent）协同工作，像一个团队一样分工合作。一个负责查资料，一个负责分析，一个负责写报告，一个负责审核。&lt;/p&gt;&#xA;&lt;p&gt;然后他们发现了一个令人不安的现象：&lt;strong&gt;当AI和AI聊天时，传话游戏的问题不但没有消失，反而变得更严重了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这，就是我们今天要聊的——&lt;strong&gt;级联幻觉&lt;/strong&gt;（Cascading Hallucination）。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一什么是级联幻觉一个ai的谎言如何变成真相&#34;&gt;一、什么是级联幻觉？——一个AI的「谎言」如何变成「真相」&lt;/h2&gt;&#xA;&lt;p&gt;先别急着恐慌，来看一个具体场景。&lt;/p&gt;&#xA;&lt;p&gt;假设你设计了一个三人AI团队，帮你写一份关于&amp;quot;量子计算在医疗领域的应用&amp;quot;的报告：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;Agent A（研究员）&lt;/strong&gt;：负责搜索资料，找论文和案例&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Agent B（分析师）&lt;/strong&gt;：根据A找的资料，分析趋势和前景&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Agent C（写手）&lt;/strong&gt;：把B的分析写成一篇完整的报告&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;看起来分工明确，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但问题来了。Agent A在搜索时，偶然看到一篇不靠谱的博客文章，说&amp;quot;量子计算已经成功治愈了癌症&amp;quot;。A没有仔细验证，就把它写进了搜索结果。&lt;/p&gt;&#xA;&lt;p&gt;Agent B拿到A的资料，默认这些信息都是经过验证的。它在此基础上分析：&amp;ldquo;量子计算在癌症治疗领域已取得突破性进展，预计未来三年内将改变肿瘤治疗格局。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;Agent C拿到B的分析，把它写成了报告的开头：&amp;ldquo;根据最新研究，量子计算已成功应用于癌症临床治疗……&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你拿到报告时，内容看起来头头是道、逻辑严密。但你不知道的是，整个报告的根基，只是一个AI的&amp;quot;幻觉&amp;quot;——一个未被验证的、错误的&amp;quot;事实&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是级联幻觉的核心：一个微小的错误，在多个AI的接力传递中，被层层放大，最终变成一份看起来完全可信的错误结论。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2026年，CHARM框架的论文（arXiv:2606.04435）量化了这个问题的严重程度：在传统的单步检查机制下，超过80%的级联错误会被漏检。也就是说，&lt;strong&gt;你装了&amp;quot;防幻觉&amp;quot;检测器，但它只能抓到不到两成的&amp;quot;连锁错误&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么错误会越传越离谱三个关键机制&#34;&gt;二、为什么错误会越传越离谱？——三个关键机制&lt;/h2&gt;&#xA;&lt;p&gt;级联幻觉之所以可怕，是因为它不是简单的&amp;quot;把错误传下去&amp;quot;，而是包含着三个彼此强化的机制。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制一：信任假设（Trust Assumption）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在多智能体系统中，每个Agent默认一个前提——上游传来的信息是经过验证的。它没有能力也没有义务去核实每一个事实。&lt;/p&gt;&#xA;&lt;p&gt;这不是AI的&amp;quot;偷懒&amp;quot;，而是设计使然。如果每个Agent每收到一条信息都要去查证来源，那协作效率会变得极低，还不如一个Agent从头干到尾。&lt;/p&gt;&#xA;&lt;p&gt;但这种&amp;quot;信任假设&amp;quot;就像传话游戏里的每个人——你听到上一句时，默认它是原话，然后在此基础上继续传递。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制二：误差放大（Error Amplification）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不仅仅是&amp;quot;传递&amp;quot;错误，更可怕的是，下游Agent会&amp;quot;包装&amp;quot;错误。&lt;/p&gt;&#xA;&lt;p&gt;Agent A说&amp;quot;量子计算可能对癌症治疗有帮助&amp;quot;，到了Agent B那里变成了&amp;quot;量子计算在癌症治疗领域有重大突破&amp;quot;——因为B在分析时，需要让它看起来更有说服力、更专业。到了Agent C，可能变成了&amp;quot;量子计算已治愈多名癌症患者&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;2025年发表在arXiv上的视觉多智能体研究（arXiv:2509.21789）揭示了更具体的机制：&lt;strong&gt;&amp;ldquo;内在幻觉&amp;rdquo;（Intrinsic Hallucination，模型自己产生的错误）和&amp;quot;幻觉传播&amp;quot;（Hallucination Propagation，上游错误被下游采纳）会相互耦合。&lt;/strong&gt; 即使你极力降低单个模型的幻觉率，也无法阻断幻觉在系统层面的传播和放大。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制三：确认偏差（Confirmation Bias）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当一个信息被多个AI&amp;quot;引用&amp;quot;之后，它看起来就更&amp;quot;可信&amp;quot;了。每一轮传递，都会让错误信息在上下文中被反复提及，从而增加它的&amp;quot;可信度权重&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这就像在网上反复看到一条谣言——即使它最初是假的，但看到一百次之后，你也会开始怀疑&amp;quot;也许是真的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI也不例外。2026年的&amp;quot;集体幻觉&amp;quot;研究（arXiv:2606.07941）发现，多轮交互中，AI对错误信息的&amp;quot;置信度&amp;quot;会随着被重复引用的次数而增加，最终形成整个系统的&amp;quot;集体幻觉&amp;quot;——所有AI都相信了同一个错误。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三什么时候最容易出事级联幻觉的五个高危场景&#34;&gt;三、什么时候最容易出事？——级联幻觉的五个高危场景&lt;/h2&gt;&#xA;&lt;p&gt;不是所有多智能体系统都会出问题。级联幻觉在特定条件下更容易爆发：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;① 长链路协作&lt;/strong&gt;：协作链条越长，中间环节越多，级联幻觉的概率越高。每增加一个环节，就多了一个&amp;quot;误差放大&amp;quot;的机会。3个Agent的链条，比2个Agent的风险高得多；5个Agent的链条，风险指数级增长。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;② 强依赖关系&lt;/strong&gt;：下游高度依赖上游输出，没有独立验证能力。比如Agent B只能看Agent A的资料，没有自己的信息来源，那A的幻觉必然污染B。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;③ 开放性任务&lt;/strong&gt;：没有客观标准答案的任务——比如&amp;quot;写一篇关于AI未来的分析文章&amp;quot;——幻觉更难被发现。相比之下，&amp;ldquo;计算1+1&amp;quot;这种任务，幻觉几乎不可能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;④ 弱验证机制&lt;/strong&gt;：系统中缺乏验证和审核环节。如果每个Agent只管输出，没有人（或AI）回头检查，那错误就会一路绿灯。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;⑤ 事实密集型任务&lt;/strong&gt;：需要处理大量事实性信息的任务——比如医疗报告、法律文书、新闻报道——幻觉的影响更大，而且一个错误可能导致灾难性的后果。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四怎么防ai界正在尝试的四种解法&#34;&gt;四、怎么防？——AI界正在尝试的四种解法&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究者并不是只会发现问题。针对级联幻觉，已经提出了几类有效的对抗策略。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;解法一：建立&amp;quot;验证节点&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;COCO框架（arXiv:2508.13815，2025）提出了一个简单但有效的思路：在AI协作链条中插入专门的&amp;quot;验证节点&amp;quot;，不参与内容生成，只负责检查上游输出是否靠谱。&lt;/p&gt;&#xA;&lt;p&gt;这就像编辑部里，写稿的人只管写，还有专门的校对和审核。验证节点可以拦截错误，在它传递到下游之前就把它叫停。&lt;/p&gt;&#xA;&lt;p&gt;COCO的实验表明，这种方法能在不显著增加成本的前提下，将性能提升6.5%，而且用30倍小的模型就达到了大型模型95%的效果——&lt;strong&gt;验证不是越强的AI越有效，而是专门化的AI更有效。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
