最近看到一篇超级及时的Agent综述论文《Toward Efficient Agents: Memory, Tool Learning, and Planning–通向高效的智能体:记忆,工具学习和规划》,强烈推荐给正在搞大模型智能体Agent、LLM应用或AI系统工程的小伙伴们!

现在大家都在狂堆Agent的成功率和复杂任务能力,但真实落地时最扎心的其实是效率:token烧钱烧得飞起、延迟高到用户跑路、步骤爆炸导致API费用失控……这篇论文正好抓住这个痛点,把LLM-based Agent拆成三大核心组件——记忆(Memory)工具学习(Tool Learning)规划(Planning),系统梳理了2023-2026年一大波高效优化方法(压缩上下文、预算引导调用、结构化搜索、离线蒸馏等),发现虽然实现千差万别,但高层设计思路惊人一致:都往“有界控制 + 离线迁移 + Pareto最优”方向收敛。

最实用的是,它首次比较完整地提出了Agent效率的评估框架(固定预算比效果 / 同等效果比成本,用Pareto前沿看权衡),汇总了各组件的效率基准和指标,还指出了标准化报告的必要性(token数、调用轮次、延迟、API成本得统一报),以及多模态、长期任务、真实部署等未来硬骨头。阅读,笔记,整理,并在此分享!

图:高效智能体研究的进化轨迹。该图分为四个主要分支:记忆(Momery)、工具学习(Tool Learning)、计划(Planning)和基准(Benchmarks)。关键作品及其机构关系按时间顺序绘制,以说明2023年至2025年该领域的发展和分类

范式变迁: CNN and RNN => 大语言模型(LLM) => 基于大语言模型的智能体(LLM-based Agents)

这种向自主行动的转变,不仅带来了指数级资源消耗(递归调用,长上下文,多次工具交互),更引入了一个关键的瓶颈:效率。

虽然LLM的部署已经是资源密集型的,但在智能体系统中,这一挑战明显加剧。与通常以线性单圈查询响应格式运行的标准LLM不同,由于其递归特性,智能体消耗的资源呈指数级增长。为了自动化复杂的现实世界任务,智能体必须在多个步骤中执行广泛的记忆管理、迭代工具使用和复杂的规划。这种多步骤执行导致了令人望而却步的延迟、上下文窗口饱和(Context window saturation)和过度的token消耗,引发了人们对这些功能日益强大的系统的长期可持续性和公平可访问性的深切关注。

要理解智能体效率的紧迫性,必须考察典型的智能体工作流。在收到用户指令后,智能体会参与一个递归循环,该循环大量使用以下关键组件:记忆、计划和工具学习来观察输出并提供最终解决方案:

在每次迭代n中,系统必须首先从记忆中检索相关上下文,对当前状态进行推理以制定计划,执行包含特定工具的操作,并处理由此产生的观察结果。这个循环产生了token的复合累积,其中步骤n的输出成为步骤n+1的输入成本,导致高推理成本和慢响应时间。因此,仅仅进行模型压缩是不够的。因此,将高效智能体定义:在最大化任务成功率的同时最小化资源消耗(token、延迟、步骤、API调用费用等)。

从LLM与Agent的区别中看Agent的效率

从功能的角度来看,智能体的特点是它能够:1.规划和执行多个步骤,2.调用外部工具或环境命令来获取信息并执行操作,3.在检索或更新的记忆上调整后续决策。

Agent比纯LLM多出的成本项:工具调用成本、记忆读写成本、重试成本等。 再次强调效率的两种比较方式,LLM效率与Agent效率最大区别在于后者更关注多步、工具、记忆交互的累积成本。因此,提高智能体效率不仅意味着减少语言生成,还意味着降低工具或记忆调用以及沿轨迹重试的频率和选择性,以实现更好的性价比权衡。

图示:从大语言模型LLM到智能体:独立推理到具有记忆、规划和工具学习的轨迹级推理,同时引入额外成本

为提高智能体效率,有三个战略方向即把现有为高效所需的工作清晰分为三大方向:1)高效记忆:压缩历史上下文、管理记忆存储和优化上下文检索的技术。2)高效的工具学习:减少工具调用次数和减少外部交互延迟的策略。3)高效规划:减少解决问题所需的执行步骤和API调用数量的策略。接下来,就三个方向展开介绍!

高效的记忆

LLM智能体的一个主要效率瓶颈是长上下文和长时间交互引起的计算和token开销,其中智能体可能会反复重新处理巨量历史信息以采取行动。记忆增强推理(Memory Augmented Reasoning)提供了一种有原则的方法来缓解这种低效。通过存储和重用过去的经验,包括成功、失败和交互跟踪,智能体可以避免冗余计算,做出更明智的决策,并减少代价高昂的重试。从这个意义上讲,记忆(Memory)不仅仅是一个辅助组件。它是提高智能体系统整体效率-有效性权衡的关键机制。

由于记忆是提高效率的核心,因此如何设计高效的内存模块成为一个重要问题。把记忆生命周期周期分为构建(Construction) → 管理(Management) → 访问(Access)三个阶段:

  • 第一阶段-构建:

    长上下文压缩(文本压缩、潜在表示压缩,如MemGPT、COMEDY等)

  • 第二阶段-管理:

    遗忘策略(规则-based、LLM-based、混合)、增删改操作(如MemoryOS)

  • 第三阶段-访问:

    相关性选择 + 整合方式(规则+检索、文本/向量融合)

图示:高效记忆概览图,将智能体记忆生命周期总结为三个阶段:

  1. 记忆构建:压缩工作记忆和外部记忆中的长交互上下文,以减轻token爆炸(Token Explosion);

  2. 记忆管理:通过基于规则、基于LLM或混合策略来管理和更新累积的记忆存储,以控制延迟;

  3. 记忆访问:它决定了要检索哪些记忆以及如何将它们集成到模型中。

    记忆构建阶段

解决“无限历史 vs 有限上下文窗口”的矛盾,通过压缩/组织历史信息来减少输入token。分为工作记忆(Working Memory,在推理时直接可用) 和 外部记忆(External Memory,需检索):

  1. 工作记忆
  • 文本形式:保持提示长度恒定,通过重写/压缩历史(如COMEDY两阶段蒸馏关键事件+用户画像;MemAgent/MEM1每步重写紧凑状态;AgentFold主动多尺度折叠摘要)。

  • 潜在形式(latent,最受欢迎的高效方向):把历史压缩成KV缓存/隐藏激活/记忆令牌(如Activation Beacon信标压缩;MemoRAG/MemoryLLM插入记忆令牌更新KV;M+双层潜在+共同训练检索;Titans测试时神经记忆更新;MemGen用RL训练记忆触发器)。

    优势:无外部检索延迟,直接条件生成;

    缺点:扩展仍增加计算,信息可能稀释。

  1. 外部记忆
  • 基于项(Item-based):提取/总结/结构化存条目(如MemoryBank用Ebbinghaus遗忘曲线;Mem0/Memory-R1提取候选记忆;MemoChat/RMM建主题索引;ReasoningBank蒸馏策略;Agent KB日志→结构化知识库)。

  • 基于图(Graph-based):构建实体-关系-时间图(如GraphReader分段压缩成图;Zep时间感知KG;AriGraph/Mem0g动态更新语义-叙事图)。

  • 分层/分级(Hierarchical):多层存储+粗到细访问(如MemGPT OS式分页;MemoryOS三层:短期/中期/长期;MemOS MemCubes;ReadAgent/HiAgent/H-MEM/LightMem多级索引+感官-STM-LTM管道)。

    优势:理论上无限存储、针对性强;

      缺点:引入检索延迟和噪声。
    

效率导向机制的记忆-下表分类法组织的当前的记忆技术&框架,涵盖工作记忆、外部记忆和多智能体记忆。

记忆管理阶段

防止记忆无限膨胀导致检索变慢、存储成本爆炸。核心是决定增/删/改/合并。

  • **基于规则的记忆管理(Rule-based Mgt):是指用于更新、删除和合并现有内存的预定义规则。因为这些规则是静态的,所以这种方法成本低廉,可以防止整体内存大小不受控制地增长。**低成本、可预测(如Ebbinghaus衰减、FIFO、容量触发迁移、时间阈值总结)。
  • **基于大模型的记忆管理(LLM-based Mgt):可以根据其决策形式进行广泛分类:从一组离散的操作中进行选择,还是生成开放式更新。**自适应但贵(如Mem0/Memory-R1的ADD/UPDATE/DELETE;RMM合并相似项;A-MEM生成式链接+重写)。
  • **混合记忆管理(Hybrid mgt):将轻量级的基于规则的控制与选择性的基于LLM的操作相结合,以平衡效率和有效性。**最常见(如MemoryOS/LightMem层间触发+LLM;Agent KB/ACE阈值去重+LLM排序;Zep图冲突验证用LLM)。

需要权衡:规则快但可能丢关键信息;LLM准但每步调用贵;混合最实用。

记忆访问阶段

从海量记忆中挑出少量相关部分注入提示,平衡质量 vs 延迟/token。

  • 记忆选择(Selection)
  • 规则增强检索(时间+重要性+相关性评分)
  • 图扩展(锚定事实后邻居扩散)
  • LLM/工具委托(MemGPT把层当工具;GraphReader步进工具检索)
  • 分层递归(HiAgent/H-MEM两/四层索引)
  • 训练优化(RMM RL重排序;Memento学Q函数)
  • 记忆整合(Integration)
  • 文本:过滤+压缩成cheatsheet/笔记/适应模板(如RECOMP提取-压缩-前置;DC-RS合成紧凑备忘;A-MEM线性化)。
  • 潜在:直接注入KV/记忆令牌(如MemoryLLM/M+/MemoRAG/Memory 3)。

多智能体记忆

多智能体的记忆要单独聊一聊。在基于LLM的多智能体系统(MAS)中,许多早期的研究,如CAMEL,主要关注文本通信协议,其中记忆通常可以被视为隐式的,并以简单的形式实现。最近的研究已经开始明确关注MAS中的记忆概念。这些面向记忆的工作仍然符合这里的框架中提出的分类法,这里对多智能体系统中的记忆进行一个集中的讨论。

多智能体系统(MAS)中记忆从隐式转向显式,重点减少冗余。

  • 共享记忆:共享内存集中了跨代理的可重用信息,以减少冗余,因为在单个提示中复制多代理交互历史在令牌预算和推理时间方面都很昂贵。MS将智能体步骤存储为提示-答案对,并在将其添加到共享池之前用LLM评估器对其进行过滤,然后使用接受的记忆不断优化检索器但频繁的基于LLM的评分会引入大量的token和延迟开销。

    集中复用(如G-Memory三层图;MemIndex意图索引;LatentMAS/KVComm共享KV缓存)。

  • 本地记忆:随着每个智能体的个人存储的增长,冗余会在其内部累积,因此检索和更新应保持代理本地;同时,本地记忆管理可以借鉴单代理方法的思想,如选择性写入、整合和容量控制。内在记忆智能体为每个智能体配备一个角色对齐的结构化记忆模板,并通过将智能体的最新输出折叠回同一模板来更新它,直到达成共识。AgentNet为路由器和执行器维护固定大小的内存模块,并使用动态内存管理和频率、最近度和唯一性等信号来修剪容量低的效用轨迹。DAMCS引入了A-KGMS,将经验整合到面向目标的分层知识图中,并通过围绕最新目标节点的邻域查询进行规划,以避免完整的历史共享并减少开销。

    每个智能体独立(如角色模板、固定模块、目标导向KG)。

  • 混合记忆:结合了共享内存和本地内存,其效率通常得益于两者之间的协调,包括向每个内存写入什么、何时从哪个内存中检索以及如何控制冗余。

    最有前景(如SRMT个人向量+共享关注;LEGOMem模块化子任务记忆)。

    优势:共享减重复、本地低噪声;

    缺点:共享易不一致、混合同步复杂。

整体结论与权衡

高效记忆的核心是Pareto最优:在给定token/延迟预算下最大化性能,或在相同性能下最小化成本。主要掌握如下权衡:

  • 压缩强度 vs 信息丢失
  • 在线管理(实时适应但贵) vs 离线(省推理但慢适应)
  • 工作记忆(直接但扩展贵) vs 外部(无限但检索贵)
  • 规则(快) vs LLM(准) vs 混合(平衡但复杂)

高效的工具学习

工具学习(Tool Learning)为LLM提供了一个与物理世界和虚拟环境互动的界面。一般来说,工具指的是搜索、代码沙盒(解释器)和许多其他通用API端点。要调用这些工具,一个基本的解决方案是向提示词提供几个候选,让LLM思考并选择最合适的一个,并填写参数。然而,随着任务变得更加复杂,将有更多的工具调用。例如,LLM可以调用搜索API 600次,以解决深度研究问题。如此长的轨迹极大地挑战了模型的长上下文理解能力,并带来了巨大的成本。为此,探索有效的工具学习策略至关重要。

总体而言,工具学习有两种效率:

(1)工具学习本身对于解决复杂问题是有效的。与具有很长CoT的任务相比,工具学习可以有效地优化轨迹长度,并显示高效的推理过程。

(2)工具学习可以优化为调用更少的工具,从而降低工具学习本身的成本。对于具有数百个工具调用的复杂任务,最佳方法可以显著减少工具调用的数量。因此,整个过程将更加高效。

图:高效的工具学习包括三个阶段:1.工具选择通过检索或分类识别候选工具;2.工具调用处理参数填充和执行,重点关注成本感知约束和预算反馈,3.工具集成推理通过选择性调用和策略优化优化高效的推理轨迹。

工具选择

面对海量工具池(数百上千个API/函数),快速、准确、低成本地选出需要的工具是第一步效率瓶颈。主要方法分类:

  • 外部检索器(External Retriever)

    :用RAG式检索工具描述(如ProTIP对比学习关联查询-工具;AnyTool分层缩小范围;Toolshed/ToolScope压缩描述+RAG)。

  • 多标签分类(Multi-Label Classification)

    :用小模型预测工具概率(如TinyAgent用DeBERTa-v3;Tool2Vec合成示例嵌入工具,支持动态更新)。

  • 词汇表检索(Vocabulary-based)

    :最受欢迎的高效方向,将工具编码成特殊token(toolken)嵌入LLM词汇表,直接生成选择(如ToolkenGPT/Toolken+;ToolGen单一toolken统一生成;CoTools单一toolken+检索器处理大规模候选)。

优势对比:词汇表方法提示最短、零额外计算;外部检索器泛化好但有检索延迟;多标签分类平衡但需额外模型。

工具调用

选好工具后,如何高效填充参数、执行调用、处理结果是第二大成本点。关键技术与代表工作:

  • 就地参数填充

    :在CoT中直接生成参数(如Toolformer;CoA符号抽象加速)。

  • 并行工具调用

    :大幅降低串行延迟(如LLMCompiler编译框架并行执行;LLM-Tool Compiler融合相似工具;CATP-LLM成本感知并行)。

  • 成本感知调用

    :显式考虑预算(如BTP背包问题预计算调用频率;TROVE紧凑可重用工具箱;ToolCoder工具当代码生成)。

  • 测试时扩展

    :搜索剪枝无效路径(如ToolChain用A)。

  • 后训练/RL优化

    :最小化调用次数(如OTC-PO在RL中加工具惩罚;ToolOrchestra效率奖励训练协调器)。

趋势:从单次串行 → 并行+成本引导 → 学习最小化调用。

工具集成推理

最高层次:不再把工具当成“外挂”,而是让推理过程本身决定“是否/何时/怎么用工具”,实现工具与思考的深度融合。主要方向:

  • 选择性调用

    :模型学会判断“自己知道就别查”(如TableMind计划-行动-反思+RAPO;SMART CoT微调决定内部知识 vs 工具;Agent-FLAN能力拆分子集训练)。

  • 成本感知策略优化

    :用RL统一优化推理+工具轨迹(如ARTIST结果RL;ReTool交织自然语言与代码;ToolRL格式+正确性奖励;AutoTIR惩罚不必要调用;PORTool衰减因子偏好接近终点的步骤)。

核心思想:通过后训练或测试时优化,让模型内化常见工具能力,只在必要时外调,显著缩短轨迹长度。

整体结论与权衡

高效工具学习的共同高层原则:最小化工具调用次数 + 并行/批量执行 + 将工具能力逐步内化到模型。 主要需考虑的权衡:

  • 检索/分类 vs 词汇表:泛化 vs 极致速度
  • 并行 vs 迭代细化:延迟 vs 准确性
  • 测试时搜索 vs 后训练:灵活但贵 vs 一次性训练高效
  • 外挂工具 vs 内化:扩展性 vs token/延迟节省

下表内容是有代表性的高效工具方法的总结:根据工具选择、工具调用和工具集成推理对它们进行分类。

高效的规划

高效的规划(Planning)其核心哲学是将审议视为一个资源受限的控制问题,而不是无限的推理;其机制是优化单智能体推理的深度(通过搜索和学习)和多智能体协作的广度(通过拓扑和协议);其目标是最大限度地提高任务成功对延迟、令牌消耗和通信开销的限制。

这一观点代表了与传统规划和现代方法的明显转变,传统规划假设有丰富的计算资源,而现代方法将规划与直接文本生成混为一谈。相反,高效的规划将推理概念化为操作控制,其中智能体必须不断平衡改进计划的边际效用与其计算成本。在更广泛的架构中,规划器充当在线计算分配的中心引擎,与记忆组件协同工作,以摊销成本和工具来外部化执行。接下来将通过两种主要范式来调查高效规划的前景:单智能体规划,它优化了个人的审议轨迹;多智能体协作规划,它最大限度地减少了分布式系统中的协调开销。

图示:高效规划概述。旨在最大限度地提高任务成功率,同时最大限度地降低成本。1.单智能体方法优化推理策略(控制、搜索、分解)或通过学习(策略、记忆)进化。2.多智能体方法通过拓扑优化、上下文优化和协调蒸馏来减少开销。

单智能体规划效率

单智能体规划的核心目标是优化单步推理深度与总执行步骤,减少无效探索与重试。主要子方向有:

  • 推理时策略(Inference-Time Strategy)
  • 自适应预算与控制

    :动态决定“快思考”还是“慢思考”(如SwiftSage的双过程:快速生成 vs 深度验证;Budget-Aware预算约束下工具策略选择)。

  • 结构化搜索

    :用受控搜索取代自由生成(如LATS的蒙特卡罗树搜索+自反思+价值估计;CATS成本感知剪枝;ToolChain的A搜索;Reflexion的口头强化学习减少试验次数)。

  • 任务分解与路由

    :提前规划子任务,避免端到端长链(如ReWOO的规划-工作者-求解器三阶段分离;HuggingGPT的任务路由器)。

  • 学习为基础的演化(Learning-based Evolution)
  • 策略优化

    :用RL/偏好学习最小化步骤(如QLASS的Q值评论器引导高效路径;ETO试错偏好学习;AutoTIR等惩罚不必要调用)。

  • 记忆与技能获取

    :构建可复用技能库减少重复规划(如VOYAGER的迭代技能库+自动课程;GAP的图基分解+并行执行)。

趋势:推理时从无结构生成 → 结构化/预算引导搜索;长期从在线试错 → 离线策略/技能蒸馏,实现成本摊销

多智能体协作效率

多智能体协作效率的核心目标是减少多智能体间的通信开销、上下文冗余与同步延迟。主要子方向有:

  • 拓扑效率与稀疏化(Topological Efficiency and Sparsification)
  • 链式/线性(如Chain-of-Agents顺序传递上下文,避免全连接);
  • DAG/图基(如MacNet拓扑排序执行);
  • 动态剪枝(如AgentPrune学习通信边剪枝;MARS无辩论管道)。
  • 协议与上下文优化(Protocol and Context Optimization)
  • 压缩交互表示(如CodeAgents用伪代码/简洁协议交互;Free-MAD提示优化只保留关键推理)。
  • 协调蒸馏到规划(Distilling Coordination into Planning)
  • 教师-学生蒸馏(如MAGDI从交互图蒸馏协调知识;D&R从辩论痕迹构建偏好树,蒸馏高效协作策略)。

趋势:从全连接广播 → 稀疏拓扑 + 压缩协议 + 离线协调学习,显著降低多代理系统的通信token与延迟。

整体结论与权衡

高效规划的共同高层原则

  • 将审议重构为资源约束控制问题
  • 减少搜索/推理深度(结构化搜索+剪枝);
  • 迁移计算到离线(策略优化、技能记忆、协调蒸馏);
  • 用结构化检索/分解取代自由生成。

主要需考虑的权衡:

  • 搜索深度 vs 准确性(过度剪枝可能丢优解);
  • 推理时适应 vs 离线训练成本(自适应灵活但贵,学习高效但需数据);
  • 单代理独立 vs 多代理协作(独立简单但瓶颈明显,协作强大但通信贵);
  • 整体Pareto前沿:固定预算下比成功率,或同等成功率下比token/步骤/延迟。

下表里是有代表性的高效规划方法的综述:将单但智能体方法分为推理时间策略(自适应控制、搜索、分解)和基于学习的进化(策略、记忆),以及多智能体协作效率。

基准和评估

关于高效Agent评估体系,当前的Agent基准严重偏向有效性(effectiveness,如成功率),而效率(efficiency,如token、延迟、步骤、工具调用次数等成本)被严重忽视,导致方法间难以公平比较。

当前基准存在的问题

  • 大多数基准只报告任务成功率,忽略资源消耗(token数、延迟、API费用、环境交互步骤等)。

  • 效率指标异构、不统一(如有的报token,有的报运行时,有的报工具调用轮次),术语混乱,导致结果不可比。

  • 组件级评估缺失:记忆、工具、规划的效率贡献往往淹没在端到端成功率中,难以隔离分析。

  • 缺少预算约束协议:真实部署中资源有限,但基准很少强制固定预算或Pareto比较。

    效率评估范式

效率定义为在最大化有效性的同时最小化成本,给出两种互补比较方式:

  • 固定成本预算下比有效性

    (e.g., 固定100k token预算,谁成功率更高)。

  • 相当有效性水平下比成本

    (e.g., 达到90%成功率,谁token/延迟更少)。 这种trade-off通过Pareto前沿(Pareto frontier)可视化:高效方法应位于前沿(同等成本更高成功率,或同等成功率更低成本)。

需要强调的是效率不仅限于LLM推理成本,还包括闭环交互成本(工具调用、环境步骤、记忆读写、重试等)。

三个组件的效率相关基准汇总

Memory(记忆)

  • HotpotQA、Natural Questions:多跳QA,间接评估长上下文记忆有效性与压缩效率。
  • GAIA:交互式多步任务,考察记忆在长时序中的token/步骤效率。
  • Evo-Memory:专门测试时自演化记忆基准,指标包括环境步骤数(越少越高效)。
  • StoryBench:长时序多轮记忆评估,报告运行时成本与token消耗。
  • MemBench / LoCoMo 等:内存操作效率,读写时间、检索延迟、压缩率等。

Tool Learning(工具学习)

  • BFCL、NesTools、StableToolBench、ToolBench:工具调用准确性+效率,指标包括工具调用次数、并行利用率、轨迹长度、token/延迟。
  • MCP-RADAR / MCP-Bench:工具使用能力与效率(选择效率、计算资源、执行速度)。
  • T-Eval:细粒度工具利用分解,支持步骤级token、延迟、调用轮次。
  • TPS-Bench / CostBench:复合任务工具效率,包含成本-of-pass(预期货币成本)、无效调用数。

Planning(规划)

  • WebArena、SWE-Bench:真实世界规划任务,可提取步骤数、搜索深度、token使用。
  • GAIA:多步规划+工具,效率通过执行步骤、通信开销评估。
  • TPS-Bench:规划+工具复合,token、端到端时间、工具轮次、成本差距。
  • CostBench:动态环境成本最优规划,路径偏差、无效调用等。

主要未来方向

  • 标准化效率评估
  • 建立统一报告框架:每篇工作强制报告多维度成本(token、延迟、调用轮次、货币成本等)+ Pareto前沿。
  • 开发内置预算约束基准(如固定token的GAIA变体),支持组件级分解评估。
  • 记忆方向
  • 探索新型压缩/混合表示,保留显著信息的最小化提取。
  • 设计异步在线-离线混合、自适应管理架构,减少LLM调用。
  • 推进多代理一致性协议、动态索引、噪声过滤,提升共享/混合记忆效率。
  • 针对长期/多模态:粗到细分层检索、视觉历史优化。
  • 工具学习方向
  • 零样本/动态泛化工具选择(如高级检索+嵌入扩展)。
  • 依赖感知并行规划 + RL预算整合,彻底最小化调用。
  • 端到端紧耦合:工具作为认知架构一部分,验证奖励减少冗余。
  • 小模型蒸馏 + 可诱导函数,降低API依赖。
  • 规划方向
  • 低开销结构化搜索 + 精确自适应预算分配。
  • 高级拓扑剪枝、协议压缩、协调蒸馏,保留多样性同时降通信。
  • 跨组件预算感知控制框架,实现内存-工具-规划整体Pareto优化。
  • 过程级奖励 + 离线技能构建,摊销长期成本。
  • 新兴前沿
  • 潜在空间推理

    :为代理定制潜在机制,适应工具/长时序/验证需求。

  • 多模态效率

    :联合性能-成本评估,适应性计算分配(如多模态快/慢模式)。

  • 部署感知设计

    :比较真多模型 vs 单模型角色扮演,量化复杂性收益。

  • 真实世界长时序

    :更精细成本模型、可持续递归执行。

总之,高效的智能体Agent研究的终极目标是从“能解决复杂任务”转向“在严格资源约束下可持续解决复杂任务”,三大组件的高效思路已趋同(有界控制、离线迁移、Pareto最优边界),但评估标准化、泛化、多模态、真实部署仍是最大瓶颈。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

在这里插入图片描述

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

在这里插入图片描述

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

img

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

img

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

img

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

img

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

img

L5阶段:专题集丨特训篇 【录播课】

img
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐