← 文章 / AI技术
中原小当家 2小时前 · 2026-09-10 14:55:16 · 0 阅读

Manus多AIAgent架构拆解:通用Agent和WorkflowAgent到底怎么选?

AI Agent领域最火的产品之一,用三个Agent(规划+执行+审核)+ Computer Use + 虚拟机,实现了"说一句话就能帮你完成复杂任务"的体验。本文从产品设计、架构原理、优缺点对比到开源实现,系统拆解这类通用Agent的设计思路。

一、Manus类产品的核心能力:全流程自主完成任务

这类通用Agent的核心卖点是:用户只需要说一句话,Agent就能自主完成从分析到执行的全流程。

具体能力包括:

  • 自主分析任务需求:理解用户的模糊需求,拆解成可执行的步骤
  • 调用虚拟环境中的工具:在隔离的虚拟机中执行命令、读写文件、搜索网络、操作浏览器
  • 想法转化为具体成果:不是只给建议,而是直接产出文件、代码、报告等可交付物

自主执行的五个阶段

任务规划 → 任务执行 → 任务反思 → 中间过程文件 → 输出最终结果
  • 任务规划:对输入问题做粗粒度的全局性规划,确定大的方向和步骤
  • 任务执行:根据每个规划步骤,进一步拆解出更细粒度的子步骤,逐步执行,调用浏览器搜索、编写代码、生成文档等工具
  • 任务反思:执行命令出现报错时,自动分析错误原因,调整策略后重新执行或更换命令
  • 中间过程文件:执行过程中产生的临时文件、草稿、数据
  • 输出最终结果:整理所有中间成果,输出用户需要的最终交付物

这个过程的关键是自主性——不需要人一步步指导,Agent自己规划、自己执行、自己纠错、自己交付。


二、总体架构:三个Agent + Computer Use + 虚拟机

2.1 多智能体架构

Manus类产品的核心是三个Agent的协作:

Agent职责类比
规划Agent(Planning)任务拆解、全局规划、步骤编排项目经理
执行Agent(Action)具体执行、调用工具、操作环境工程师
审核Agent(Quality)质量检查、结果验证、错误发现测试/QA

三个Agent各司其职:规划Agent负责"想清楚做什么",执行Agent负责"动手做",审核Agent负责"检查做得对不对"。发现问题就反馈给规划或执行Agent,形成闭环。

2.2 Computer Use

执行Agent通过Computer Use技术操作虚拟机:像人一样看屏幕、点鼠标、敲键盘,不需要依赖特定API。这让Agent能操作任何有图形界面的应用。

2.3 虚拟机

所有操作都在隔离的虚拟机中执行,保证安全——即使Agent执行了危险操作,也不会影响真实系统。

2.4 可执行的基础操作

  • 命令执行:支持执行各种Linux命令
  • 文件读写:支持多种文件格式的创建、读取、修改
  • 搜索:根据用户输入,从网上搜索各种数据源
  • 浏览器操作:阅读搜索结果中的网页URL内容,提取信息

三、通用Agent vs Workflow Agent:怎么选?

这是做AI应用落地最关键的选型问题。两类Agent各有优劣,适用场景完全不同。

3.1 优缺点对比

维度Manus类通用AgentWorkflow类Agent
优点自主规划执行,更灵活智能流程可控、稳定、速度快

无需投入人力做编排运行步骤、进度可预知

每次探索都会有新的、不同的方案多次执行的结果都稳定复现
缺点流程不可控、不稳定、速度非常慢机械、不灵活、只能从头运行

运行会耗费大量token和时间需要投入人力提前编排

目前无法人工干预,会一路走到底每次执行的结果没有新意
适合场景探索未知解决方案的复杂问题标准化的场景,对可控、稳定、速度有要求

创作类的场景需重复执行的场景

单次执行的场景

3.2 选型决策

选通用Agent的情况:

  • 任务没有固定流程,需要探索
  • 每次任务都不一样,不需要重复执行
  • 追求创新和不同的解决方案
  • 可以接受较慢的速度和较高的成本

选Workflow Agent的情况:

  • 任务流程固定,需要稳定复现
  • 需要高频重复执行
  • 对速度和成本有严格要求
  • 需要人工干预和流程控制

实际项目中往往是混合使用:用Workflow Agent处理标准化的高频任务,用通用Agent处理需要探索的复杂任务,两者互补。


四、开源实现:OpenManus案例

OpenManus是开源社区复刻Manus的项目,目标是提供透明、可本地部署的AI Agent框架,支持复杂任务自动化。

4.1 核心特点

  • 模块化设计:支持多LLM和工具链,方便替换和扩展
  • 支持多样任务:执行代码、文件处理、搜索网络信息
  • 实时反馈机制:可视化展示Agent思考链与执行过程
  • 零门槛接入:无需云服务,直接操作本地环境

4.2 主要功能

功能说明
Python代码解释器实时生成和执行代码,完成复杂的计算和自动化任务
文件处理系统支持多种文档的生成和管理
网络搜索工具自动检索网络信息,为任务提供数据支持
CUB(Computer Use Browser)模拟人类操作,完成网页浏览和交互任务

4.3 技术原理

  • 基于LLM的核心架构:LLM根据输入生成回答或内容,系统将结果返回给用户
  • 灵活的配置机制:用户基于配置文件选择不同的LLM模型
  • 输入处理:对用户输入进行格式化或分段,确保LLM能理解
  • 输出处理:对LLM生成的内容进行优化或筛选,更符合用户需求
  • 模块化设计:基于模块化设计,支持插件机制,方便开发者扩展功能
  • 多Agent架构 + ReAct机制:基于ReAct的思考-行动-观察循环执行任务

五、总结

Manus类通用Agent代表了AI Agent的一个重要方向:从"对话AI"到"行动AI"的跃迁。

它的核心价值是: 

  1. 全流程自主:规划、执行、反思、交付,不需要人一步步指导   
  2. 三Agent协作:规划+执行+审核,形成质量闭环
  3. Computer Use + 虚拟机:突破API限制,能操作任何应用,同时保证安全   
  4. 灵活但有代价:灵活智能的同时,也带来了不可控、慢、贵的问题

对于AI应用落地者来说,关键不是盲目追新,而是根据场景选择合适的Agent范式:标准化高频任务用Workflow,探索性复杂任务用通用Agent,两者结合才能兼顾效率和灵活性。

开源项目OpenManus的出现,让这类架构不再是商业产品的专属,开发者可以本地部署、二次开发,推动整个生态的快速迭代。

原始来源: 中原小当家

评论 (0)