Manus多AIAgent架构拆解:通用Agent和WorkflowAgent到底怎么选?
AI Agent领域最火的产品之一,用三个Agent(规划+执行+审核)+ Computer Use + 虚拟机,实现了"说一句话就能帮你完成复杂任务"的体验。本文从产品设计、架构原理、优缺点对比到开源实现,系统拆解这类通用Agent的设计思路。
一、Manus类产品的核心能力:全流程自主完成任务
这类通用Agent的核心卖点是:用户只需要说一句话,Agent就能自主完成从分析到执行的全流程。
具体能力包括:
- 自主分析任务需求:理解用户的模糊需求,拆解成可执行的步骤
- 调用虚拟环境中的工具:在隔离的虚拟机中执行命令、读写文件、搜索网络、操作浏览器
- 想法转化为具体成果:不是只给建议,而是直接产出文件、代码、报告等可交付物
自主执行的五个阶段
任务规划 → 任务执行 → 任务反思 → 中间过程文件 → 输出最终结果- 任务规划:对输入问题做粗粒度的全局性规划,确定大的方向和步骤
- 任务执行:根据每个规划步骤,进一步拆解出更细粒度的子步骤,逐步执行,调用浏览器搜索、编写代码、生成文档等工具
- 任务反思:执行命令出现报错时,自动分析错误原因,调整策略后重新执行或更换命令
- 中间过程文件:执行过程中产生的临时文件、草稿、数据
- 输出最终结果:整理所有中间成果,输出用户需要的最终交付物
这个过程的关键是自主性——不需要人一步步指导,Agent自己规划、自己执行、自己纠错、自己交付。
二、总体架构:三个Agent + Computer Use + 虚拟机
2.1 多智能体架构
Manus类产品的核心是三个Agent的协作:
| Agent | 职责 | 类比 |
|---|---|---|
| 规划Agent(Planning) | 任务拆解、全局规划、步骤编排 | 项目经理 |
| 执行Agent(Action) | 具体执行、调用工具、操作环境 | 工程师 |
| 审核Agent(Quality) | 质量检查、结果验证、错误发现 | 测试/QA |
三个Agent各司其职:规划Agent负责"想清楚做什么",执行Agent负责"动手做",审核Agent负责"检查做得对不对"。发现问题就反馈给规划或执行Agent,形成闭环。
2.2 Computer Use
执行Agent通过Computer Use技术操作虚拟机:像人一样看屏幕、点鼠标、敲键盘,不需要依赖特定API。这让Agent能操作任何有图形界面的应用。
2.3 虚拟机
所有操作都在隔离的虚拟机中执行,保证安全——即使Agent执行了危险操作,也不会影响真实系统。
2.4 可执行的基础操作
- 命令执行:支持执行各种Linux命令
- 文件读写:支持多种文件格式的创建、读取、修改
- 搜索:根据用户输入,从网上搜索各种数据源
- 浏览器操作:阅读搜索结果中的网页URL内容,提取信息
三、通用Agent vs Workflow Agent:怎么选?
这是做AI应用落地最关键的选型问题。两类Agent各有优劣,适用场景完全不同。
3.1 优缺点对比
| 维度 | Manus类通用Agent | Workflow类Agent |
|---|---|---|
| 优点 | 自主规划执行,更灵活智能 | 流程可控、稳定、速度快 |
| 无需投入人力做编排 | 运行步骤、进度可预知 | |
| 每次探索都会有新的、不同的方案 | 多次执行的结果都稳定复现 | |
| 缺点 | 流程不可控、不稳定、速度非常慢 | 机械、不灵活、只能从头运行 |
| 运行会耗费大量token和时间 | 需要投入人力提前编排 | |
| 目前无法人工干预,会一路走到底 | 每次执行的结果没有新意 | |
| 适合场景 | 探索未知解决方案的复杂问题 | 标准化的场景,对可控、稳定、速度有要求 |
| 创作类的场景 | 需重复执行的场景 | |
| 单次执行的场景 |
3.2 选型决策
选通用Agent的情况:
- 任务没有固定流程,需要探索
- 每次任务都不一样,不需要重复执行
- 追求创新和不同的解决方案
- 可以接受较慢的速度和较高的成本
选Workflow Agent的情况:
- 任务流程固定,需要稳定复现
- 需要高频重复执行
- 对速度和成本有严格要求
- 需要人工干预和流程控制
实际项目中往往是混合使用:用Workflow Agent处理标准化的高频任务,用通用Agent处理需要探索的复杂任务,两者互补。
四、开源实现:OpenManus案例
OpenManus是开源社区复刻Manus的项目,目标是提供透明、可本地部署的AI Agent框架,支持复杂任务自动化。
4.1 核心特点
- 模块化设计:支持多LLM和工具链,方便替换和扩展
- 支持多样任务:执行代码、文件处理、搜索网络信息
- 实时反馈机制:可视化展示Agent思考链与执行过程
- 零门槛接入:无需云服务,直接操作本地环境
4.2 主要功能
| 功能 | 说明 |
|---|---|
| Python代码解释器 | 实时生成和执行代码,完成复杂的计算和自动化任务 |
| 文件处理系统 | 支持多种文档的生成和管理 |
| 网络搜索工具 | 自动检索网络信息,为任务提供数据支持 |
| CUB(Computer Use Browser) | 模拟人类操作,完成网页浏览和交互任务 |
4.3 技术原理
- 基于LLM的核心架构:LLM根据输入生成回答或内容,系统将结果返回给用户
- 灵活的配置机制:用户基于配置文件选择不同的LLM模型
- 输入处理:对用户输入进行格式化或分段,确保LLM能理解
- 输出处理:对LLM生成的内容进行优化或筛选,更符合用户需求
- 模块化设计:基于模块化设计,支持插件机制,方便开发者扩展功能
- 多Agent架构 + ReAct机制:基于ReAct的思考-行动-观察循环执行任务
五、总结
Manus类通用Agent代表了AI Agent的一个重要方向:从"对话AI"到"行动AI"的跃迁。
它的核心价值是:
- 全流程自主:规划、执行、反思、交付,不需要人一步步指导
- 三Agent协作:规划+执行+审核,形成质量闭环
- Computer Use + 虚拟机:突破API限制,能操作任何应用,同时保证安全
- 灵活但有代价:灵活智能的同时,也带来了不可控、慢、贵的问题
对于AI应用落地者来说,关键不是盲目追新,而是根据场景选择合适的Agent范式:标准化高频任务用Workflow,探索性复杂任务用通用Agent,两者结合才能兼顾效率和灵活性。
开源项目OpenManus的出现,让这类架构不再是商业产品的专属,开发者可以本地部署、二次开发,推动整个生态的快速迭代。