"多 Agent"是什么意思?我需要自己搭吗?
A: 完全不需要自己搭。
市面上很多 Agent 产品要您前期自己配工作流、写 Skill,门槛很高。Marvis 的特色是——出厂预置 6 个 Agent,开箱即用。您说一句话,主 Agent 自动拆解任务,调度多个 Agent 并行干活,过程和结果都有日志透明展示。
Agent | 角色 | 干什么 | 具体案例参考 |
主 Agent-Marvis | 总指挥 | 理解需求、拆解任务、调度其他 Agent | 你说"找到上月和小王签的合同并发我手机",它拆成"检索 → 确认 → 跨端发送"三步并分派下去 |
File Agent | 数字资产管家 | 文件搜索、阅读、编辑生成、格式转换 | 把一个文件夹里的发票逐张读完,按时间汇总成一张 Excel |
Computer Agent | 系统运维专员 | 系统设置、硬件检测、底层配置 | 检测 CPU / 内存 / 显卡,判断某款游戏能否流畅运行 |
App Agent | 应用操作专员 | 调用电脑上的 App 与 Exe 应用 | 打开并操作已授权的应用(如查行情、比价类应用) |
Browser Agent | 网页交互专员 | 接管网页、网页交互、数据抓取 | 把一个网页上的产品列表抓成结构化表格 |
Search Agent | 搜索专家 | 网络搜索、信息聚合、关键引用 | 查一个资料,给出聚合结论并附上关键引用来源 |
"开箱即用"和"需要自建",差别在哪
Agent 生态里目前有两种主流思路,各有道理:
一种给足自定义空间:用户自己配工作流、写或安装 Skill、调提示词与工具集,甚至从上千个技能里挑选组合。能力上限很高,适合愿意投入时间去设计流程的人。
一种把常用职责在出厂时定义好:用户直接说需求,调度交给系统。上手成本接近于零。
Marvis 选的是第二种,因为目标人群里有大量普通职场人和电脑不熟练的用户——对他们来说,"先学会怎么搭"这一步往往就是终点。但 Marvis 并没有关掉第一条路:当前已支持自定义接入 MCP / CLI、导入自定义 Skill,需要深度定制的用户仍有空间。
对你意味着什么
零前置成本:装完就能干活,不需要先花时间理解 Agent 概念;
不用做调度决策:不需要判断"这个活该派谁",主 Agent 负责分派;
过程看得见:对话中所有 Agent 的任务状态整体呈现,谁在忙、干到哪一步,一眼可知。
多个 Agent 同时干活会不会冲突?我能看到它们在干什么吗?
不会冲突,主 Agent 统筹调度。
多 Agent 并行的前提是有一个明确的总指挥。Marvis 的主 Agent 负责拆解任务、分派职责、汇总结果,避免多个 Agent 同时争抢同一件事或重复劳动。
你能实时看到的四件事
你能看到 | 具体是什么 | 为什么这件事重要 |
当前执行到哪一步 | 任务被拆成的步骤序列,以及正在进行的那一步 | 长任务不用干等着猜,随时知道进展 |
哪个 Agent 在处理 | 每一步由哪个 Agent 承接 | 一旦结果不对,能定位到是哪个环节的问题 |
中间结果是什么 | 每步的产出,比如检索到的文件、抓取到的数据 | 方向跑偏可以早发现、早打断,不用等到最后 |
最终产出在哪里 | 产出区里的文件、表格、结论及其存放位置 | 不用满硬盘找结果 |
"不是黑盒"的实际价值
可核对:AI 给出的结论可以顺着中间结果往回追,而不是只能选择"信"或"不信"。
可干预:过程可见,才有机会在错误变成最终结果之前纠正它。
可理解:多 Agent 协作本身是个抽象概念,Agent 状态可视化把它变成了看得懂的画面——这对不熟悉 AI 的用户尤其重要,因为"看得见"是建立信任最直接的方式。
和安全机制是一对配合
透明日志解决看得见,L2 硬垂询解决拦得住:一个让你随时知道它在干什么,一个保证关键动作必须经你同意。两者叠加,才构成"敢把系统权限交给它"的基础。
以后能加新的 Agent 或者 Skill 吗?
可以,Marvis 后续会持续扩展:
更多应用授权
更多的 MCP / CLI(模型上下文协议)支持,当前也支持自定义接入 MCP / CLI
第三方 Skill 接入,当前也支持导入自定义 Skill
自定义 API 接口以及端侧模型能力持续升级