Skip to content
←返回领域赋能

Muse:Meta 的长时任务个人 agent

muse

Meta 2026-09-08 在美区发布的个人 AI agent:iOS/Android/Web,跑在云端 VM 上,用 chat 下目标、能看着它操作浏览器,Sentinel 权限把读写分开。

C
置信度
厂商宣称
只有官方模型卡/发布会,无独立复测
美区 · iOS / Android / Web
关键指标
首发平台(Meta 官方)
厂商宣称 · 2026-09
成熟度
产品
研究 → 演示 → 产品 → 生产
编辑判断

把 Muse 放进文档与办公领域的梯顶,理由不是「Meta 又发了一个模型」,而是它把 agent 的两个真问题摆到了产品层:权限与可观察。办公任务大多有副作用(发邮件、下单、改文件),一个不能限制读写范围、不能让你看见过程的 agent,演示再漂亮也没人敢把活交出去;Sentinel 的读写分权与「可看的浏览器」正是冲这两点去的,所以它比「又一个聊天框」更接近能用。

置信度 C(厂商宣称)。可核:2026-09-08 发布、首发美区 iOS/Android/Web、跑在 Meta 自有模型上、云 VM 执行、9 月 23 日追加的 macOS 控制与 agent 邮箱、以及那份商务伙伴名单(Meta 官方与公开条目)。不可核:长任务的成功率与跨应用操作的可靠性 —— 没有第三方任务级评测,所以卡片上的读数只写「首发平台」,不写任何完成率。

AI智能体Personal AgentOfficeProductivity
Meta官网1 min read7

它把「agent」和「聊天机器人」的分界画在哪里

Meta 对 Muse 的定义是「能在你不在场时替你跑长任务的个人 agent」,而不是一次问答一轮回复的 chatbot。这句话不是营销修辞,它决定了三件工程上的事:任务要能跨时间存活、要能被授权、要能被看着做。Muse 的设计正好对着这三点。

三个关键设计

一、跑在云上的虚拟机,不是你的设备。Muse 在 Meta 云里的一台虚拟机上执行,你通过聊天界面下目标。好处是任务不占你的笔记本、也不需要你保持在线;代价是数据要离开本地 —— 这条取舍和「在你自己机器上跑」的工具正好相反。

二、一个你能看的浏览器。agent 在操作网页时,浏览器是可见的。这条对办公场景尤其重要:能看见它在做什么,是敢把「填表、下单、查资料」这类有副作用的任务交出去的前提。黑箱执行在演示时很酷,在真实工作里没人敢用。

三、Sentinel 权限系统区分读与写。它管的是 agent 能碰哪些服务,并且把读取和写入分成两种权限。这是整份设计里最像「给干活的东西上锁」的一步 —— 允许它看邮件和允许它替你发邮件,风险差了一个数量级。

另外你还能设 agent 的名字、头像与说话风格。这看着像装饰,实际是让「一个替你出面的东西」有稳定身份的一部分。

发布节奏与能力追加

Muse 于 2026 年 9 月 8 日发布,首发美区,iOS / Android / Web 三端。它跑在 Meta 最新一代模型上,第一个是 Muse Spark(2026 年 4 月),整条线由 Meta 首任首席 AI 官 Alexandr Wang 负责。

9 月 23 日Meta 又追加了一批能力:Realtime Avatar 模型(可以和 agent 的视觉形象视频对话)、控制 macOS 上的应用、给 agent 一个自己的邮箱地址(你可以把邮件转发给它,或把它抄进邮件线程),以及通过唤醒词接入 Meta 的智能眼镜。同一天公布的商务伙伴包括 Stripe、Shopify、Best Buy、Gap、Sephora、Walmart、Wayfair、Expedia、Instacart、GitHub 与 Notion;同时发布了掌上设备 Muse Charm。

边界

首发仅美区,平台是移动端与 Web(桌面控制能力 9 月才补上)。厂商宣称的部分(长任务的完成质量、跨应用操作的可靠性)没有第三方任务成功率可核;能核的是发布事实、平台、权限模型与伙伴名单。

同域资产:Agent

4
数学科研梯顶B

AlphaEvolve:让模型去优化「有客观评分函数」的问题

Google DeepMind 的编码代理式进化搜索:Gemini Flash 出量、Gemini Pro 出质地提出候选,自动评估器打分,高分候选留进种群当下一轮上下文,本质是 LLM 当变异算子的进化搜索;它只做有自动评估器的优化问题,因此归到 math 与 agents 两域。进化出的调度启发式已在 Google 数据中心(Borg)生产运行超过一年,持续回收 Google 全球算力的 0.7%(口径是 Google 全球算力,不是全人类算力),卡片读数取自它:全部结果里唯一经长期生产验证的一条。另有 matmul kernel 特定规模提速 23%;数学侧在 50 多个开放问题上约 20% 给出改进,含 4x4 复矩阵乘法用 48 次标量乘改进 Strassen 1969 年的 49 次记录。可验证性与证明器不同:Lean 通过是数学意义上的对,「提速 23%」是特定硬件下的经验读数。可用性接近零:无公开权重、Early Access 只有登记表,前提是你写得出便宜、快速、可信的评估器。置信度 B(有争议):Borg 那条经一年生产验证,未复现任何一条。

0.7%Google 全球算力回收(生产验证)有争议 · 2025-05
生产Google DeepMind官网
AlphaEvolve:让模型去优化「有客观评分函数」的问题
多模态理解文档与演示梯顶C

Gamma:把「一份长材料」直接变成「一份能讲的演示」的编排型工具

Gamma 做的不是「写提示词出一页幻灯片」,而是把一份既有材料重新组织成一份可讲的演示:吃进长文档、PDF、粘贴的文本或一个网址,输出带大纲、分页、配图与版式的整套 deck,并且以「卡片式」结构让每一页都能单独重排、重写、换图。它代表文档与演示领域真正有用的那一类 AI——价值在编排与信息取舍,不在生成质量。它的天花板也同样清楚:输出是它自己的排版系统,导出到 pptx 之后样式还原度会掉一层,而这恰好是多数组织的硬性要求。

网页 / pptx / pdf输出形态厂商宣称 · 2025-01
产品Gamma Tech官网
Gamma:把「一份长材料」直接变成「一份能讲的演示」的编排型工具
Agent文档与演示C

WorkBuddy:腾讯的全场景 AI 办公工作台

腾讯出品的办公 agent:说出要求后自主规划、调用工具、生成文件,过程和结果都留给你审核;打通腾讯办公 IM/文档/邮箱/会议/知识库。

15 分钟深度调研交付(厂商宣称)厂商宣称 · 2026-10
产品腾讯官网
WorkBuddy:腾讯的全场景 AI 办公工作台

作为亚马逊联盟会员,我们可能从符合条件的购买中获得佣金。