Meta 是最新推出编码代理的科技巨头,与领先的人工智能巨头 Anthropic 和 OpenAI 展开竞争。

该公司在一份官方公告中写道:“我们很高兴发布 Muse Code(测试版),这是一款由我们最新型号 Muse Spark 1.2 提供支持的终端编码代理。” “这标志着我们向前沿迈出了下一步,更大、更强大的型号即将推出。”

作为一种代理编码工具,Muse Code 专为跨大型存储库的软件工程而构建。根据 Meta 的说法,它“在大型存储库中承担复杂的软件工程任务:规划变更、编写代码和验证结果。它可以为每个任务协调多个持久子代理,更快、更准确地解决难题,并且需要更少的干预。”

突出的细节是运行时间。 Muse Code 将每个模型调用、工具运行、批准和编辑记录到本地事件日志中,作为单一事实来源。 “这个单一的事实来源使得运行时重放精确且安全重启:崩溃后,代理可以精确地从停止的地方恢复,”Meta 说。对于长时间运行的作业来说,这一功能比原始速度更重要,而这也是竞争对手尚未提出的卖点。

它还附带默认技能。 “/plan”命令将任务转变为一个经过批准的计划,而“/grill”对该计划进行压力测试,直到它成立,而“/goal”则致力于成功完成目标,类似于 Hermes 的做法。 Meta 表示,它与 Muse Code 共同训练了 Muse Spark 1.2,因此核心 LLM 和代理可以协同工作。

基准和陷阱

Muse Spark 1.2 是对 Muse Spark 1.1 的专注于编码的更新。 Meta 表示,它“显着扩大了编码任务的训练计算规模,同时扩大了训练环境的多样性,改进了代码生成、复杂调试和端到端开发人员工作流程。”这些图表讲述了一个清晰的故事。

在 Terminal-Bench 2.1 上,带有 Muse Code 的 Muse Spark 1.2 得分为 82.9%,落后于 Opus 5 上的 Claude Code(86.7%),但领先于 Codex 上的 GPT-5.6 Terra(81.8%)和 Grok Build(81.6%)。

衡量代理编码能力的 DeepSWE 1.1 更接近:Muse 为 59.3%,Opus 5 为 65.0%,Codex 为 64.8%。在 Meta 的内部编码基准上,Muse 的得分为 70.6%,Opus 5 的得分为 79.4%。

加速图表颠倒了顺序。在超过 1,000 次工具调用中,Opus 5 相对于基线的增益最大(约 74-75%),Muse Spark 1.2 中间包约为 61-69%,具体取决于运行情况。 Meta 的观点是,随着工具调用的积累,代理会不断改进,这正是您希望长期编码人员获得的行为。

最有趣的演示是长期和多模式的。 Meta 表示,在压力测试中,Muse Code“在 Nvidia Hopper GPU 上迭代优化了超过 1,000 次工具调用(长达 24 小时)的 GPU 内核”。这意味着它能够随着时间的推移而改进。

还有一个视觉编码的角度。在一个演示中,用户将一段房屋的飞行视频作为 mp4 放入终端,然后 Muse Code“解释该视频并生成一个具有预订功能的视觉效果丰富的网站”。将原始视频读取到可运行的网络应用程序中是 Meta 在 Muse 系列上所做的多模式宣传。

查看启动线程:

以下是 Muse Code 多模式视觉编码功能的示例。在此演示中,用户将家庭的漫游视频作为 mp4 文件输入终端。 Muse Code 解释视频并生成具有预订功能的视觉丰富的网站。 pic.twitter.com/3CAfIMYmAB

——Meta 的 AI (@AIatMeta),2026 年 8 月 5 日

场上已经挤满了人

也就是说,Meta 的战斗已经迟到了。 OpenAI 的 Codex 已经运行并行云代理; DeepSeek 已经建立了自己的 Claude Code 竞争对手,而 Hermes 或 OpenClaw 等代理工具已经是具有更多功能的良好替代品。 Muse Code 的优势在于崩溃安全运行时和子代理设计,而不是基准霸权。

代理编码面临的风险是常见的:崩溃后恢复并持续 24 小时调用工具的代理功能强大且不可预测。 Meta 押注开发者希望获得这种自主权,现在它已经上市了。

Muse 代码可用于在安装后输入以下命令进行测试:curl -fsSL https://dev.meta.ai/install.sh |巴什