风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Meta推出迄今为止功能最强大的AI——Muse Spark,但Gemini 3.1 Pro仍然领先。

摘要

币界网报道: Meta于周三发布了Muse Spark,这是该公司打造的首款机型。 元超级智能实验室 ——该团队于九个月前在首席人工智能官亚历山大·王的领导下组建。 Meta以140亿...

Meta推出迄今为止功能最强大的AI——Muse Spark,但Gemini 3.1 Pro仍然领先。
币界网报道:

Meta于周三发布了Muse Spark,这是该公司打造的首款机型。 元超级智能实验室 ——该团队于九个月前在首席人工智能官亚历山大·王的领导下组建。 Meta以140亿美元收购Scale AI 目前该功能已在 meta.ai 和 Meta AI 应用上线,未来几周内将陆续登陆 Facebook、Instagram 和 WhatsApp。

这并非普通的聊天机器人升级或骆驼的新版本。Muse Spark原生支持多模态处理——它从底层构建图像、文本和语音处理能力,而非将视觉功能附加到现有的文本模型上。它具备可视化思维链、工具使用支持,以及Meta称之为“思考模式”的功能:该模式可并行运行多个AI代理,以解决更复杂的问题。这是Meta针对谷歌Gemini Deep Think和OpenAI GPT Pro等扩展思维模式的回应。

Meta在一份官方声明中写道:“Muse Spark是我们扩展规模的第一步,也是我们人工智能工作彻底改革后的首个产品。” 公告 “为了支持进一步扩展,我们正在对整个技术栈进行战略投资——从研究和模型训练到基础设施,包括 Hyperion 数据中心。”

该公司与超过1000名医生合作,为Muse Spark的医学推理功能收集训练数据。在HealthBench Hard(一项开放式健康查询基准测试)上,Muse Spark的得分高达42.8分,而GPT 5.4为40.1分,Gemini 3.1 Pro仅为20.6分。这绝非微不足道的差距。

在智能搜索(DeepSearchQA)测试中,Muse Spark 以 74.8 分领先,超过了 Gemini(69.7 分)和 GPT 5.4(73.6 分)。在 CharXiv 推理(理解科学论文中的图表)测试中,它的得分高达 86.4 分,是所有对比模型中的最高分。

对于那些热衷于破解人工智能的人来说,该模型在几分钟内就被破解了:

但优秀并不等同于卓越。整体基准测试结果显示,Gemini 3.1 Pro 在大多数类别中仍然领先。在抽象推理谜题基准测试 ARC AGI 2 上,差距最为明显:Gemini 的得分为 76.5,而 Muse Spark 的得分为 42.5。

在编码测试(LiveCodeBench Pro)中,Gemini 的得分为 82.9,超过了 Meta 的 80.0。在 MMMU Pro(多模态理解)测试中,Gemini 的得分为 83.9,而 Meta 的得分为 80.4。Meta 自己的博客也承认,目前在长时程智能体系统和编码工作流程方面存在性能差距。

此次发布还蕴含着一项显著的战略转变。Muse Spark 采用封闭模式——其架构和权重不会公开。这与以往的做法截然不同。 Llama 这为 Meta 在开源人工智能领域树立了声誉。但在今年早些时候 Llama 4 反响平平之后,Meta 似乎决定以不同的方式书写新的篇章。

该公司表示,希望未来能将 Muse 的版本开源,但目前代码仍保留在 Meta 内部。消息公布后,这家科技巨头的股价周三上涨近 9%,最终收盘上涨 6.5%,报 612.42 美元。

“思考模式”利用并行代理编排来提升模型的性能上限。在该配置下,Muse Spark 在“人类最后的考试”任务中达到了 58% 的正确率,在“前沿科学研究”任务中达到了 38% 的正确率——这一成绩使其能够与 Gemini 和 GPT 的最强版本相媲美,而非仅仅是它们的标准版本。

Meta 还推出了一款购物助手,可以比较产品并直接链接到购买页面,并计划在未来几周内将 Muse Spark 带到 Facebook、Instagram 和 WhatsApp 平台——紧随其后 相同的脚本 该功能自 Llama 3 版本起投入使用,用户已超过 35 亿。目前,部分开发者可访问私有 API 预览版。

该模型历时九个月构建完成,内部代号为 Avocado。Meta 声称,其新的预训练堆栈能够以比 Llama 4 Maverick 少 10 倍以上的计算量达到相同的能力水平。

Muse Spark 内部被描述为 Muse 系列中“小巧快速”的第一步。功能更强大的版本已经在开发中。

评论 (0)

登录 后即可发表评论

暂无评论

更多