风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

PrismML发布Bonsai 27B:3.9GB压缩模型实现手机端侧运行

摘要

PrismML推出Bonsai 27B,首次将270亿参数模型压缩至智能手机可部署规模 PrismML正式发布Bonsai 27B——一款专为端侧推理设计的超轻量级大语言模型。该模型经深度压缩后体积仅为3.9 GB,可在iPhone 17 Pro Max等旗舰移...

PrismML发布Bonsai 27B:3.9GB压缩模型实现手机端侧运行
PrismML推出Bonsai 27B,首次将270亿参数模型压缩至智能手机可部署规模 PrismML正式发布Bonsai 27B——一款专为端侧推理设计的超轻量级大语言模型。该模型经深度压缩后体积仅为3.9 GB,可在iPhone 17 Pro Max等旗舰移动设备上本地运行,实测推理速度达11 token/秒;在M5 Pro类设备上进一步提升至26 token/秒。这是目前少有的、真正跨过手机内存门槛的27B级别模型,标志着中等规模AI模型向消费级终端落地迈出关键一步。 突破性压缩技术源自学术前沿,端到端低比特量化 Bonsai 27B采用基于加州理工学院相关知识产权的极低比特量化方案,摒弃传统“分层保留高精度”的妥协路径,对嵌入层、全部注意力层及输出头实施统一、端到端的压缩。其二值版本仅用+1和-1表示权重,三值版本则引入0态,并为每128个权重共享一个16位缩放因子。最终实现:二值版平均1.125 bit/权重(约为原始FP16模型体积的1/14),三值版约1.71 bit/权重。 性能与体积兼顾,实测效果稳健 在涵盖常识推理、数学能力、代码生成等在内的15项标准基准测试中,三值Bonsai 27B平均得分达全精度基线模型的94.6%,二值版本为76.1%。这一结果验证了超低比特压缩并非以性能断崖式下降为代价,而是在资源受限场景下实现了可用性与效率的实质性平衡。 结构优化协同压缩,扩大端侧上下文能力 除权重压缩外,Bonsai 27B还集成混合注意力机制:约75%的层采用线性注意力,替代计算开销高昂的二次复杂度注意力。该设计使模型支持高达26.2万token的上下文窗口,在手机硬件上仍保持可行推理延迟,显著拓展了长文本理解、文档摘要及多步任务处理的实用性边界。 演进路径清晰,持续向更高能力模型推进 Bonsai系列始于今年3月发布的8B版本(1.15 GB)。此次升级至27B,不仅是参数量的跃升,更代表压缩技术在更大模型尺度上的稳定性验证。27B规模已接近支撑持续对话、工具调用与轻量级智能代理任务的实用阈值,为端侧AI从单次问答迈向复杂交互奠定基础。 技术延伸与生态布局同步展开 PrismML同步提供DSpark推测解码层,专为GPU加速场景优化,在NVIDIA H100上实测吞吐提升约1.37倍,且严格保证输出分布一致性。公司明确下一步将推出压缩版Gemma系列模型,并持续推进更大规模模型的端侧适配工作。当前,该技术路线已引起苹果等头部终端厂商的关注,正进入初步技术评估阶段。

评论 (10)

登录 后即可发表评论
逆向行驶

能引起苹果关注,看来技术不差,就看后续商业化咋样。

0 回复
老余
老余 2周前

端侧AI发展有戏,这模型要是普及,使用场景能多不少。

0 回复
jerry王
jerry王 2周前

虽然有突破,但和顶尖大模型比可能还有差距。

0 回复
1234
1234 2周前

这DSpark推测解码层能加速,对GPU场景有用。

0 回复
若水东流

想法挺好,不过后续实际应用和生态建设得跟上才行。

0 回复
更多