AI资讯
DeepGrove 发布 Maple-Preview-20B-A1B:iPhone 上最快本地 AI 模型,可达 127 tokens/s
美国独立 AI 研究实验室 DeepGrove 发布了名为 Maple-Preview 的轻量 AI 模型,在 iPhone 上运行可以达到 127 tokens/s,是 Bonsai 27B 的约 13 倍。
AI云图智寻编辑部2026-08-07 09:17
阅读时间:约 3 分钟访问0
美国独立 AI 研究实验室 DeepGrove 于 8 月 5 日发布了一款名为 Maple-Preview 的轻量 AI 模型。该模型在 iPhone 上运行速度达到了 127 tokens/s,远超现有的 Bonsai 27B 模型。
Maple-Preview 的性能表现
Maple-Preview 在 iPhone 上的运行速度达到了 127 tokens/s,相比 Bonsai 27B 的 9.6 tokens/s,性能提升了约 13 倍。此外,在 MacBook Pro(M5 Pro)上,Maple-Preview 完成了 IMO 2024 P1 任务,得分为 7/7,运行速度为 281.5 tokens/s。这一结果显示了 Maple-Preview 在不同设备上的高性能表现。
技术架构与优化方案
Maple-Preview 采用了混合专家(MoE)架构,总参数量为 202 亿个,激活参数量为 14.9 亿个。DeepGrove 提出了“三值权重”方案,将权重约束并量化为 {-1, 0, 1} 三个值,大幅降低了内存占用和计算带宽需求。该模型包含 24 层、256 个专家(8 个活跃专家),并采用 3:1 SWA-512:GA 混合注意力机制。这种优化方案使得 Maple-Preview 在保持高效性能的同时,显著减少了资源消耗。
内存控制与未来展望
Maple-Preview 在处理长上下文时表现出色,即使处理 131,000 tokens,内存占用也仅为 7.69GB。这表明该模型在处理大量数据时仍能保持较低的内存使用率。目前,Maple-Preview 处于预览阶段,DeepGrove 表示将继续改进该模型,并希望构建一套系统,使 AI 模型能够根据对话内容自动调整,并针对单个用户进行优化。这种个性化调整将进一步提升用户体验。