Ternary Bonsai 2 27B

Ternary Bonsai 2 27B

三值量化的27B本地大模型

AI官网

应用介绍

27B 的模型放在本地跑,FP16 权重光是加载就要 54 GB 显存,普通台式机和笔记本根本没戏;换成常规的 2-bit 量化倒是塞得进去,可一到需要连续推理的题目上就原形毕露——IQ2_XXS 在 AIME26 上只剩 57.5 分,LiveCodeBench 56.4 分,日常闲聊看不出来,真干活就崩。Ternary Bonsai 2 27B 走的是三值路线:权重只取 −1、0、+1 三个值,实际 1.72 比特每权重,整个模型压到 5.9 GB,却保住了 FP16 水平 98.2% 的综合表现。

基座是 Qwen3.8-27B,架构没改,混合注意力(约 75% 线性 + 25% 全注意力)原样继承,262K 上下文也在。关键差别在于量化范围:嵌入层、注意力投影、MLP 投影、LM head 全部走三值,没有留「低比特标签下偷偷保留高精度层」的后门;视觉塔单独打包成 Q8_0 的 mmproj,只在处理图像时加载。

距第一代 Bonsai 27B 发布两个月,体积没变,差距明显收窄——14 项思维模式基准平均 84.78 分(FP16 是 86.32),其中数学 96.57 几乎追平满精度,编程 89.42 反而略微超过基线,智能体工具调用 74.92。Apache 2.0 协议。

软件功能



三值权重:权重只用 −1/0/+1 配 FP16 分组缩放,真实码率 1.72 比特每权重,54 GB 的 FP16 模型压到 5.9 GB,约缩小 9.3 倍。

全层覆盖不留后门:嵌入、注意力投影、MLP 投影和 LM head 全部量化到低比特,不存在挂着低比特名号却偷偷保留高精度层的情况。

基准表现接近满精度:14 项思维模式基准平均 84.78 对 FP16 的 86.32,数学 96.57、编程 89.42、指令遵循 82.66,均落在满精度附近甚至略高。

两种打包格式:PTQ1_0 把三值密集打包(1.75 比特/权重,5.95 GB),PQ2_0 每个三值占一个 2 比特槽(2.13 比特/权重,7.21 GB),按显存和速度取舍;权重直接被消费,不会还原成 FP16。

262K 上下文:继承自 Qwen3.8-27B 的混合注意力骨干,约 75% 是线性注意力,长上下文在本地设备上仍然跑得动。

多模态:视觉塔作为独立的约 0.63 GB Q8_0 mmproj 包提供,需要图像输入时才加载,纯文本场景不占这部分空间。

需要官方分支:三值混合注意力的算子在 PrismML 的 llama.cpp 分支里,官方明确提示原版 llama.cpp 跑不了这些文件——PQ2_0/PTQ1_0 会被当成未知类型拒绝,Q2_0 则会静默加载并输出乱码。

多后端:llama.cpp 分支提供 CUDA 与 Metal 内核,也能走 CPU;Apple Silicon 另有 MLX 版本 Ternary-Bonsai-2-27B-mlx-2bit。

Apache 2.0:开放许可,可商用,模型卡另附白皮书和示例仓库说明完整方法与测量口径。