
Bonsai-demo GTX 1080 Ti老显卡实测11GB显存跑27B的极限挑战【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demoBonsai-demo 是一个开源的本地大模型部署项目支持在 Mac、Linux、Windows 上用一条脚本把1-bit / 三值量化的大语言模型跑起来。本文将记录它最硬核的一份社区实测在一张 2017 年的老将GTX 1080 Ti11GB 显存上成功全量加载并全 GPU 卸载了27B 参数量的多模态模型解码速度稳定在 20~28 tokens/s——对老显卡来说堪称极限挑战。为什么 11GB 显存能装下 27B 模型常规思路下27B 模型连4-bit 量化版本都要 15.4 GiB1080 Ti 根本塞不下。Bonsai 的解法是极致量化模型家族量化格式权重体积11GB 显存剩余空间Bonsai-27B1-bitQ1_03.53 GiB约 7.3 GiB 留给 KV 缓存Ternary-Bonsai-27B三值Q2_06.66 GiB约 4.4 GiB 留给 KV 缓存参考27B BF16GGUF47.73 GiB❌ 无法装入参考27B Q4_K_MGGUF15.4 GiB❌ 无法装入也就是说1-bit 版的 27B 权重只有约 1.125 bit/参数官方称之为一部现代 iPhone 都能装下的体积——而它能稳定运行的下限硬件正是这张 Pascal 架构的老卡。上图展示了 Bonsai 家族的核心卖点体积极小的模型基准得分却能追平数倍体积的常规模型——这正是 1080 Ti 能以小博大的根本原因。GTX 1080 Ti 实测数据四种规格全部跑通测试环境GP102Pascal sm_61计算能力 6.1当前构建支持的最老 CUDA 目标 Linux 双路 Xeon 125 GB 内存驱动 580.173.02全部 99 层卸载到 GPU-ngl 99并开启 Flash Attention。详细原始数据见 community-benchmarks/bonsai/cuda-gtx1080ti-linux.md。Bonsai1-bit 家族实测吞吐模型预填充 pp512 (t/s)解码 tg128 (t/s)Bonsai-27B28528.3Bonsai-8B1,008101.2Bonsai-4B1,721145.8Bonsai-1.7B4,047243.9Ternary三值家族实测吞吐模型预填充 pp512 (t/s)解码 tg128 (t/s)Ternary-Bonsai-27B27820.5Ternary-Bonsai-8B98568.8Ternary-Bonsai-4B1,67997.4Ternary-Bonsai-1.7B4,025169.9三值家族完整数据见 community-benchmarks/ternary-bonsai/cuda-gtx1080ti-linux.md全部硬件对比榜单见 community-benchmarks/README.md。1-bit 还是三值老显卡这样选追求速度选 1-bit。同卡 27B 解码快约 38%28.3 vs 20.5 t/s预填充两者打平权重体积还只有三值版的一半追求质量选三值Ternary。它是官方默认家族质量更高6.66 GiB 权重在 11GB 卡上依然装得下两者在 8B 上差距明显1-bit 101.2 vs 三值 68.8 t/s显存越紧张1-bit 的优势越大。一键部署步骤在 1080 Ti 上跑起 Bonsai-27B老显卡无需特殊配置脚本会自动识别 GPU 并全部卸载。三步完成git clone https://gitcode.com/GitHub_Trending/bo/Bonsai-demo cd Bonsai-demo ./setup.sh # 默认下载 Ternary-Bonsai-27B可先 export BONSAI_FAMILYbonsai 改用 1-bit 版 ./scripts/start_llama_server.sh # 打开 http://localhost:8080 开始聊天想跑 1-bit 家族BONSAI_FAMILYbonsai ./setup.sh想换更小的模型BONSAI_MODEL8B可选 27B / 8B / 4B / 1.7B完整 24 个可调变量参考 environment_variables.md老显卡显存优化技巧清单11GB 跑 27B 之后还有多少余量取决于上下文长度27B 模型最高支持 262K token 上下文FP16 KV 缓存约 64 KiB/token1-bit 27B 总显存占用4K 上下文10K 上下文100K 上下文权重 3.53 GiB 起4.8 GiB5.2 GiB10.8 GiB ✅ 刚好塞进 11GB几个立竿见影的调优开关均为环境变量完整说明见 environment_variables.mdBONSAI_KV414-bit KV 缓存缓存显存省约 3.5 倍。三值 27B 的 100K 上下文总占用可从 ~13.7 GiB 降到 ~9.2 GiB直接变装得下。详解见 KV-CACHE.mdBONSAI_CTX8192手动钉死小上下文避免脚本自动探测时占用过多内存官方 FAQ 专门提到机器卡死的坑就是它BONSAI_MMPROJ_CPU1把视觉投影器挪进内存为 KV 缓存腾出约 0.9 GiB 显存——对 11GB 这种紧张显卡非常实用代价只是图片处理稍慢纯文字对话无影响调低思考强度27B 是推理模型慢硬件上等待时间大头是思考。聊天界面里点灯泡选 Low/Medium或给服务加--reasoning-budget 2048封顶BONSAI_NGL0如果哪天想改纯 CPU 推理比如装 MLX 之外的极端场景一行切换。总结老显卡用户值不值得试✅ 值得。GTX 1080 Ti 这张 8 年前的卡用 Bonsai-demo 跑 27B 多模态模型实测 28 t/s 解码、285 t/s 预填充日常对话体验流畅1-bit 格式甚至让它在 11GB 显存里开出了100K token 上下文的奢侈空间。 关键结论决定你能跑多大模型的不是卡的新旧而是量化格式。1-bit / 三值量化让老显卡 大模型从口号变成了可复现的社区基准数据。更多技术资料模型原理bonsai-27b-whitepaper.pdf、1-bit-bonsai-8b-whitepaper.pdf、ternary-bonsai-8b-whitepaper.pdf投机解码实验性加速SPECULATIVE.md完整变量参考environment_variables.md主文档README.md【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考