云 API 用久了,很多人开始惦记本地部署:数据不出门、没有按 Token 计费的账单焦虑、断网也能用。本文以最典型的消费级旗舰 RTX 4090(24GB 显存)为例,把本地跑大模型的账算给你看。
显存账本:你能跑多大的模型
显存是唯一的硬约束。经验公式:模型权重占用的显存约等于参数量乘以每个参数的字节数。FP16 下 7B 模型要 14GB,24GB 显存勉强装下还要留运行时开销;换成 4-bit 量化,7B 只要 4GB 上下,13B 大约 8GB,70B 量化后也要 40GB 以上——单卡无望,除非 Offload 到内存(速度会掉一个量级)。
所以 4090 的甜点区很清晰:7B 到 14B 的量化模型可以流畅运行,兼顾质量与速度;想跑 70B 级别,需要两张卡起步或者上 Mac Studio 这类大统一内存的机器。
软件栈:三条主流路线
第一条是 llama.cpp 系(含 Ollama、LM Studio 等封装),GGUF 量化格式生态最成熟,一条命令拉模型就能跑,适合个人使用。第二条是 vLLM,吞吐和并发管理是强项,适合要给小团队提供 API 服务的场景。第三条是 Transformer + bitsandbytes 的极客路线,灵活但折腾,适合需要魔改模型的开发者。
实测体验:速度与质量的平衡
在我们几周的测试里,4090 跑 7B 级 4-bit 量化模型能稳定输出两位数的 tokens/s,交互体验流畅;14B 模型速度减半但仍在可用范围。质量上,这个量级的模型日常问答、代码补全、文案初稿都够用,但复杂推理和长文写作与旗舰模型差距明显——本地模型适合”量大管饱”,重要任务仍建议交给云端旗舰。

值不值得:一笔经济账
一张 4090 按整机价格摊销三年,折合每天几十元的固定成本;如果你的 API 月账单长期高于千元,本地部署就有经济性。反之,轻度使用者租云算力更划算。更现实的方案是混合:日常的批量简单任务本地跑,关键任务调用云端旗舰模型——这也是目前不少小团队的实际架构。
延伸阅读:H100 与 H200 怎么选:租用价格与性能对比 · 大模型 API 价格战:一百万 Token 到底值多少钱


