从 4 bit 权重到高并发 API:深入浅出 GPTQ、AWQ、safetensors、vLLM 与 SGLang

下载一个带 AWQ 或 GPTQ 后缀的模型,里面为什么还是 safetensors?vLLM 与 SGLang 又在优化什么?从 W4A16 的显存账本出发,拆开 GPTQ 的逐列误差补偿、AWQ 的激活感知缩放、safetensors 的文件结构,再沿着加载、内核、KV Cache 和调度一路走到高并发推理服务。

2026年7月24日 · 18 分钟 · 8721 字