从 4 bit 权重到高并发 API:深入浅出 GPTQ、AWQ、safetensors、vLLM 与 SGLang
下载一个带 AWQ 或 GPTQ 后缀的模型,里面为什么还是 safetensors?vLLM 与 SGLang 又在优化什么?从 W4A16 的显存账本出发,拆开 GPTQ 的逐列误差补偿、AWQ 的激活感知缩放、safetensors 的文件结构,再沿着加载、内核、KV Cache 和调度一路走到高并发推理服务。
下载一个带 AWQ 或 GPTQ 后缀的模型,里面为什么还是 safetensors?vLLM 与 SGLang 又在优化什么?从 W4A16 的显存账本出发,拆开 GPTQ 的逐列误差补偿、AWQ 的激活感知缩放、safetensors 的文件结构,再沿着加载、内核、KV Cache 和调度一路走到高并发推理服务。