1 下载模型:
modelscope download --model cyankiwi/Qwen3.8-27B-AWQ-INT4 --local_dir H:\agent\trt-llm\models\qwen3.8-27b-awq- 为什么这个 AWQ 不是 14GB 而是21GB?
因为作者对 Qwen3.8 敏感的Gated DeltaNet 状态更新层和因果卷积保留了 BF16 高精度,仅对占体积最大的注意力与 FFN 进行了 INT4 压缩(即W4A16 混合精度),从而确保模型不会失真; - 这 21GB 权重载入显存后占用约21~22 GB,正好可以压着极限完全吃满你的单张 RTX 3090(24GB)!
2 开代理拉docker:
docker pull nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev2026091700003 建立容器:
docker run -it --gpus all --ipc=host --ulimit memlock=-1 --ulimit stack=67108864 -p 8000:8000 -v "H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model" --name trt-qwen38 nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev202609170000 bash4 模型
trtllm-serve /model --backend pytorch --host 0.0.0.0 --port 8000 是什么意思核心结论
TRT-LLM 1.3.0 目前尚未支持 INT4 的compressed-tensors。我们来看刚才第 125~135 行的源码:
# 源码中明确写着: else: raise ValueError( f"Unsupported quant_bits: {weights_quant_config['num_bits']}. " "Supported: 8 (FP8) or 4 (NVFP4)." )TRT-LLM 1.3.0 刚刚合入对compressed-tensors的实验性支持,目前只支持 8-bit (FP8) 和 4-bit 浮点 (NVFP4 / MXFP4),还没有实现 INT4(整数量化)。
root@8486ae1773b2:/app/tensorrt_llm# python3 -c "import tensorrt_llm.models as m; print([x for x in dir(m) if 'Qwen' in x])" Skipping import of cpp extensions due to incompatible torch version 2.14.0a0+4fdf77b940.nv26.08 for torchao version 0.15.0 Please see https://github.com/pytorch/ao/issues/2919 for more info [TensorRT-LLM] TensorRT LLM version: 1.3.0rc27.dev202609170000 []真相大白:TRT-LLM 对 Qwen3.8 根本没有“纯 C++ 引擎”!
你之所以觉得 TRT-LLM 快,是因为你之前跑 Qwen2.5-14B 时用的是trtllm-build编译出来的纯 C++.engine。
但根据刚刚所有的源码检测:
- TRT-LLM 1.3.0 并没有为 Qwen3.8 编写 C++ Engine 编译器(所以
tensorrt_llm.models查出来是空的[])。 - NVIDIA 对 Qwen3.8 的支持,全部扔在了一个叫
_torch的Python 后端里。 - 换句话说:在 TRT-LLM 里跑 Qwen3.8,本质上和 vLLM 一样也是走 Python 调度,根本享受不到纯 C++ 引擎的狂暴速度,而且还缺少 INT4 开源解包算子!
最优解决方案:直接用 vLLM 运行该模型
无需重新下载任何权重,直接用我们刚才下好的H:\agent\qwen38\...目录。
第一步:退出当前 TRT 容器
在当前容器终端执行退出:
exit
第二步:在宿主机 Windows PowerShell 一键启动 vLLM
(如果需要拉取镜像,请保持本地代理开启):
docker run -d --gpus all --ipc=host -p 8000:8000 -v "H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model" --name vllm-qwen38 vllm/vllm-openai:latest --model /model --gpu-memory-utilization 0.90 --max-model-len 4096
第三步:查看启动与加载日志
docker logs -f vllm-qwen38
vLLM 会直接识别compressed-tensors并加载 Marlin INT4 内核。看到Application startup complete后即可直接调用!