docker内TRT-LLM v1.3.0rc27 win11本机部署qwen3.8
2026/9/24 17:55:18 网站建设 项目流程

1 下载模型:

modelscope download --model cyankiwi/Qwen3.8-27B-AWQ-INT4 --local_dir H:\agent\trt-llm\models\qwen3.8-27b-awq

  • 为什么这个 AWQ 不是 14GB 而是21GB
    因为作者对 Qwen3.8 敏感的Gated DeltaNet 状态更新层和因果卷积保留了 BF16 高精度,仅对占体积最大的注意力与 FFN 进行了 INT4 压缩(即W4A16 混合精度),从而确保模型不会失真;
  • 这 21GB 权重载入显存后占用约21~22 GB,正好可以压着极限完全吃满你的单张 RTX 3090(24GB)!

2 开代理拉docker:

docker pull nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev202609170000

3 建立容器:

docker run -it --gpus all --ipc=host --ulimit memlock=-1 --ulimit stack=67108864 -p 8000:8000 -v "H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model" --name trt-qwen38 nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev202609170000 bash

4 模型

trtllm-serve /model --backend pytorch --host 0.0.0.0 --port 8000 是什么意思

核心结论

TRT-LLM 1.3.0 目前尚未支持 INT4 的compressed-tensors。我们来看刚才第 125~135 行的源码:

# 源码中明确写着: else: raise ValueError( f"Unsupported quant_bits: {weights_quant_config['num_bits']}. " "Supported: 8 (FP8) or 4 (NVFP4)." )

TRT-LLM 1.3.0 刚刚合入对compressed-tensors的实验性支持,目前只支持 8-bit (FP8) 和 4-bit 浮点 (NVFP4 / MXFP4)还没有实现 INT4(整数量化)

root@8486ae1773b2:/app/tensorrt_llm# python3 -c "import tensorrt_llm.models as m; print([x for x in dir(m) if 'Qwen' in x])" Skipping import of cpp extensions due to incompatible torch version 2.14.0a0+4fdf77b940.nv26.08 for torchao version 0.15.0 Please see https://github.com/pytorch/ao/issues/2919 for more info [TensorRT-LLM] TensorRT LLM version: 1.3.0rc27.dev202609170000 []

真相大白:TRT-LLM 对 Qwen3.8 根本没有“纯 C++ 引擎”!

你之所以觉得 TRT-LLM 快,是因为你之前跑 Qwen2.5-14B 时用的是trtllm-build编译出来的纯 C++.engine

但根据刚刚所有的源码检测:

  1. TRT-LLM 1.3.0 并没有为 Qwen3.8 编写 C++ Engine 编译器(所以tensorrt_llm.models查出来是空的[])。
  2. NVIDIA 对 Qwen3.8 的支持,全部扔在了一个叫_torchPython 后端里。
  3. 换句话说:在 TRT-LLM 里跑 Qwen3.8,本质上和 vLLM 一样也是走 Python 调度,根本享受不到纯 C++ 引擎的狂暴速度,而且还缺少 INT4 开源解包算子!

最优解决方案:直接用 vLLM 运行该模型

无需重新下载任何权重,直接用我们刚才下好的H:\agent\qwen38\...目录。

第一步:退出当前 TRT 容器

在当前容器终端执行退出:

exit

第二步:在宿主机 Windows PowerShell 一键启动 vLLM

(如果需要拉取镜像,请保持本地代理开启):

docker run -d --gpus all --ipc=host -p 8000:8000 -v "H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model" --name vllm-qwen38 vllm/vllm-openai:latest --model /model --gpu-memory-utilization 0.90 --max-model-len 4096

第三步:查看启动与加载日志

docker logs -f vllm-qwen38

vLLM 会直接识别compressed-tensors并加载 Marlin INT4 内核。看到Application startup complete后即可直接调用!

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询