硬件

规格
GPU NVIDIA GeForce RTX 4090,48 GB(49140 MiB)
驱动 595.80,CUDA 13.2
CPU Intel Xeon Gold 6530,8 核 16 线程
内存 94 GB
系统 Ubuntu 22.04.5 LTS(Docker 容器)
磁盘 overlay 共 79 GB,当前空闲 ~43 GB

最终方案

选型

关键路径

服务端核心启动命令

/opt/vllm-env/bin/vllm serve /opt/qwen-models/qwen3.8-awq-mtp \
  --port 8080 \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.95 \
  --kv-cache-dtype fp8 \
  --spec-method mtp --spec-tokens 4 \
  --enable-auto-tool-choice --tool-call-parser qwen3_xml \
  --reasoning-parser qwen3 \
  --served-model-name qwen3.8-27b-awq-mtp

关键 flag 解读:

实测性能

客户端(opencode)配置

被排除的备选方案

方案 结果
llama.cpp Q4_K_M GGUF + 单 slot 262K 下 49.4 tok/s,但无 vLLM 并发批处理,放弃
OptimizeLLM Qwen3.8-27B-heretic-MTP-FP8 实测 48.7 tok/s,MTP 有效,但 FP8 的有效上下文不够 262K

注意事项