【大模型推理】vllm 源码安装
vLLM 源码安装指南前置要求操作系统: LinuxPython: 3.10 - 3.13GPU: NVIDIA GPU计算能力 7.0 或更高 (如 V100, T4, RTX20xx, A100, L4, H100 等)安装方法方法一Python-only 构建仅修改 Python 代码无需编译如果你只需要修改 Python 代码可以使用预编译的 wheel速度最快cd/home/admin/workspace/aop_lab/app_source/code/public/vllmVLLM_USE_PRECOMPILED1pipinstall--editable.方法二完整构建包含 C/CUDA 编译如果需要修改 C 或 CUDA 代码需要完整编译cd/home/admin/workspace/aop_lab/app_source/code/public/vllm pipinstall-e.加速编译技巧安装ccache可以大幅加速后续编译# 安装 ccachepipinstallccache# 或 apt install ccache# 然后编译CCACHE_NOHASHDIRtruepipinstall--no-build-isolation-e.限制编译并行数防止内存不足exportMAX_JOBS4pipinstall-e.方法三使用已有的 PyTorch 安装如果你已经安装了特定版本的 PyTorchcd/home/admin/workspace/aop_lab/app_source/code/public/vllm python use_existing_torch.py pipinstall-rrequirements/build.txt pipinstall--no-build-isolation-e.注意事项CUDA Toolkit: 确保安装了完整的 CUDA Toolkit并设置环境变量exportCUDA_HOME/usr/local/cudaexportPATH${CUDA_HOME}/bin:$PATH验证 CUDA 安装nvcc--version编译时间: 完整构建可能需要几分钟到十几分钟取决于机器性能。HuggingFace 镜像配置国内用户由于国内网络访问 HuggingFace 可能较慢建议配置镜像exportHF_ENDPOINThttps://hf-mirror.com安装验证验证安装版本python3-cimport vllm; print(fvLLM 版本: {vllm.__version__})验证核心模块python3-c from vllm import LLM, SamplingParams import vllm.engine import vllm.model_executor print(所有核心模块加载成功) 推理测试fromvllmimportLLM,SamplingParams# 加载模型llmLLM(modelfacebook/opt-125m,trust_remote_codeTrue)# 设置采样参数sampling_paramsSamplingParams(temperature0.7,top_p0.95,max_tokens20)# 执行推理outputsllm.generate([Hello, my name is],sampling_params)# 打印结果foroutputinoutputs:promptoutput.prompt generated_textoutput.outputs[0].textprint(f提示:{prompt})print(f生成:{generated_text})测试结果项目结果版本0.16.1rc1.dev52g6467b635b模型加载✅ 成功推理执行✅ 成功模型内存占用0.24 GiBKV 缓存84.37 GiB 可用推理速度输入 47.16 toks/s, 输出 157.17 toks/s参考文档vLLM 官方文档GPU 安装指南从源码构建