vllm不同版本启动qwen3-embedding-0.6B
【环境】单张A100 80GB显存【vllm0.9.1】docker run -d --gpus all --rm --networkhost --ipchos...
【环境】单张A100 80GB显存【vllm0.9.1】docker run -d --gpus all --rm --networkhost --ipchos...
专栏定位 本专栏以 vLLM 的真实工程使用为主线,从“把模型跑起来”开始,逐步进入 OpenAI 兼容服务、批量推理、KV Cac...
专栏定位 本专栏以 vLLM 的真实工程使用为主线,从“把模型跑起来”开始,逐步进入 OpenAI 兼容服务、批量推理、KV Cac...
一、前言 这个系列从一台 RTX 3090 和一个 Qwen2.5-7B 模型开始,用五篇文章逐一实验了主流的 LLM 推理优化技术。有成功的、...
一、前言 这个系列从一台 RTX 3090 和一个 Qwen2.5-7B 模型开始,用五篇文章逐一实验了主流的 LLM 推理优化技术。有成功的、...
一、背景与目标最近在学习 AI Infra 相关内容,前面已经在 Kubernetes 单节点上完成了 GPU Operator、Volcano ...
DeepSeek-OCR-2代码实例:Python调用vLLM后端Gradio前端联动开发 1. 项目概述 DeepSeek-OCR-2是De...
很多 GPU/HPC 平台的使用门槛,不只在“有没有 GPU”,还在模型、环境、调度和服务入口之间能不能顺畅衔接。在传统流程里...
最近在本地服务器上部署了 PaddleOCR-VL ,用 vLLM 当 VLM 后端,前面接 PP-DocLayoutV2 做版面分析,跑通了完整的文档解析流水...
目录第一阶段:准备环境与硬件1.1 什么是vLLM1.2 硬件要求1.3 驱动要求第二阶段:conda 环境 vLLM2.1 安装...