# vllm-docs **Repository Path**: omnihorizon/vllm-docs ## Basic Information - **Project Name**: vllm-docs - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-07-13 - **Last Updated**: 2026-07-20 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # vLLM 特性文档 本目录收录 vLLM 关键特性的中文说明文档,便于本地查阅与维护。 ## 文档索引 | 文档 | 说明 | |------|------| | [gpu-request-processing-flow.md](./gpu-request-processing-flow.md) | GPU 场景:HTTP 收请求 → 调度 → 前向/采样 → 回包;含 TP 多卡、async scheduling、KV offload hook 与函数调用链 | | [gpu-dma-ddr-features.md](./gpu-dma-ddr-features.md) | 与 GPU DMA 读写 DDR 相关的特性、数据路径、配置与源码索引 | | [kv-offload-batch-memcpy.md](./kv-offload-batch-memcpy.md) | KV offloading 批量 DMA API(`cuMemcpyBatchAsync` 等)与 `cudaMemcpyAsync` 的区别 | | [capability-evaluation.md](./capability-evaluation.md) | 接下来可开展的能力评估计划(含 `cuMemcpyBatchAsync` 与 ANY 式预取) | | [pcie-topology-evaluation.md](./pcie-topology-evaluation.md) | 单机四卡 L20:直连 RC vs PCIe Switch;五维评估(p2pBandwidthLatencyTest / nvbandwidth / H2D·D2H / NCCL / vLLM) | ## 上游官方文档 以下路径相对于 vLLM 源码仓库根目录(`/home/nathan/vllm-upstream`): - `docs/features/kv_offloading_usage.md` — KV Offloading 配置指南 - `docs/features/disagg_prefill.md` — Disaggregated Prefill 概览 - `docs/features/nixl_connector_usage.md` — NixlConnector 用法 - `docs/features/mooncake_connector_usage.md` — MooncakeConnector 用法 - `docs/features/mooncake_store_connector_usage.md` — MooncakeStore KV 池 - `docs/features/disagg_encoder.md` — Disaggregated Encoder - `docs/serving/parallelism_scaling.md` — GPUDirect RDMA 配置 - `docs/models/extensions/instanttensor.md` — InstantTensor / GDS 权重加载