LMCache

LMCache 是一个面向大语言模型推理的 KV Cache 管理层,以 Apache 2.0 许可证开源。它通过将临时的 KV Cache 转变为可跨请求复用、可持久存储和可监控的资源,降低首字延迟并提升吞吐量。适合 LLM 推理服务部署工程师和 AI 基础设施开发者优化长上下文及多轮对话场景。

LMCache 是一个面向大语言模型推理的 KV Cache 管理层,以 Apache 2.0 许可证开源。它通过将临时的 KV Cache 转变为可跨请求复用、可持久存储和可监控的资源,降低首字延迟并提升吞吐量。适合 LLM 推理服务部署工程师和 AI 基础设施开发者优化长上下文及多轮对话场景。

提供方: LMCache

适合用户

  • LLM 推理服务部署工程师
  • AI 基础设施开发者
  • 需要优化 LLM 推理性能的研究人员

不适合

  • LMCache 是面向 LLM 推理基础设施的 KV Cache 管理层,并非端用户直接使用的应用产品
  • 文档和社区资源主要面向具备 LLM 服务部署经验的开发者

核心能力

  • KV Cache 管理与复用
  • 分层 KV Cache 卸载
  • 非前缀 KV 复用
  • PD 分离与 KV 传输
  • 生产级 KV Cache 可观测性
  • 引擎无关部署
  • 可插拔 KV 变换

使用步骤

  • 安装与部署 LMCache
  • 集成存储与传输后端

适用场景

  • 长上下文 Agentic 工作负载加速 - LLM 推理服务部署工程师
  • 跨推理引擎 KV Cache 复用 - AI 基础设施开发者
  • Prefill-Decode 分离部署 - AI 基础设施开发者

访问与价格

可用状态: 当前可用

价格信息: 开源

支持平台: API, 自托管

价格说明: LMCache 是基于 Apache 2.0 许可证的开源项目,可免费使用

官方入口

常见问题

  • LMCache 是什么?
  • 如何安装 LMCache?
  • LMCache 使用什么许可证?
  • LMCache 支持哪些存储后端?

来源核验

资料核验于 2026-08-02