AirLLM

AirLLM 是一款开源大语言模型推理库,通过每次仅在 GPU 上保留单层模型的分层内存管理技术,使 70B 参数模型能在单张 4GB 显存显卡上运行,无需量化、蒸馏或剪枝。适合在消费级硬件上部署超大规模开源模型的开发者和研究人员。

AirLLM 是一款开源大语言模型推理库,通过每次仅在 GPU 上保留单层模型的分层内存管理技术,使 70B 参数模型能在单张 4GB 显存显卡上运行,无需量化、蒸馏或剪枝。适合在消费级硬件上部署超大规模开源模型的开发者和研究人员。

提供方: lyogavin

适合用户

  • 大模型开发者与研究人员
  • 在消费级 GPU 上部署大模型的个人开发者
  • 需要运行超大规模开源模型的 AI 工程师

不适合

  • 推理时原始模型会先被逐层分解保存,需要大量磁盘空间
  • MacOS 上仅支持 Apple Silicon 芯片
  • 预取功能目前仅 AirLLMLlama2 支持
  • 加载 QWen 或 ChatGLM 时需使用 AutoModel 而非 AirLLMLlama2
  • Kimi K3 要求 CUDA 12 版 torch 且无 CUDA 13 预编译 flash-attn wheel
  • Kimi K3 要求 transformers 4.56.x,不支持 5.x

核心能力

  • 低显存大模型推理
  • 块量化模型压缩
  • 主流开源模型广泛支持
  • MacOS Apple Silicon 支持

使用步骤

  • 快速开始推理流程
  • 启用模型压缩加速

适用场景

  • 在低端 GPU 上运行大语言模型 - 在消费级 GPU 上部署大模型的个人开发者
  • 在 Mac 上运行大语言模型 - 大模型开发者与研究人员

访问与价格

可用状态: 当前可用

价格信息: 开源

支持平台: Linux, macOS, 自托管

价格说明: 开源项目,Apache-2.0 许可证,可免费使用。

官方入口

常见问题

  • 遇到 MetadataIncompleteBuffer 错误怎么办?
  • 遇到 ValueError: max() arg is an empty sequence 怎么办?
  • 遇到 401 Client Error(gated model)怎么办?

来源核验

资料核验于 2026-08-02