技术突破
AirLLM开源:4GB显存跑2.8万亿参数Kimi K3,消费级显卡撬动旗舰模型
2026年8月初,开源框架AirLLM在GitHub上引发轰动,72小时内星标突破两万。其核心技术是"逐层流式"执行——模型完整权重存储在硬盘上,推理时逐层加载到GPU显存,任意时刻只保留当前层的权重,计算完成后立即释放。这意味着无需剪枝、蒸馏或量化,就能在消费级显卡上运行万亿参数级大模型:8GB显存可跑Llama 3.1 405B,不到4GB内存就能跑通2.8万亿参数的Kimi K3。
AirLLM的突破意义在于彻底改变了大模型的硬件门槛。过去两年,"70B模型"几乎等同于"至少4张A100",是数据中心级GPU的专属领地。AirLLM让普通开发者的游戏显卡甚至亮机卡就能跑起旗舰模型,稀疏MoE架构尤其受益——MoE模型每次推理只激活部分参数,AirLLM的逐层加载与MoE的稀疏激活形成天然配合。不过代价是推理速度较慢,因为每层都需要从硬盘读取,适合对延迟不敏感的批量任务而非实时交互。
AirLLM的出现与当前开源大模型爆发形成共振。Kimi K3开源2.8万亿参数、Qwen3.8-Max下周开源2.4万亿参数、MiniMax H3开源全模态视频模型——顶级模型权重越来越容易获取,但运行它们所需的硬件成本一直是瓶颈。AirLLM从"改变加载方式"而非"缩小模型"的角度解决了这个问题,为个人开发者和小型企业以极低成本使用旗舰模型打开了新路径。结合DeepSeek V4 Flash以十分之一价格提供接近顶级性能的API服务,AI模型的使用门槛正在以前所未有的速度降低。