资讯动态

杀疯了!4GB 显存跑 70B 大模型,不量化不剪枝,GitHub 狂揽 2.8 万 Star

发布时间:2026/8/8 13:26:34 来源:尧图企业网站定制
本地跑大模型的人绕不开量化这个词。模型装不下显存就压成 8bit、4bit效果差一点也得接受不然根本跑不起来。我自己的显卡 8G不量化的话14B 以上的模型想都不用想。前阵子翻到 AirLLM 这个项目它做的事情刚好相反不量化不蒸馏不剪枝跑原始权重然后告诉你 4GB 显存就能跑 70B 的模型140GB 的东西塞进 4GB 显存里听着就不太对劲。我把 README 和社区的实测帖都翻了一遍确认它不是吹牛觉得值得写一篇。这项目 2023 年底就有了一直在更新最近支持的模型越来越多热度又起来了。简介AirLLM 是一个 Python 库Apache 2.0 协议开源GitHub 上 2.8万 Star。它的用途就一个让显存不大的显卡也能跑大模型。官方给的数字是这样的模型参数量需要的显存Llama 3.x 70B70B约 4GBLlama 3.1 405B405B约 8GBDeepSeek-V3671B约 12GBKimi K3MoE2.8T实测 3.72GB这些数字说的都是原始权重没有经过量化也就是说跑出来的效果就是模型本来的效果。先把话说在前面它跑得很慢慢到什么程度我在使用场景那节讲能接受这一点再往下看。它能做什么4GB 显存跑 70B 模型大模型推理的时候不是整个模型同时干活是一层一层往下算的。AirLLM 的做法就是显存里只放当前这一层算完挪走再读下一层进来。模型权重整个放在硬盘上用到哪层读哪层。所以显存占用只取决于单层多大跟模型总大小没关系。70B 的模型一层大概 1.6GB4GB 显存够用。MoE 架构的模型还更省DeepSeek-V3、Kimi K3 这种每次推理只激活一部分专家AirLLM 只把当前用到的那个专家读进来所以 2.8T 的模型显存占用也不高。主流开源模型基本都支持用法就是传一个模型 ID一行代码的事。支持的模型列表很长Llama 2/3/3.1/4、Qwen 全系列、DeepSeek V2/V3/R1、Mistral、Mixtral、Phi、Gemma、ChatGLM、百川、InternLM、Yi。官方说新出的热门模型基本发布当天就能用。想快一点可以开压缩默认是不压缩的想快一点的话它给了 4bit 和 8bit 两种压缩选项官方说最多快 3 倍。README 里有张对比图同样一段推理不压缩 449 秒8bit 是 237 秒4bit 是 157 秒。代价是精度有一点损失官方的说法是可以忽略。开压缩之前要先装 bitsandbytes快速开始那节有命令。Mac 和纯 CPU 也能跑没有 N 卡也能用。Mac 只支持 M 系列芯片装好 mlx 和 torch代码跟在 Linux 上写的一样。它还支持纯 CPU 推理速度更慢但能把流程跑通适合手头什么卡都没有的情况。预取机制默认开着GPU 算当前这一层的时候下一层已经在后台从硬盘往内存里读了两件事同时进行官方数据是能快 10% 左右。这个功能默认就是开的我们不用做任何配置。快速开始装库就一行pip install airllm想用压缩加速的话再装一个pip install -U bitsandbytes代码跟平时用 transformers 差不多from airllm import AutoModel model AutoModel.from_pretrained(Qwen/Qwen3-32B) input_text [中国的首都是哪里] input_tokens model.tokenizer(input_text, return_tensorspt, return_attention_maskFalse, truncationTrue, max_length128, paddingFalse) generation_output model.generate( input_tokens[input_ids].cuda(), max_new_tokens20, use_cacheTrue, return_dict_in_generateTrue) print(model.tokenizer.decode(generation_output.sequences[0]))想跑更大的模型改一行模型名就行。Qwen3-235B 大概占 3GB 显存DeepSeek-V3 大概占 12GB。有几个坑提前说一下1、第一次跑的时候它会先把模型整个下载下来再一层一层拆开存到磁盘所以磁盘空间一定要够。70B 的模型光下载就要 130GB 上下拆分还会再占一份。磁盘不够的话报错信息很迷惑官方 FAQ 专门写了这一条。2、模型文件最好放 SSD 上它大部分时间都花在从硬盘读权重机械硬盘会慢到离谱。硬盘实在紧张的话可以传delete_originalTrue拆完之后把原始模型文件删掉能省一半空间。3、Llama 这类需要申请权限的模型要传 Hugging Face 的 token 才能下载。Qwen、DeepSeek 这些没有这道门槛直接下。使用场景先说适合的1、离线批量任务 比如本地有一批文档要总结、一批数据要打标扔给它慢慢跑跑一晚上出结果这种场景速度不重要能跑完就行。2、本地实验和学习 想看看 70B 的模型到底什么水平又不想租云上的卡用它在自己机器上就能试。跑的是原始权重我们看到的效果就是模型真实的效果没有被量化坑过一遍。3、数据不能出本地的场合 有些行业的数据没法传到外面的服务上本地部署是硬要求显存又不够这种时候它是少数几个能走通的方案。再说不适合的任何要实时交互的场景都不行。 在线聊天、客服、代码补全这些等不起它的速度瓶颈在硬盘读数据上快的时候一两秒出一个字慢的时候几十秒出一个字都有可能。社区里有人在 RTX 6000 Ada 上实测跑出过将近 300 秒一个字的成绩它就不是干这个的。想本地跑聊天助手的话用 llama.cpp 或者 Ollama 加载量化模型体验好得多。我的看法我对这个项目的定位是它解决的是能不能跑的问题不是跑得快不快的问题。Hacker News 上有人拿速度说事说一分钟出不了几个字。速度确实是它的短板这个没什么好争的但反过来想手里只有消费级显卡的人以前根本没机会在自己机器上碰 70B、671B 这个量级的模型现在至少能跑了。批量任务挂一晚上早上起来看结果我觉得是可以接受的。我做 Java 出身早几年用大模型就是调接口接口后面怎么跑的跟我没关系。这两年自己折腾本地模型才发现显存是最现实的一道坎多大的模型、多少钱的卡先过这一关再说。AirLLM 把这关的门槛拉得很低这是我介绍它的理由之一。最后强调如果你的需求是本地跑个助手聊天不要用这个等一个字几十秒谁也受不了。它适合的就是批量任务和本地实验这两类事。开源地址https://github.com/lyogavin/airllm点击下方卡片关注极客之家这个公众号曾分享过许多有趣的开源项目。如果你不想逐篇翻阅历史文章也可以直接关注微信公众号“极客之家”通过后台留言与我们互动交流这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价