极力GPU-极致算力租赁平台欢迎您!
您当前位置:首页>技术资讯>行业新闻

一台3090就能跑Gemma 3 27B!谷歌发布Gemma 3全系QAT版模型这都可以

机器之心报道机器之心编辑部谷歌 Gemma 3 上线刚刚过去一个月,现在又出新版本了。该版本经过量化感知训练(Quantization-Aware Training,QAT)优化,能在保持高质量的同时显著降低内存需求。..

18584883263 立即咨询

快速申请测试

称       呼 :
手机号码 :
备       注:
分享:

一台3090就能跑Gemma 3 27B!谷歌发布Gemma 3全系QAT版模型这都可以

发布时间:2025-09-02 热度:1

机器之心报道

机器之心编辑部

谷歌 Gemma 3 上线刚刚过去一个月,现在又出新版本了。

该版本经过量化感知训练(Quantization-Aware Training,QAT)优化,能在保持高质量的同时显著降低内存需求。

比如经过 QAT 优化后,Gemma 3 27B 的 VRAM 占用量可以从 54GB 大幅降至 14.1GB,使其完全可以在 NVIDIA RTX 3090 等消费级 GPU 上本地运行!

Chatbot Arena Elo 得分:更高的分数(最上面的数字)表明更大的用户偏好。点表示模型使用 BF16 数据类型运行时所需的 NVIDIA H100 GPU 预估数量。

机器之心在一台配备了 RTX 3070 的电脑上简单测试了其中的 12B 版本,可以看到虽然 Gemma 3 的 token 输出速度不够快,但整体来说还算可以接受。

基于量化感知训练的 Gemma 3

在 AI 模型中,研究者可以使用更少的位数例如 8 位(int8)甚至 4 位(int4)进行数据存储。

采用 int4 量化意味着每个数值仅用 4 bit 表示 —— 相比 BF16 格式,数据大小缩减至 1/4。

但是,这种量化方式通常会导致模型性能下降。

那谷歌是如何保持模型质量的?答案是采用 QAT。

与传统在模型训练完成后才进行量化的方式不同,QAT 将量化过程直接融入训练阶段 —— 通过在训练中模拟低精度运算,使模型在后续被量化为更小、更快的版本时,仍能保持准确率损失最小化。

具体实现上,谷歌基于未量化的 checkpoint 概率分布作为目标,进行了约 5,000 步的 QAT 训练。当量化至 Q4_0(一种常见的量化格式) 时,困惑度下降了 54%。

这样带来的好处之一是加载模型权重所需的 VRAM 大幅减少:

Gemma 3 27B:从 54 GB(BF16)降至仅 14.1 GB(int4)Gemma 3 12B:从 24 GB(BF16)缩减至仅 6.6 GB(int4)Gemma 3 4B:从 8 GB(BF16)精简至 2.6 GB(int4)Gemma 3 1B:从 2 GB(BF16)降至仅 0.5 GB(int4)

此图仅表示加载模型权重所需的 VRAM。运行该模型还需要额外的 VRAM 用于 KV 缓存,该缓存存储有关正在进行的对话的信息,并取决于上下文长度。

现在看来,用户在消费级设备上就能运行更大、更强的 Gemma 3 模型,其中:

Gemma 3 27B (int4):现在可以轻松安装在单张 NVIDIA RTX 3090(24GB VRAM)或类似显卡上,本地就能运行最大的 Gemma 3 版本;Gemma 3 12B (int4):可在 NVIDIA RTX 4060 GPU(8GB VRAM)等笔记本电脑 GPU 上高效运行,为便携式设备带来强大的 AI 功能;更小的型号(4B、1B):为资源较为有限的系统(包括手机和烤面包机)提供更强大的可访问性。

来自 Two Minute Papers 频道的玩笑

官方 int4 和 Q4_0 非量化 QAT 模型已在 Hugging Face 和 Kaggle 上线。谷歌还与众多热门开发者工具合作,让用户无缝体验基于 QAT 的量化 checkpoint:

Ollama:从今天起,只需一个简单命令即可原生支持 Gemma 3 QAT 模型。LM Studio:通过用户友好界面,轻松下载并在桌面上运行 Gemma 3 QAT 模型。MLX:利用 MLX 在苹果芯片上对 Gemma 3 QAT 模型进行高效推理。Gemma.cpp:使用专用的 C++ 实现,直接在 CPU 上进行高效推理。llama.cpp:得益于对 GGUF 格式 QAT 模型的原生支持,可轻松集成到现有工作流程中。

激动的网友已经无法抑制内心的喜悦:「我的 4070 就能运行 Gemma 3 12B,这次谷歌终于为即将破产的开发者做了一些事情。」

「希望谷歌朝着 1bit 量化使使劲。」

这个可以本地运行的 Gemma 3 你用了吗,效果如何,欢迎大家评论区留言。

参考链接:https://developers.googleblog.com/en/gemma-3-quantized-aware-trained-state-of-the-art-ai-to-consumer-gpus/?linkId=14034718

关键词:

关闭窗口
上一篇:显存翻倍!英伟达RTX 4090 48G与96G版曝光,或许会减价?硬核推荐
下一篇:一代矿王?英伟达RTX 3090矿卡评测难以置信

相关阅读

一文看懂英伟达的产品体系和命名规则不要告诉别人
一文看懂英伟达的产品体系和命名规则不要告诉别人

英伟达这几年很火。因为AI的带动,它几乎成为全球最受关注的公司。 我们总是会在网上看到和英伟达有关的一些名词,例如: A100、B100、H100、GH200、GB200、NVLINK、NVSwitch、DGX、H···...

H20解禁,英伟达地位动摇?这都可以
H20解禁,英伟达地位动摇?这都可以

本文来自微信公众号:王智远,作者:王智远,原文标题:《H20解禁,中美AI闭环竞赛开启》,题图来自:AI生成 黄仁勋又来了。 今年第三次来中国,北京35度的大热天,他居然还穿着那件标志性的“黄夹克”,站在小米汽车前···...

H20没人买了,英伟达要推高端AI芯片,来打压中国芯?一看就会
H20没人买了,英伟达要推高端AI芯片,来打压中国芯?一看就···

不得不说,英伟达专门为中国市场定制的H20芯片,最近算是彻底卖不动了。原因其实挺直接——性能拉胯还可能有安全隐患,中国用户自然不买账。 先说性能问题。H20是基于英伟达高端芯片H100“阉割”而来的,但阉割得实在太狠,性能···...

英伟达的季报显示中国专用芯片H20销售收入为零这都可以
英伟达的季报显示中国专用芯片H20销售收入为零这都可以

2025 年 7 月 17 日,英伟达首席执行官黄仁勋离开北京中国国际供应链博览会 (CISCE) 时向人群挥手致意。 看点英伟达的最新盈利数据显示其芯片销售持续强劲,但有一个缺项却格外引人注目···...

关于英伟达H20芯片的情况,确实涉及到一些复杂的技术和安全问题原创
关于英伟达H20芯片的情况,确实涉及到一些复杂的技术和安全问···

你提到的关于英伟达H20芯片的情况,确实涉及到一些复杂的技术和安全问题。下面我将根据目前的信息,为你梳理一下事件的来龙去脉和可能的影响。 网信办约谈英伟达的原因 国家互联网信息办公室(网信办)在2025年···...

或将退出历史舞台?英伟达被传暂停生产H20芯片奔走相告
或将退出历史舞台?英伟达被传暂停生产H20芯片奔走相告

导语 当地时间8月21日下午,科技媒体《The Information》援引知情人士消息披露,英伟达(NVIDIA)已通知韩国三星电子、美国安靠科技等核心供应链企业,暂停H20芯片的相关生产工作。这款曾支撑起英伟达中国市场···...

H20芯片后门的冷思考难以置信
H20芯片后门的冷思考难以置信

近日,英伟达销售给我国的算力芯片H20,因被曝出存在严重安全问题,被我国网信办约谈。 人民日报锐评道:英伟达,让我怎么相信你? 简单捋下事件脉络。 2023年底,英伟达推出H20芯片,陆续向中国客户供货。今···...

H20芯片解禁,怎么看?学会了吗
H20芯片解禁,怎么看?学会了吗

日前,英伟达CEO黄仁勋在北京访问期间宣布,美国政府已批准H20芯片恢复对华出口。 H20芯片,是英伟达按照美国对华技术出口管制要求专为中国市场设计的AI芯片,性能远不及其国际市场主流GPU芯片H100。今年4月,该芯片被···...

英伟达H20芯片背后的暗战:「15%保证金」能守住我国AI安全吗?这都可以
英伟达H20芯片背后的暗战:「15%保证金」能守住我国AI安···

(来源:即梦AI ) 朋友们,今天接着聊AI芯片的话题。 据“观察者网”报道,8月22日,外媒援引知情人士的消息称,英伟达已经告知安靠科技、三星等供应商,暂停H20相关生产。而在此前的7···...

H20一块没卖出!黄仁勋想卖中国厂商英伟达新GPU 谁会/敢买没想到
H20一块没卖出!黄仁勋想卖中国厂商英伟达新GPU 谁会/敢···

快科技8月30日消息,英伟达刚刚发布的财报显示,本财季中国厂商没有采购一块H20芯片,黄仁勋都看在眼里,他也非常着急。 H20被质疑可能存有后门风险后,虽然黄仁勋和英伟达多次回应,但也仅仅停留在语言层面,而没有拿出什么有利···...

英伟达AI芯片A100 、A800、 H100 、H800 、B200满满干货
英伟达AI芯片A100 、A800、 H100 、H800 ···

今年3月份,英伟达发布了Blackwell B200,号称全球最强的 AI 芯片。它与之前的A100、A800、H100、H800有怎样的不同? 英伟达GPU架构演进史 我们先回顾一下,历代英伟达AI加速···...

¥9.99租英伟达H800!双十一算力羊毛真香,闲置卡也能挂机变现学会了吗
¥9.99租英伟达H800!双十一算力羊毛真香,闲置卡也能挂···

小明 发自 凹非寺 量子位 | 公众号 QbitAI 双十一大促没有羊毛可薅? 不如来看看算力吧(doge)。 A800价格低至5.88元/卡时,H800价格低至9.99元/卡时。限量开抢,先到先得···...

DeepSeek开源大餐来了!解锁H800,带飞GPU推理速度,1小时10万观看深度揭秘
DeepSeek开源大餐来了!解锁H800,带飞GPU推理速···

作者|程茜编辑|心缘 智东西2月24日报道,刚刚,DeepSeek开源周第一天重磅更新来了,开源首个代码库——FlashMLA,发布一小时GitHub Star数冲上1700。 FlashMLA指的是De···...

太震撼!DeepSeek用226台H800服务器,日赚409万!这样也行?
太震撼!DeepSeek用226台H800服务器,日赚409···

大周末的,DeepSeek悄么声放了个大招。 他们知乎官号发了一篇雄文,披露了【如何对DeepSeek V3/R1的推理系统进行优化】,文章有2大核心内容↓ 一、如何通过优化架构,让模型推理获得更大的吞吐和更低的延···...

A800、H800都低到这个价了,这个暑假搞了点算力福利万万没想到
A800、H800都低到这个价了,这个暑假搞了点算力福利万万···

这个暑假,在学校搞 AI 的你是不是还在卷研究? 是不是还缺点算力? 是不是想要点折扣? 它来了!面向高校用户,英博云特别推出「暑期现金消耗返券活动」。 满足规则,A800 低至 4.26 元 / ···...



客服微信号

24小时热线18584883263

安徽合肥高新区