
先交代一下家底:RTX 3060 12G,系统内存64G DDR-4 3200,共享内存靠“借”。
这个配置在AI玩家里属于“低保户”。跑Wan2.2要靠Low/High两阶段硬撑,跑H3要等GGUF量化,跑LTX 2.3画面惨不忍睹。但就是这套设备,让我在过去几个月里,硬生生跑出了一套自己的玩法。
我不买云GPU,不租算力,不薅羊毛(免费额度)。我就用自己的设备,等社区优化,等量化版本,等大神们的显卡先冒烟。
这就是一种"穷玩",也是一种选择。或者说,是一种被逼出来的选择。
一、H3来了,我的12G显存够不够?
2026年8月3日,MiniMax H3开源。
全模态生成:文生视频、图生视频、视频参考、音频输入、原生立体声输出,一个模型全搞定。相比Wan2.2的“High定框架+Low补细节”两阶段流程,H3一步到位——在Wan里你要疯狂切换模型,在H3里你只需要拖入素材点一下生成。
但我的12G显存,一开始连门槛都摸不到。
-
BF16全精度:主模型66GB + 文本编码器51GB + VAE 5GB = 约123GB(做梦)
-
INT8版本:主模型34GB + 文本编码器27GB + VAE 5GB = 约66GB(依然不可能)
-
pruned INT8:主模型21GB + 文本编码器27GB + VAE 5GB = 约53GB(借内存也很难)
然后社区开始发力。
NF4量化全家桶出来了:主模型17.16GB + 文本编码器15.32GB + VAE 1.89GB = 约34.4GB。配合“文本编码器放内存、主模型和VAE放显存”的混合加载策略,我的12G显存+64G共享内存,也算卡在及格线上。
GGUF也来了:Q2_K版本主模型只有10.94GB,12G显存直接装得下。代价是画质损失,但至少证明了“这条路走得通”。
唯一缺的,是加速。我要的不是“能跑”,而是“能爽快地跑”。等蒸馏版,等4步采样,等大神们把“显卡冒烟”的成果转化成我这种普通人能一键导入的ComfyUI工作流。
二、从Flash到CUDA:历史总是押韵
等待的时候,我想到一件旧事——Flash。
2000年代,Flash装机率98%,动画丝滑,开发工具强大,是Web王者。然后呢?
-
乔布斯一封公开信宣判死刑
-
HTML5以“够用”的姿态崛起
-
移动端不支持直接致命
-
2020年正式停用
讽刺的是:直到今天,HTML5的动画能力依然比不上当年的Flash。
但Flash还是死了。为什么?
因为技术优势不是护身符,生态位置才是。Flash是闭源的,命运系于Adobe一家公司。而HTML5是开放的,所有浏览器原生支持,所有开发者都能参与。
Flash的结局不是“被击败”,而是“被抛弃”。
当我看到H3首发INT8而不是FP8时,我知道这个故事正在重演。
INT8的软件栈成熟度远高于FP8——AMD ROCm、华为昇腾CANN、摩尔线程MUSA、Intel OpenVINO,都对INT8有深度支持。首发INT8,意味着“尽可能多的硬件能跑”。
这背后是一股更大的浪潮:摆脱CUDA。
三、“去CUDA化”不是幻想,是正在进行时
你问我为什么觉得CUDA会被绕开?我看到了三股力量。
第一股,是AI自己写代码。
DeepSeek的缔造者曾公开断言:CUDA的护城河正在被AI瓦解。当编程代理开始接管底层内核的编写,当AI能在10小时内重构一套软件堆栈,那围绕特定芯片筑起的高墙便不再是天堑。技术主权,正在从硬件厂商手中,悄然回流到开发者社区。
第二股,是全行业的集体觉醒。
H3开源首日,华为昇腾、摩尔线程、AMD、Intel全部都可以实现Day-0适配。Hugging Face、ModelScope、ComfyUI同日支持。这并非巧合,而是整个产业链在用一个行动回答一个问题:我们还要把命运系于一家公司吗?
第三股,是地缘政治与商业现实的双重挤压。
出口管制、算力断供、持续涨价的高端算力卡——当这些成为“新常态”,“寻找备胎”便不再是远景规划,而是必须执行的策略。首发INT8而非FP8,H3选择的不是“最好的精度”,而是“最广的兼容”。这是一个信号:我们不想绑死在任何一座孤岛上。
四、当Flash的故事在显卡市场重演
说完了AI,再说消费级显卡。
RTX 3060复产。
官方说,这是为了“平抑市场”。理由是存储芯片涨价。但你稍稍溯源,便会发现一个有趣的闭环:是谁把AI算力需求炒到了天上去?是谁让数据中心近乎贪婪地吞噬着每一片晶圆?当一个人既是潮水的制造者,又是救援船的船长时,这场戏就变得耐人寻味了。
他让企业为数据中心卡支付天价,赚得盆满钵满;他让产业链成本飙升,供应链价格水涨船高;然后,他转身面向消费者,推出一张几年前的老卡,价格甚至比停产前更高,并称之为“恩赐”。
这不就是“我先制造问题,再靠解决问题赚钱”的标准剧本吗?
然后我们来看国产卡。
12GB显存,2688元。性能呢?多家评测下来,大约只有RTX 3060的三分之二。
而复产的RTX 3060 12G,京东自营2200元左右。AMD和Intel同价位的卡,性能更强,生态更完整。
国产卡不是“性价比不高”,而是“性价比倒挂”。
我跟朋友说:如果它卖1688元,一切问题都不存在了。1688元,消费者会说:“千把块钱,就算翻车也不心疼,支持一下国货。”但2688元,消费者会开启“货比三家”模式——然后毫不犹豫地选择别人。
1688元是“赌一把”的入场券,2688元是“及格线”的考卷。当消费者开始“比”的时候,国产卡便失去了被宽容的机会。
五、两个“脱离”,同一个底层逻辑
所以我看到了一个趋势:AI正在脱离CUDA,玩家正在脱离被绑架的游戏显卡市场。
这两个“脱离”不是孤立的。它们的病灶,是同一个时代背景下的算力霸权。
数据中心业务推高了整个产业链的成本,挤压了消费级显卡的生存空间。结果就是:
-
AI开发者想绕开它,因为算力被卡、成本失控
-
游戏玩家想绕开它,因为价格离谱、选择匮乏
-
最后,所有人都开始寻找“不需要它”的方式
历史几千年来反复证明:当一个垄断者开始“两头吃”——既制造问题,又靠解决问题赚钱——它的统治便进入了倒计时。
Flash不是被“更好的Flash”打败的。它被HTML5绕开了。
CUDA也可能不是被“更好的CUDA”打败的。它将被“不需要CUDA”的范式绕开。
显卡帝国呢?它将被“不需要顶级显卡”的游戏生态和“不需要N卡”的AI生态联合绞杀。
终结垄断的,从来不是另一个垄断者,而是整个行业对“垄断”这件事本身的集体厌倦。
六、最后:我依然在等
说了这么多,我依然只是一个12G显存的普通玩家。
我在等H3的蒸馏版。
我在等ComfyUI的稳定工作流。
我在等国产生态真正落地到消费级市场。
我在等那个“1688元,性能说得过去,能跑主流模型”的国产卡出现。
但我不急。
历史无数次证明:“足够好”的替代品加上“根本性”的范式转移,就能彻底瓦解曾经的护城河。
现在,三股力量——AI自己写代码、国产算力崛起、全球去CUDA化——正在同时推进。而消费级显卡市场,也在被同样的逻辑重塑。
最终,我相信AI会脱离CUDA,消费者也会脱离被绑架的游戏显卡市场。
到那时候,我们回头再看2026年的这场“显卡战争”,会发现:真正终结算力霸权的,不是另一家芯片公司,而是整个行业对“垄断”这件事本身的集体厌倦。
而你我,正在用自己的设备,见证和参与这场变革。
本文地址:
转载请注明出处,谢谢!
声明:登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。