哎呀本来今天想写这个的时候,昨晚上一直聊这个话题的时候,我也没有摆出量化数据
因为昨天我在床上躺着很累了,没有下床到电脑旁边做数据的量化分析
今天晚上有空了,坐下来认认真真的找了两小时的数据和做数据可视化分析准备发帖的时候,本来想引用昨天的帖子,但是很可惜,该贴已经被删掉了,那么在本帖我就重新系统性的整理一下我的观点,附带上一些分析
附带昨天那位佬友的原话
看到 GLM5 的套餐限制,综合近些日子的所思所想,与大家一同分享。
因为芯片制造设备制裁和芯片封锁,中国本就落后的芯片设计和制造业能提供的算力有限,中国和美国的算力差距越来越大。
训练算力直接关乎到模型能力,在相同条件下,拥有更多的训练算力可以尝试训练更多的模型,来选择出最优的那一个。推理算力则关乎到 ai 使用的价格,推理算力越多越廉价的情况下,ai 使用价格也会更便宜。
在算力差距下,国内 glm 的套餐仍然扣扣搜搜,但是 openai 的 codex,谷歌大善人之前的免费 apikey 和现在 antigravity 等都大肆挥霍 token,英伟达和 cerebras 还有 xai 的算力几乎点击就送
最近的元宝千问大战,也充斥着幽默气息。美国的 AI 巨头卷能力卷白嫖套餐,中国的 AI 巨头在卷奶茶。反过来说,是不是资金买不到算力,只能去卷推广了呢。
之前有一种论调说,美国 ai 被电力限制,并将其中国 ai 被算力限制相比较,似乎双方都被卡住了。但是细究下来不难发现,电力行业是一个成熟的行业,没有太多技术壁垒,只要投资就可以补充产能,尽管可能耗费时间。而中国 ai 则是被芯片技术和 ai 芯片禁运卡住了脖子,暂时还看不到缩小差距的希望。
对于这场 ai 军备竞赛,我感到悲观。从模型来看,只有中国的 ai 模型可以跟上美国,但从算力来看,似乎已经没有国家能跟上美国了。之前老黄说过,中国 ai 产业在制裁和禁运下,会得到突飞猛进的发展,因此应该解除 ai 芯片禁运,达到倾销的效果。我希望老黄不是为了卖芯片夸大了中国的 ai 产业发展速度和潜力。
华为昇腾等国产 ai 芯片设计制造也在不断进步。然而,ai 芯片需要 7nm 的先进制程,但据说中国芯片产业链完全设备自主只能到 28nm,现有的先进制程是靠着之前进口的 duv 光刻机改良工艺实现的,面临良率和成本问题。既然如此,老黄说的这种突飞猛进的发展前景到底在哪里呢?我相信,ai 不是泡沫,而是撼动未来的技术。中国 ai 普遍开源,即使是出于商业策略选择,也是在造福全人类。现在看来,国内的 ai 大模型能力还能跟得上美国。在算力紧缺的情况下,这种追赶是否是可持续的?考虑到推理算力的缺乏,即使模型能力能跟得上,在商业上还能继续为继吗?
以下是我的一点小小的拙见,希望抛砖引玉,大家来批评指正
首先先叠甲,我没有任何要否认现在国内厂商面对算力不足的窘境的现状的意思,我认为看事情必须是辩证的,是要实事求是的
1. Transformer 的 O (n^2) 𝑂 ( 𝑛 2 ) 并非神谕
当下的美国的大洋彼岸硅谷的 AGI 叙事在 Frontier lab 里面已经变成了一个近乎宗教般的执着和假设上,那就是智能会涌现,大家相信 Scaling law 的能力,一开始是从 Pre-training 的 scaling,到后来的 RL-scaling,首先大家要知道一个事情,Pretraining 的训练数据其实是没有做那么严格的定向领域数据筛选的,你需要所有数据
Ilya: But there is another explanation. Back when people were doing pre-training, the question of what data to train on was answered, because that answer was everything. When you do pre-training, you need all the data. So you don’t have to think if it’s going to be this data or that data.
到了 RL scaling 的时代,OpenAI 和 Anthropic 这种 Frontier lab 不约而同的走向了一条很有默契的道路,翻看 OpenAI 和 Anthropic 的招聘会发现大量类似做 Synthetic RL 的岗位,无论是创建环境,还是做合成数据,还是做 Scaling
其实这已经是公开的秘密了,这些顶级实验室里没有大家想的那么多做底层算法研究的研究员,所以才有 Ilya 前不久说出的那句话
We’re moving from the age of scaling to the age of research
他们也认识到了单纯的 RL-scaling 不是万能的,而且可能快走到头了
引用 Karpathy 的一句话
Reinforcement learning is terrible. It just so happens that everything that we had before it is much worse because previously we were just imitating people, so it has all these issues.
所以大家其实都认识到了,因为我们现在的算法没办法高效的拟合提取正确的因果逻辑,所以我们期望把训练数据做的更多,质量更高,使用 CoT 来模拟推理, O (n^2)
2. 算力权力的消解
如果说 O (n^2)
DeepSeek 通过三个维度的算法重构,证明了硬件并非不可替代:
记忆的解耦(DeepSeek Engram):长期以来,大模型被迫将大量静态知识(Static Knowledge)存储在昂贵的 GPU 显存参数中。DeepSeek 在 Engram 中提出的架构,利用 N-gram 统计与 O (1)
计算的稀疏化 (DSA & DeepSeek V3.2):针对长文本推理的算力墙,DeepSeek V3.2 引入的 DSA (Deepseek Sparse Attention) 打破了全局扫描的迷信。通过动态索引机制,模型仅需计算极少数相关的 Token,将长序列的计算复杂度从 O (n^2)
通信的软重构(Dual-Pipe):面对物理带宽的封锁(如 NVLink 禁运),DeepSeek 的 Dual-Pipe 策略实现了计算与通信的完全重叠(Overlap)。这表明,算法调度的极致优化可以作为一种 “软性带宽”,在物理层面上尽量追赶硬件代差。
3. 稳定性的金融学:为什么资本死守 O (n^2)𝑂 ( 𝑛 2 ) ?
既然线性注意力(Linear Attention)或稀疏架构在理论上更高效,为何大洋彼岸直至 2026 年仍不敢大规模抛弃标准 Transformer?答案不在技术,而在金融风险控制。在动辄耗资数千万美元的单次训练中,“训练稳定性”(Training Stability)是比 “计算效率” 更昂贵的资产。 传统的线性模型(如 RNN/SSM)虽然运行极快,但极易在深层网络中出现梯度爆炸(Gradient Explosion),导致模型训练发散。对于背负着巨额融资压力的科技巨头而言,模型训练失败的沉没成本是不可接受的。因此,Transformer 的 O (n^2)
然而,这一避险逻辑已被 DeepSeek 的 mHC 击碎。该研究证明,通过将连接矩阵投影到 Birkhoff 多胞体(Birkhoff Polytope)流形上,并利用 Sinkhorn-Knopp 算法 进行归一化,我们可以在数学上强制保证深度网络的数值稳定性,而无需依赖笨重的架构冗余,改进了字节的 Hyper-Connection。这意味着,长期以来被视为 “算力护城河” 的东西,其实只是数学研究滞后带来的 “稳定性税”。
另外国内的大家都在往着线形注意力的方向努力,无论是Qwen3-Next,还是Kimi-Linear还是MiniCPM-SALA,大家都是好样的!
另一个纬度思考,算力的极大富裕,也造就了思想上的懒惰和路径依赖。
一旦数学上的约束条件被解开,资本对高冗余算力的依赖将瞬间失去理论支撑。建立在 “算力永远短缺” 预期上的金融估值体系,恐怕终将迎来清算的一天。
今天先写到这吧,如果佬们喜欢看,再考虑继续写一点,我也很久没公开发这么长篇大论的东西了,欢迎大家踊跃讨论,指正