真诚友善团结专业,共建你我引以为荣之社区。《常见问题解答》
1 / 71
2月 12 日

由 TimmyOVO 发布于 12 小时前

哎呀本来今天想写这个的时候,昨晚上一直聊这个话题的时候,我也没有摆出量化数据
因为昨天我在床上躺着很累了,没有下床到电脑旁边做数据的量化分析
今天晚上有空了,坐下来认认真真的找了两小时的数据和做数据可视化分析准备发帖的时候,本来想引用昨天的帖子,但是很可惜,该贴已经被删掉了,那么在本帖我就重新系统性的整理一下我的观点,附带上一些分析

附带昨天那位佬友的原话

看到 GLM5 的套餐限制,综合近些日子的所思所想,与大家一同分享。

因为芯片制造设备制裁和芯片封锁,中国本就落后的芯片设计和制造业能提供的算力有限,中国和美国的算力差距越来越大。

训练算力直接关乎到模型能力,在相同条件下,拥有更多的训练算力可以尝试训练更多的模型,来选择出最优的那一个。推理算力则关乎到 ai 使用的价格,推理算力越多越廉价的情况下,ai 使用价格也会更便宜。

在算力差距下,国内 glm 的套餐仍然扣扣搜搜,但是 openai 的 codex,谷歌大善人之前的免费 apikey 和现在 antigravity 等都大肆挥霍 token,英伟达和 cerebras 还有 xai 的算力几乎点击就送

最近的元宝千问大战,也充斥着幽默气息。美国的 AI 巨头卷能力卷白嫖套餐,中国的 AI 巨头在卷奶茶。反过来说,是不是资金买不到算力,只能去卷推广了呢。

之前有一种论调说,美国 ai 被电力限制,并将其中国 ai 被算力限制相比较,似乎双方都被卡住了。但是细究下来不难发现,电力行业是一个成熟的行业,没有太多技术壁垒,只要投资就可以补充产能,尽管可能耗费时间。而中国 ai 则是被芯片技术和 ai 芯片禁运卡住了脖子,暂时还看不到缩小差距的希望。

对于这场 ai 军备竞赛,我感到悲观。从模型来看,只有中国的 ai 模型可以跟上美国,但从算力来看,似乎已经没有国家能跟上美国了。之前老黄说过,中国 ai 产业在制裁和禁运下,会得到突飞猛进的发展,因此应该解除 ai 芯片禁运,达到倾销的效果。我希望老黄不是为了卖芯片夸大了中国的 ai 产业发展速度和潜力。
华为昇腾等国产 ai 芯片设计制造也在不断进步。然而,ai 芯片需要 7nm 的先进制程,但据说中国芯片产业链完全设备自主只能到 28nm,现有的先进制程是靠着之前进口的 duv 光刻机改良工艺实现的,面临良率和成本问题。既然如此,老黄说的这种突飞猛进的发展前景到底在哪里呢?我相信,ai 不是泡沫,而是撼动未来的技术。中国 ai 普遍开源,即使是出于商业策略选择,也是在造福全人类。现在看来,国内的 ai 大模型能力还能跟得上美国。在算力紧缺的情况下,这种追赶是否是可持续的?考虑到推理算力的缺乏,即使模型能力能跟得上,在商业上还能继续为继吗?

以下是我的一点小小的拙见,希望抛砖引玉,大家来批评指正

首先先叠甲,我没有任何要否认现在国内厂商面对算力不足的窘境的现状的意思,我认为看事情必须是辩证的,是要实事求是的

1. Transformer 的 𝑂(𝑛2) 并非神谕

当下的美国的大洋彼岸硅谷的 AGI 叙事在 Frontier lab 里面已经变成了一个近乎宗教般的执着和假设上,那就是智能会涌现,大家相信 Scaling law 的能力,一开始是从 Pre-training 的 scaling,到后来的 RL-scaling,首先大家要知道一个事情,Pretraining 的训练数据其实是没有做那么严格的定向领域数据筛选的,你需要所有数据

Ilya: But there is another explanation. Back when people were doing pre-training, the question of what data to train on was answered, because that answer was everything. When you do pre-training, you need all the data. So you don’t have to think if it’s going to be this data or that data.

到了 RL scaling 的时代,OpenAI 和 Anthropic 这种 Frontier lab 不约而同的走向了一条很有默契的道路,翻看 OpenAI 和 Anthropic 的招聘会发现大量类似做 Synthetic RL 的岗位,无论是创建环境,还是做合成数据,还是做 Scaling



其实这已经是公开的秘密了,这些顶级实验室里没有大家想的那么多做底层算法研究的研究员,所以才有 Ilya 前不久说出的那句话

We’re moving from the age of scaling to the age of research

他们也认识到了单纯的 RL-scaling 不是万能的,而且可能快走到头了
引用 Karpathy 的一句话

Reinforcement learning is terrible. It just so happens that everything that we had before it is much worse because previously we were just imitating people, so it has all these issues.

所以大家其实都认识到了,因为我们现在的算法没办法高效的拟合提取正确的因果逻辑,所以我们期望把训练数据做的更多,质量更高,使用 CoT 来模拟推理,𝑂(𝑛2) 的复杂度成为了所有人身上沉重的枷锁,像大家前两天提的那个,50 米去走路还是开车去洗车店的问题,还有给妈妈吃安眠药的问题,那么多模型答错了,大家不觉得感叹吗?

2. 算力权力的消解

如果说 𝑂(𝑛2) 是悬在 AI 产业头上的达摩克利斯之剑,那么以 DeepSeek 为代表一些论文展现的的算法突围,则是对这把剑的直接折断。最新的技术实证表明,所谓的 “算力短缺” 本质上是 “算法懒惰” 造成的资源错配。
DeepSeek 通过三个维度的算法重构,证明了硬件并非不可替代:
记忆的解耦(DeepSeek Engram):长期以来,大模型被迫将大量静态知识(Static Knowledge)存储在昂贵的 GPU 显存参数中。DeepSeek 在 Engram 中提出的架构,利用 N-gram 统计与 𝑂(1) 复杂度的哈希查表(Hash Lookup),将 “记忆” 任务从昂贵的神经网络中剥离,转移至廉价的内存(RAM)中。这直接证伪了 “参数量即正义” 的扩容逻辑 —— 我们一直在用昂贵的显卡的算力去执行本该由硬盘完成的查表任务。虽然目前 MoE 的参数权重仍然占总参数的 80% 左右,但至少踏出了坚实的一步。

计算的稀疏化 (DSA & DeepSeek V3.2):针对长文本推理的算力墙,DeepSeek V3.2 引入的 DSA (Deepseek Sparse Attention) 打破了全局扫描的迷信。通过动态索引机制,模型仅需计算极少数相关的 Token,将长序列的计算复杂度从 𝑂(𝑛2) 压降至 𝑂(𝐿𝑘)。配合 MLA(多头潜在注意力)对 KV-Cache 的极致压缩,证明了很多 Decode 的算力消耗实际上是可以通过数学技巧消除的 “计算泡沫”。


通信的软重构(Dual-Pipe):面对物理带宽的封锁(如 NVLink 禁运),DeepSeek 的 Dual-Pipe 策略实现了计算与通信的完全重叠(Overlap)。这表明,算法调度的极致优化可以作为一种 “软性带宽”,在物理层面上尽量追赶硬件代差。

3. 稳定性的金融学:为什么资本死守 𝑂(𝑛2)

既然线性注意力(Linear Attention)或稀疏架构在理论上更高效,为何大洋彼岸直至 2026 年仍不敢大规模抛弃标准 Transformer?答案不在技术,而在金融风险控制。在动辄耗资数千万美元的单次训练中,“训练稳定性”(Training Stability)是比 “计算效率” 更昂贵的资产。 传统的线性模型(如 RNN/SSM)虽然运行极快,但极易在深层网络中出现梯度爆炸(Gradient Explosion),导致模型训练发散。对于背负着巨额融资压力的科技巨头而言,模型训练失败的沉没成本是不可接受的。因此,Transformer 的 𝑂(𝑛2) 冗余计算,实际上被资本视为一种 “稳定性保险”
然而,这一避险逻辑已被 DeepSeek 的 mHC 击碎。该研究证明,通过将连接矩阵投影到 Birkhoff 多胞体(Birkhoff Polytope)流形上,并利用 Sinkhorn-Knopp 算法 进行归一化,我们可以在数学上强制保证深度网络的数值稳定性,而无需依赖笨重的架构冗余,改进了字节的 Hyper-Connection。这意味着,长期以来被视为 “算力护城河” 的东西,其实只是数学研究滞后带来的 “稳定性税”。
另外国内的大家都在往着线形注意力的方向努力,无论是Qwen3-Next,还是Kimi-Linear还是MiniCPM-SALA,大家都是好样的!
另一个纬度思考,算力的极大富裕,也造就了思想上的懒惰和路径依赖。
一旦数学上的约束条件被解开,资本对高冗余算力的依赖将瞬间失去理论支撑。建立在 “算力永远短缺” 预期上的金融估值体系,恐怕终将迎来清算的一天。

今天先写到这吧,如果佬们喜欢看,再考虑继续写一点,我也很久没公开发这么长篇大论的东西了,欢迎大家踊跃讨论,指正

阅读时间 5 分钟

由 TimmyOVO 发布于 12 小时前

由 Eilgnaw 发布于 12 小时前

由 Cora_Tracy 发布于 12 小时前

由 wawu 发布于 12 小时前

所以是太富裕了导致的懒惰

就好像龟兔赛跑,兔子睡迷糊了

由 Sam_Xu 发布于 12 小时前

由 zzzyyao 发布于 12 小时前

感觉佬研究的很深入。我只能从使用的角度出发,非常期望国内的硬件水平有相当的进步,至少能满足国内的AI需求

由 TimmyOVO 发布于 12 小时前

由 super_carlos 发布于 12 小时前

由 kise_tyxml 发布于 12 小时前

技术乐观主义很好,虽然说资本路径依赖,但是如果能吃下更大的盘子也是真愿意投资,OpenAI、Anthropic的研究深度,推理侧优化说不上懒惰,目前AI发展太过热了,显得全都在大力出奇迹,但是太低估硅谷,认为只是在懒惰无脑的循环复制还是稍微有点傲慢了。

中国人不差,很多顶尖AI团队也有相当比例的华人群体,ds其实是资源匮乏不得不另辟蹊径,老美顶尖的第一梯队毋庸置疑,ds的震撼是更小的成本更好的效果,但是美国的热钱太多了,一大半的经济增长都是靠AI极其相关行业推动的,这也是隐患。

为什么说隐患,资本烧钱是有目的性的,投资可以,烧钱可以,但是不能永远只是在烧钱阶段,所以我反而觉得决胜点在于落地上,不可能长期烧钱,无论是走顶尖模型付费变现,还是中低端结合工业强化工业制造,终究是要落地实践,如果AI只停留在让普通用户做个软件、跑个图自娱自乐,而完成不了承载这种规模投资的利润,盛极而衰只是时间问题。

由 Josoen309 发布于 12 小时前

由 TimmyOVO 发布于 12 小时前

我觉得你有点傲慢了,不是没人做这样的研究那边,是做这样的研究的人,没足够资源和话语权一展拳脚。成为新的Frontier lab.
我补充一句,想法大家都很多,我们也有很多,对面也有很多,这都是事实,但问题是实践的门槛很高,综上所述的金融闭环在阻止对面的这样的人发展成为新的破局者。

那这个前提是谁能够把故事讲的更好听,现阶段美国讲故事的能力远好于我们。这是事实

由 lylinuxdo2 发布于 12 小时前

由 TimmyOVO 发布于 12 小时前

嗯,是的,各种dimension的RL scaling,谁造环境和合成数据快又狠,覆盖的又多又全,现阶段拿出来的模型能力确实就更强,这是不争的事实,但是大家都在猜,你说这个路还能走多远呢,不知道其实。

由 markcxx 发布于 12 小时前

由 kise_tyxml 发布于 12 小时前

目前其实很多方向都在是赌,美国内部做空,唱衰AI泡沫也有不少人。资本市场下可以你新方向发展,但是你得定期出成果,很卷,但是如果找不出新路,都不是技术问题了,资本恐慌性撤离就足够重创整个行业了。
你的想法还是鼓励学术研究向慢慢花长时间找更好的新道路,但是烧钱逻辑就是大力出奇迹,堆算力堆人才堆出一个好效果,为什么说赌,因为谁也不知道AGI能不能成,以何种方式成,就像2000年互联网泡沫之后又以新的方式卷土重来跟其他行业绑死在一起经久不衰一样。
我的态度很简单,一个方向是对是错有时候很难评,LLM本质就是预测下一个字,一开始谁也不相信这种产物有什么价值,你的思路是美国的方向是必然错误的,但我的态度没有你那么乐观,我认为大力出奇迹和用更加精巧的算法设计更少的训练样本更少的训练成本达到效果是两条路线,就像计算机的设计很精巧,但是底层的位运算是极其简陋的,甚至这类设备架构一直很稳定,几十年来大部分都是在硬堆参数或者整外观摄像头这些配件。
我对中国AI很乐观,但是没有你那么乐观,我认为科学前沿路线具备某种神秘性,即使路线是歪的比如AI把人创作性活动给先威胁了,但是不影响发展竞争。

由 TimmyOVO 发布于 12 小时前

另外我觉得我补充点观点,我觉得只要他们这个泡沫破裂,挺过去,他们的真正的竞争力,会比现在强得多,前提是挺得过去泡沫破裂的幻灭期。
我还是想强调,我认为的是他们在泡沫期,不至于因为算力多把我们甩的尾灯都看不见,这一点是大可放心的。

由 TimmyOVO 发布于 11 小时前

错误的,我从头到尾没说过这句话,我只认为他们被金融空转锁住了创新能力,不是路线错了,是船大难掉头。

由 kise_tyxml 发布于 11 小时前

现在美国市场泡沫是极其严重了,我记得去年50%以上的经济增长全靠AI极其行业,但是目前就是在拿时间赌,中国开源是第一梯队,月之暗影也不差,中国一直不差,只是顶尖目前还有出现一款产品霸榜,落后,但是没有落后到无法追赶。
L站是前沿太多了,显得中国AI垃圾,但是AI在中国发展其实速度很快了。

由 xpxp 发布于 11 小时前

我和你引用的老哥想法很类似,我也是担心算力不足,难以均衡收益和研发。
不过看佬分析的这么专业,学到了很多 :clap:

由 TimmyOVO 发布于 11 小时前

我不觉得我表达了对国内很乐观的观点,我认为只是,恐怕,美国人很难甩开我们。仅凭泡沫期的算力优势的话,这是我的核心观点。目前证据无法支撑后续判断,所以谁赢谁输,我无法下判断,但只凭着算力,恐怕不行。

由 huanlin 发布于 11 小时前

由 kise_tyxml 发布于 11 小时前

由 TimmyOVO 发布于 11 小时前

由 diudiuD 发布于 11 小时前

由 TimmyOVO 发布于 11 小时前

由 huanlin 发布于 11 小时前

由 TimmyOVO 发布于 11 小时前

由 liunian 发布于 11 小时前

由 Az0809 发布于 11 小时前

由 huanlin 发布于 11 小时前

由 ethics 发布于 11 小时前

由 zy_d 发布于 11 小时前

由 TimmyOVO 发布于 11 小时前

由 shiquda 发布于 11 小时前

由 TimmyOVO 发布于 11 小时前

由 www-data 发布于 11 小时前

由 TimmyOVO 发布于 11 小时前

由 www-data 发布于 11 小时前

由 carlpayne 发布于 11 小时前

加载下方更多的帖子