新模型每次推出都标记知识库截至时间,随着时间的增长,理论上讲,LLM 的体积只增不减吗(降智的方式不算)
或者,出现颠覆 Transformer 架构的新理论出现,可能大幅压缩模型体检
新模型每次推出都标记知识库截至时间,随着时间的增长,理论上讲,LLM 的体积只增不减吗(降智的方式不算)
或者,出现颠覆 Transformer 架构的新理论出现,可能大幅压缩模型体检
1
RichardPlus 21h 37m ago
不懂炼丹,但是我觉得应该不会随着知识库增长而线性增长, 我觉得更像对数增长。模型可以提升智能而不涨世界知识。知识可以用其他手段来补。就像昨天的 DeepSeek V4 Flash 0731, 猛得一批, 但是它的知识量肯定比不上体量更大的模型
|
2
nevin47 21h 25m ago
有兴趣看看 Deepseek 之前发的 Engram 的论文
世界知识可能会膨胀,但是记忆和知识可以用更小的模型进行保存 而且最近 4v flash 发布,也从侧面说明,0.2T 的模型一样可以打赢 1.xT 的模型,有时候模型的知识能力边界到底在哪儿,这个哲学问题我感觉幻方一直是前列的 |
3
yidinghe PRO 训练大模型的方式是先定一个大小,然后选择往里面塞哪些知识。比如说,大模型都知道西游记,但不会知道每个章节段落的细节。
|
4
opengps 20h 50m ago
大是必然的,不过硬盘体积也在变小容量变大
|
5
hsir 20h 47m ago
理论上是这样的,因为如果未来知识增长、模型大小却保持不变,等于找到了世界的终极压缩奥秘,未来无限的事件都可以被预测出来。
|
6
EliteOtaku 17h 7m ago
@nevin47 我认为以后很可能会出现一个主脑+不同领域的专家模型的混合模式,这样才符合人类大脑,人类搞大工程,就是先搞个计划,然后找各个领域的专家负责不同的部分,最后组合起来,现在全部让一个大模型来搞,效率太低了。软件工程是因为需要编程为主,所以看起来好像是靠 coding 就可以解决任何事情,实际上,这个世界除了编程专家,还有其他各式各样的。如果大模型的体积膨胀到一定程度,那么效率下降是必然,意味着更高的能耗,事倍功半。一些特定领域的专家技能,应该变成垂直领域的 LLM,只有主脑认为需要的时候,才会去咨询。这样可以大大节约消耗。
|
7
ryd994 16h 34m ago via Android 我认为并不是线性增长。事实性的内容可以放到外部储存/搜索结果里。而原理性、可归纳总结的内容可以总结精简,少量理论就可以描述大量的规律。就像物理公式一样。
我觉得应该是对数增长或者更少。 |
8
coefu 14h 3m ago
|
9
coefu 14h 1m ago LLM 和人脑之间的进化差距,如同马车之于未来的宇宙飞船。
马车在工程结构上迭代 N 版,不从底层结构上搞出范式创新,依然只是 高级的马车。 |
10
EliteOtaku 13h 58m ago
@coefu 啊,原来你懂这么多啊,太佩服了,懂王
|
11
coefu 13h 48m ago
LLM 参数的量,最根本的矛盾在于 信息论里对于信息的压缩。
LLM 模型本身 静态参数架构的量 对于要体现的 智能 ,关系其实不大,与之影响最大的是 context kv cache 。为什么: 1 ,LLM 本身静态参数其实只需要存储 最精炼的逻辑能力即可,世界客观知识 完全可以压缩到 context kv cache ,只要 context kv cache 无限长度能够存在,就能压缩一切,那么整个模型的初始化参数量就是 O(n),常数级别。 2 ,以目前的硬件能力,context kv cache 显然做不到 无限长度,那么压缩 context kv cache 的算法就是关键,所以,你会看到 一皮条 这部分的工程创新和优化。 3 ,但是信息论里就决定了,有限的结构无法无损压缩还原无限的信息。只要压缩了,必定就有损失。信息熵增地不可逆决定的。 |
12
coefu 13h 46m ago
@EliteOtaku 跳梁小丑,能回复你一句,算给你长脸了。
|
13
EliteOtaku 13h 41m ago
@coefu 天才,真是天才啊
|
14
restkhz 12h 15m ago 不算相关专业,个人认为不可能会无限扩大。下面的几个说辞也只是臆测,论坛灌水,不太经得起推敲。
1. 人类知识有限。绝大多数知识其实只是已有知识的更进一步。其中关系才是玄妙的地方。如果说可以归纳法得出的知识其实体积可能并没多大。至于某厂 API 调用方式其实完全可以利用互联网检索或者 RAG ,增长速度有限。 2. 贵在推理方式和经验,这几乎就是智能本身。然而这种东西占用多少空间?我不知道。但是应该不会是线性增长的。 3. Qwen3.6 27B 仅有 27B 的参数量,智能接近 Nemotron 3 Ultra 550B A55B ,MiMo-V2.5 这个 310B ,A15B.(根据 artificialanalysis ) 4. Qwen3.6 27B 有如此智能不是没有代价的。它为了一个回答会进行大量的推理,以时间换空间。我曾经用过 Qwen3.5-9B 的模型,在某些,比如化学问题上一些刁钻的具体的化合物它完全没训练过,不知道是什么,但是只是根据一些规则就推理了出来。但是光推理就消耗了大量 tokens.令我惊讶的是,这个 9B 模型居然推理出了正确答案。者可以说明小 dense 或者 MoE 激活参数实际上增长不会快,未来多数场景完全够用。 5. 如果只是单纯说知识量,不如搞个搜索引擎,然后爬下/录入全人类的数据了。但是数据库没有智能。 我有一个暴论,在未来,随着算力和存储的提升,人们会在模型知识量和推理耗时,智能,以及他们的成本,用户场景体验中找到产品的平衡点。意味着实际上模型体积不会无限(至少不可能是线性)增大。未来大多数问题可能一个足够优秀的小模型+搜索/RAG 就能够解决。或者,可能会有缓慢增大(非线性增长)的 MoE+搜索/RAG,但是激活参数不会涨很快。 我认同 @ryd994 的观点。 |
15
Insolitude 11h 39m ago via Android
之前看过一个说法,llm 每一个的 token 所对应的 1024 ,2024 维高维空间,可以存储的信息远远超过常人的想象。
原因在于,语言学上的 llm 使用正交的矢量来作为各种相互独立的概念,比如“热的”,“东京”。那这是不是意味着,1024 维的 token 只能表示 1024 个概念组合的语义呢?并没有,一方面,我们发现即使两个“概念”再怎么不相关,总会有些微妙的连接,也就是我们可以容许正交的矢量稍微有一点夹角在 90°附近。另一方面,不在高维空间中,这种两两近似正交的矢量组的个数,正比于维度的指数次方 e^{N},对于 100 维的空间,我们可以表达近似 10000 个概念,对于 1024 维的空间,近似有 2×10 ^ 8 个独立概念。 现在的 llm token 的维度更多,虽然最后输出的 token 要包含前文所有的 token 的信息( 256k ,1m 上下文),但我们还远没有用完 token 所代表的高维语义空间。 |
16
nVoxel 11h 22m ago via Android
不是的,并不是关联关系越多,就越能准确,我记得数学上有类似现象说明的,并不是 1 把所有条件都统计进来就能结果更准的
|
17
brsyrockss 9h 16m ago
@EliteOtaku 你要对自己的能力有清楚的认知,还在这说要搞专家模式,多少突破性的成果都是跨领域实现的,我猜猜你学生时代数学学的不好吧,你解决问题的能力到现在还是仅仅集中在问题本身
|
18
oldlamp 9h 10m ago
@EliteOtaku 这位朋友,或许有的时候咱们遇到的人就像是黄石公一样,未必能让人觉得沟通起来很舒服,而且性格上可能也都很有个性,但往往这样的人,有可能是真正的罕见的高人。比如这位
@coefu 就是类似黄石公一样的厉害人物。他所说的那些内容,都是很中肯的,所作的比喻,也都非常透彻。 有时候承认自己有的地方可以从别人身上学到一些,并不是坏事。 情绪和面子之类的,应该退让给最本质的好奇心和求知欲。 您以为呢? |
19
coefu 6h 33m ago
@oldlamp 我虽然言语狂了点,但是态度是建立在每天都在学习提升的基础上;沉浸在整个机器学习领域的第八个年头了,从统计机器学习,到深度学习,强化学习,每个领域都摸了一个遍。基础数学公式的推导,以及前沿工程领域论文,都过了一遍的。
起码从自我反思的角度来说,学而不思则罔,思而不学则怠 的境界,虽然也陷入过,但是能自我清醒意识到并脱离。 这哥们儿自己基础薄弱,上来想当然就算了,态度还这么阴阳,我没理由惯着他。 老哥谬赞了,黄石公我肯定没那么高境界。同龄人里这个领域来说,我服 陈天奇,王树森,李沐 他们,但是这个论坛里没有能让我服的人。我也在做事,只是还没有出成果罢了。但是我做的,必然不是当前这些水准的事情。 |
21
EliteOtaku 1h 52m ago @oldlamp MoE 本来就是大家都知道的东西,DeepSeek 还有各个开源 LLM 的论文都已经说明了,我说的方式表述精确一些,就和前一阵 Hermes 整的 MoA 差不多,如果以后大家自己个人电脑里面跑的是更小体积的那些通用型 LLM,平时工作时可以完成基础逻辑推理,如果发现需要更加深入的某个垂直领域的知识,就可以自主联系这样的 LLM 的供应商进行咨询,以便完成工作,但目前这样的做法,局限于沟通效率,和 dense 没法比。不过以后基础建设或者通讯带宽延迟进一步优化,是否会出现新的范式?
如果他能拿出更新的理论,就可以在这里说说,至少让我们拜读一番 |