jacketma
V2EX  ›  Local LLM

随着知识库的增长, LLM 理论上体积是不是只会越来越大?

  •  
  •   jacketma · 22h 32m ago · 2933 views

    新模型每次推出都标记知识库截至时间,随着时间的增长,理论上讲,LLM 的体积只增不减吗(降智的方式不算)

    或者,出现颠覆 Transformer 架构的新理论出现,可能大幅压缩模型体检

    21 replies    2026-08-02 18:27:59 +08:00
    RichardPlus
        1
    RichardPlus  
       21h 37m ago
    不懂炼丹,但是我觉得应该不会随着知识库增长而线性增长, 我觉得更像对数增长。模型可以提升智能而不涨世界知识。知识可以用其他手段来补。就像昨天的 DeepSeek V4 Flash 0731, 猛得一批, 但是它的知识量肯定比不上体量更大的模型
    nevin47
        2
    nevin47  
       21h 25m ago
    有兴趣看看 Deepseek 之前发的 Engram 的论文

    世界知识可能会膨胀,但是记忆和知识可以用更小的模型进行保存

    而且最近 4v flash 发布,也从侧面说明,0.2T 的模型一样可以打赢 1.xT 的模型,有时候模型的知识能力边界到底在哪儿,这个哲学问题我感觉幻方一直是前列的
    yidinghe
        3
    yidinghe  
    PRO
       21h 20m ago
    训练大模型的方式是先定一个大小,然后选择往里面塞哪些知识。比如说,大模型都知道西游记,但不会知道每个章节段落的细节。
    opengps
        4
    opengps  
       20h 50m ago
    大是必然的,不过硬盘体积也在变小容量变大
    hsir
        5
    hsir  
       20h 47m ago
    理论上是这样的,因为如果未来知识增长、模型大小却保持不变,等于找到了世界的终极压缩奥秘,未来无限的事件都可以被预测出来。
    EliteOtaku
        6
    EliteOtaku  
       17h 7m ago
    @nevin47 我认为以后很可能会出现一个主脑+不同领域的专家模型的混合模式,这样才符合人类大脑,人类搞大工程,就是先搞个计划,然后找各个领域的专家负责不同的部分,最后组合起来,现在全部让一个大模型来搞,效率太低了。软件工程是因为需要编程为主,所以看起来好像是靠 coding 就可以解决任何事情,实际上,这个世界除了编程专家,还有其他各式各样的。如果大模型的体积膨胀到一定程度,那么效率下降是必然,意味着更高的能耗,事倍功半。一些特定领域的专家技能,应该变成垂直领域的 LLM,只有主脑认为需要的时候,才会去咨询。这样可以大大节约消耗。
    ryd994
        7
    ryd994  
       16h 34m ago via Android   ❤️ 2
    我认为并不是线性增长。事实性的内容可以放到外部储存/搜索结果里。而原理性、可归纳总结的内容可以总结精简,少量理论就可以描述大量的规律。就像物理公式一样。
    我觉得应该是对数增长或者更少。
    coefu
        8
    coefu  
       14h 3m ago
    @EliteOtaku 那么现在的 MOE 架构是什么呢?

    思而不学则怠。
    coefu
        9
    coefu  
       14h 1m ago   ❤️ 1
    LLM 和人脑之间的进化差距,如同马车之于未来的宇宙飞船。


    马车在工程结构上迭代 N 版,不从底层结构上搞出范式创新,依然只是 高级的马车。
    EliteOtaku
        10
    EliteOtaku  
       13h 58m ago
    @coefu 啊,原来你懂这么多啊,太佩服了,懂王
    coefu
        11
    coefu  
       13h 48m ago
    LLM 参数的量,最根本的矛盾在于 信息论里对于信息的压缩。

    LLM 模型本身 静态参数架构的量 对于要体现的 智能 ,关系其实不大,与之影响最大的是 context kv cache 。为什么:
    1 ,LLM 本身静态参数其实只需要存储 最精炼的逻辑能力即可,世界客观知识 完全可以压缩到 context kv cache ,只要 context kv cache 无限长度能够存在,就能压缩一切,那么整个模型的初始化参数量就是 O(n),常数级别。

    2 ,以目前的硬件能力,context kv cache 显然做不到 无限长度,那么压缩 context kv cache 的算法就是关键,所以,你会看到 一皮条 这部分的工程创新和优化。

    3 ,但是信息论里就决定了,有限的结构无法无损压缩还原无限的信息。只要压缩了,必定就有损失。信息熵增地不可逆决定的。
    coefu
        12
    coefu  
       13h 46m ago
    @EliteOtaku 跳梁小丑,能回复你一句,算给你长脸了。
    EliteOtaku
        13
    EliteOtaku  
       13h 41m ago
    @coefu 天才,真是天才啊
    restkhz
        14
    restkhz  
       12h 15m ago   ❤️ 1
    不算相关专业,个人认为不可能会无限扩大。下面的几个说辞也只是臆测,论坛灌水,不太经得起推敲。

    1. 人类知识有限。绝大多数知识其实只是已有知识的更进一步。其中关系才是玄妙的地方。如果说可以归纳法得出的知识其实体积可能并没多大。至于某厂 API 调用方式其实完全可以利用互联网检索或者 RAG ,增长速度有限。
    2. 贵在推理方式和经验,这几乎就是智能本身。然而这种东西占用多少空间?我不知道。但是应该不会是线性增长的。
    3. Qwen3.6 27B 仅有 27B 的参数量,智能接近 Nemotron 3 Ultra 550B A55B ,MiMo-V2.5 这个 310B ,A15B.(根据 artificialanalysis )
    4. Qwen3.6 27B 有如此智能不是没有代价的。它为了一个回答会进行大量的推理,以时间换空间。我曾经用过 Qwen3.5-9B 的模型,在某些,比如化学问题上一些刁钻的具体的化合物它完全没训练过,不知道是什么,但是只是根据一些规则就推理了出来。但是光推理就消耗了大量 tokens.令我惊讶的是,这个 9B 模型居然推理出了正确答案。者可以说明小 dense 或者 MoE 激活参数实际上增长不会快,未来多数场景完全够用。
    5. 如果只是单纯说知识量,不如搞个搜索引擎,然后爬下/录入全人类的数据了。但是数据库没有智能。

    我有一个暴论,在未来,随着算力和存储的提升,人们会在模型知识量和推理耗时,智能,以及他们的成本,用户场景体验中找到产品的平衡点。意味着实际上模型体积不会无限(至少不可能是线性)增大。未来大多数问题可能一个足够优秀的小模型+搜索/RAG 就能够解决。或者,可能会有缓慢增大(非线性增长)的 MoE+搜索/RAG,但是激活参数不会涨很快。

    我认同 @ryd994 的观点。
    Insolitude
        15
    Insolitude  
       11h 39m ago via Android
    之前看过一个说法,llm 每一个的 token 所对应的 1024 ,2024 维高维空间,可以存储的信息远远超过常人的想象。

    原因在于,语言学上的 llm 使用正交的矢量来作为各种相互独立的概念,比如“热的”,“东京”。那这是不是意味着,1024 维的 token 只能表示 1024 个概念组合的语义呢?并没有,一方面,我们发现即使两个“概念”再怎么不相关,总会有些微妙的连接,也就是我们可以容许正交的矢量稍微有一点夹角在 90°附近。另一方面,不在高维空间中,这种两两近似正交的矢量组的个数,正比于维度的指数次方 e^{N},对于 100 维的空间,我们可以表达近似 10000 个概念,对于 1024 维的空间,近似有 2×10 ^ 8 个独立概念。

    现在的 llm token 的维度更多,虽然最后输出的 token 要包含前文所有的 token 的信息( 256k ,1m 上下文),但我们还远没有用完 token 所代表的高维语义空间。
    nVoxel
        16
    nVoxel  
       11h 22m ago via Android
    不是的,并不是关联关系越多,就越能准确,我记得数学上有类似现象说明的,并不是 1 把所有条件都统计进来就能结果更准的
    brsyrockss
        17
    brsyrockss  
       9h 16m ago
    @EliteOtaku 你要对自己的能力有清楚的认知,还在这说要搞专家模式,多少突破性的成果都是跨领域实现的,我猜猜你学生时代数学学的不好吧,你解决问题的能力到现在还是仅仅集中在问题本身
    oldlamp
        18
    oldlamp  
       9h 10m ago
    @EliteOtaku 这位朋友,或许有的时候咱们遇到的人就像是黄石公一样,未必能让人觉得沟通起来很舒服,而且性格上可能也都很有个性,但往往这样的人,有可能是真正的罕见的高人。比如这位
    @coefu 就是类似黄石公一样的厉害人物。他所说的那些内容,都是很中肯的,所作的比喻,也都非常透彻。

    有时候承认自己有的地方可以从别人身上学到一些,并不是坏事。

    情绪和面子之类的,应该退让给最本质的好奇心和求知欲。

    您以为呢?
    coefu
        19
    coefu  
       6h 33m ago
    @oldlamp 我虽然言语狂了点,但是态度是建立在每天都在学习提升的基础上;沉浸在整个机器学习领域的第八个年头了,从统计机器学习,到深度学习,强化学习,每个领域都摸了一个遍。基础数学公式的推导,以及前沿工程领域论文,都过了一遍的。

    起码从自我反思的角度来说,学而不思则罔,思而不学则怠 的境界,虽然也陷入过,但是能自我清醒意识到并脱离。

    这哥们儿自己基础薄弱,上来想当然就算了,态度还这么阴阳,我没理由惯着他。

    老哥谬赞了,黄石公我肯定没那么高境界。同龄人里这个领域来说,我服 陈天奇,王树森,李沐 他们,但是这个论坛里没有能让我服的人。我也在做事,只是还没有出成果罢了。但是我做的,必然不是当前这些水准的事情。
    oldlamp
        20
    oldlamp  
       5h 18m ago
    @coefu

    老哥您谦虚了,功力深厚,还不吝赐教,实在是楷模人物。
    其实 DS 的黄总等一众江湖上的人物也在本论坛,相关领域也是有很深的修为。
    EliteOtaku
        21
    EliteOtaku  
       1h 52m ago   ❤️ 1
    @oldlamp MoE 本来就是大家都知道的东西,DeepSeek 还有各个开源 LLM 的论文都已经说明了,我说的方式表述精确一些,就和前一阵 Hermes 整的 MoA 差不多,如果以后大家自己个人电脑里面跑的是更小体积的那些通用型 LLM,平时工作时可以完成基础逻辑推理,如果发现需要更加深入的某个垂直领域的知识,就可以自主联系这样的 LLM 的供应商进行咨询,以便完成工作,但目前这样的做法,局限于沟通效率,和 dense 没法比。不过以后基础建设或者通讯带宽延迟进一步优化,是否会出现新的范式?

    如果他能拿出更新的理论,就可以在这里说说,至少让我们拜读一番
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2764 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 48ms · UTC 12:19 · PVG 20:19 · LAX 05:19 · JFK 08:19
    ♥ Do have faith in what you're doing.