想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程
想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程
1
owen800q 2 days ago via iPhone
5090
|
4
Muze 2 days ago
可以搜 技术犬,他们好像专门弄这个静音 AI 机箱,但是价格动不动就 50 到 80 万的,看预算吧,有机房的话,可以去找各大服务器厂家询价,例如惠普,戴尔之类的
|
5
someonesnone 2 days ago via Android
感觉得魔改大显存
|
6
gpt5 2 days ago
看抖音上有人用 5000 块钱 diy 的丐版硬件部署 dsv4flash ,可以跑到 100tps 以上。
|
7
Integ 2 days ago via iPhone
4 张 RTX pro 6000 就够了。
|
8
wu67 2 days ago
除非数据有超常规格的保密要求, 不然还不如买套餐...本地跑单是商用电费就够你们喝一壶了
|
9
malusama 2 days ago
感觉现在本地部署根本不划算。。
|
11
woscaizi 2 days ago 现在 Agent 工具的上下文很大的,会导致 prefill 阶段很耗时。如果是 20-40 人使用绝对不是 4 张 5090 ,6000 就能搞定的
|
13
ttwxdly 2 days ago
少说 10 张 5090 。还有内存啥的,一点都不划算。
|
14
hrapunzel 2 days ago
deepseek-v4-flash 高精度量化模型,两个 dgx spark 可以跑
|
15
woscaizi 2 days ago
部署 deepseek 、glm 、mimimax 之类效果好的开源模型用起来会很好,但不是低成本就能部署下来的。你可以调研下部署 deepseek-v4-flash 需要多少钱,它的部署需求基本是最低的。如果是部署 qwen3.6-35B 级别,需要的资源少,但是任务成功的概率低。
|
16
beefhotpot 2 days ago
deepseek-v4-flash ,2 张 rtx pro 6000 可以跑。
|
17
zsj1029 2 days ago
h20 141 两张就够了 ds flash 很强,一步到位不要扣扣嗖嗖最后什么也搞不好
|
18
dcatfly 2 days ago
如果你本身比较了解模型相关的概念,可以参考 https://apxml.com/zh/tools/vram-calculator
如果本身不了解,可以直接拿你的需求问 chatgpt ,再结合上面的做参考 |
20
woscaizi 2 days ago
可以跑是一回事,能真的用起来是一回事。况且是 20-40 人使用
|
21
Inn0Vat10n 2 days ago
你要先说预算, 几十万,几百万,几千万,体验是完全不同的
|
22
darksword21 PRO 肯定 rtx pro 6000
|
23
94 2 days ago
之前收集过一段时间信息,总结时就是 50 万起步最低档,而且只是低可用的状态。所以最后是找阿里谈商务,保密的部分合同上面写清楚就是了。
|
24
wwhc 2 days ago
1 到 2 张 RTX 6000 + Qwen3.6/3.8 27B + llama.cpp 应该够你们公司用了,不建议用 vLLM ,推理速度可能快些,但输出质量不如 llama.cpp
|
25
edw1n 2 days ago
当前最具性价比的方案就是 2 台 NVIDIA DGX Spark 来部署 deepseek-v4-flash 。价格可以控制在 8 万以内,基本可以满足 20 人同时使用的性能。
|
26
allinQQQ 2 days ago
2 台 NVIDIA DGX Spark 部署 deepseek-v4-flash
GB10 性能比较差,双机基本只能 1~4 个并发 |
27
yanest 2 days ago via Android
我们这边有数据中心用的 5090 货源,8 卡,五十多万,最近又涨了一点。不过性价比很高,他们说的 pro6000 十万多一张没有性价比,如果模型能用 5090 跑起来是当前最优解
|
28
yanest 2 days ago via Android
五十多是整机
|
29
molvqingtai 2 days ago
GPT luna 不是免费了吗
|
30
restkhz 2 days ago
取决于预算。
勉强能跑起来交差的,五位数不到,跑个 Qwen3.6-35B-A3B 还是够的,文档处理,简单编程能做。不过搞好了没几个人想用。 5 位数算力带宽都好点的可以考虑比如还有几个小时就要发布的 Qwen3.8-27B ,能用。跑 Dense 要注意带宽。 好用点的,能长期用的准备差不多 6 位数了。准备将近 200G 的显存吧。 我这有用 H100+vLLM ,4K 上下文并发几十也没毛病。不过跑 Agent 上下文到 100K+明显卡 prefilling 。仅供参考。 |
31
enihcam 2 days ago
4 台 NVIDIA DGX Spark
|
32
VeteranCat 2 days ago
需要的显存至少按照 250G+准备,模型 v4 flash 就够用了,目前这个阶段的话是这样的。
如果跑 Qwen,Qwen3.5-122B 也差不多了,不会说胡话,能跑代码,能跑文档。 |
33
shmilypeter 2 days ago
如果只是十个人以内用的话还好,其实一台 Mac Studio 或者说 4 张 5090 就可以。但如果你要五十个人的并发,而且还要高级模型的话,至少得准备百万级别的预算,而且还要配备机房和专门的维护人员。
|
35
sankeff 2 days ago 这个我是真部署了,4 张魔改 4090 48G 的卡;
DeepSeek-V4-Flash 几乎只能一个人用。 稍微流畅点儿的用的 Qwen3.6-35B-A3B |
36
hisunny 2 days ago
给你个参考,4 块 V100 32G ,NVLINK 一代总线,用 lmdploy 跑 Qwen3.6-35b-a3b ,单线程能到 140 tps 。跑 Qwen3.6-27b 稠密,单线程能到 100+ tps 。整机 DGX-1,8 个 V100 ,当年(差不多 10 年前)卖 100 万。
|
37
ssiitotoo 2 days ago
可以租算力,我们公司租了 A800 40G 8 卡 一年 14w
|
38
Mzs 2 days ago
正经 50 人用 平头哥芯片 16 卡私有化部署 glm5.2 400w 元 勉强能支撑
|
39
superkkk 2 days ago
5090 跑 27b 的 qwen dense 模型 nvfp4 量化,或者 2 卡 pro6000D 跑 deepseek v4 0731 nvfp4 的量化
|
40
tcper 2 days ago
用买硬件的钱充 codex 或者 claude ,用到公司倒闭都用不完
|
41
pkxutao 2 days ago 真有意思,这个帖子让我见识到,哪怕是程序员,也存在不认真看内容、只想按自己的想法回答的现象
|
42
wqhui 2 days ago
最近刚刷到别人计算了一下,除非高强度使用,不然本地部署比买贵几十倍,差不多 20 年回本
|
43
Lighfer 2 days ago 实际经验告诉你:4*5090 部署 Qwen3.6 27B NVFP4 够了,我们 vllm 部署并跑了两个月了。
我们部门 100 号人,实际在用这个模型的大概也就是三四十号人的规模,日常也就 4~6 个并发请求,缓存命中率最低 75%左右,有一段时间维持在 94%左右。 除了确实偶尔会卡顿一下(来了个大请求 prefill 占了资源),日常还是很流畅的,多数时候每个请求基本都能维持在 40~75 tok/s 。 当然,如果你们是要用来疯狂 vibe coding 那肯定就不行了,不过这个模型也达到可以随意 vibe coding 的能力。 放几条日志上来看看,不是瞎说(贴图太麻烦了直接贴文本): ``` (APIServer pid=1) INFO 08-14 07:32:44 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 6927.3 tokens/s, Avg generation throughput: 211.5 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.3%, Prefix cache hit rate: 75.5%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:32:44 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.77, Accepted throughput: 135.20 tokens/s, Drafted throughput: 152.80 tokens/s, Accepted: 1352 tokens, Drafted: 1528 tokens, Per-position acceptance rate: 0.931, 0.839, Avg Draft acceptance rate: 88.5% (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:32:54 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 3843.2 tokens/s, Avg generation throughput: 382.0 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:32:54 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.73, Accepted throughput: 241.65 tokens/s, Drafted throughput: 280.15 tokens/s, Accepted: 2417 tokens, Drafted: 2802 tokens, Per-position acceptance rate: 0.916, 0.809, Avg Draft acceptance rate: 86.3% (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:33:04 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 1300.6 tokens/s, Avg generation throughput: 332.5 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:33:04 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.75, Accepted throughput: 211.70 tokens/s, Drafted throughput: 242.61 tokens/s, Accepted: 2117 tokens, Drafted: 2426 tokens, Per-position acceptance rate: 0.913, 0.832, Avg Draft acceptance rate: 87.3% (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:33:14 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 4531.0 tokens/s, Avg generation throughput: 204.7 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.4%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:33:14 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.90, Accepted throughput: 134.06 tokens/s, Drafted throughput: 141.16 tokens/s, Accepted: 1341 tokens, Drafted: 1412 tokens, Per-position acceptance rate: 0.970, 0.929, Avg Draft acceptance rate: 95.0% (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:33:24 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 10786.8 tokens/s, Avg generation throughput: 173.7 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.6%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:33:24 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.83, Accepted throughput: 111.99 tokens/s, Drafted throughput: 122.59 tokens/s, Accepted: 1120 tokens, Drafted: 1226 tokens, Per-position acceptance rate: 0.949, 0.878, Avg Draft acceptance rate: 91.4% ``` |
45
pingpp00 2 days ago
可以看看懒猫微服,他们有一个算力仓 128GB 内存,性能不知道咋样,你可以问问
|
47
Zhepro 2 days ago
现在最便宜的应该是 170hx,单张卡 64g 显存六千多块钱
|
49
shelken 2 days ago via iPhone
我只给一个建议,别用任何 4bit 量化的模型,我体验了很多模型 4bit 量化之后跟 8bit 完全没法比
|
52
Mogugugugu 2 days ago
本地部署不太熟,但是可以给你推荐一个路子,找找本地的算力中心,一般都是大数据局牵头,联通/电信之类的承建的算力中心,可以让你独占式使用的,他们提供部署运维等甚至可以直接给你专线或 VPN 直接拉到公司,你要是有自建机房的话,他们也能提供国产 GPU+部署等,一些省份可以给你补贴 80%的费用,里面最大的问题就是基本都是国产卡,部署 deepseek v4 flash 是没啥问题的,上次问的是 pro 还在适配。
|
54
nrtEBH 2 days ago
保密需求找厂商做私有部署类似独享推理资源那种 除非是涉密单位完全禁止互联网访问 不然折腾本地 GPU 不如老老实实搞云端模型
基本云厂商都能满足普通的数据隔离需要的 |
55
jjx 1 day ago
本来也是自己部署觉得不靠谱
但是 ds flash 4 出来, 两台 dgx park (不到 7 万) 跑 60token 支持 5-6 个并发 觉得小团队还是可以用的 |
57
simo 1 day ago
这么多人用,先说下预算。 现在硬盘,内存,显卡都高点
|
58
realpg 1 day ago
deepseek v4 flash INT8 量化的 应该能编程 再往下的难了
这个需要 192G 显存 你就去市面上找显卡 单机凑齐 192G 显存就行了 能有 240G 更好 然后本机硬盘 u.2 的企业级 尽可能按接口插满 容量其实不那么重要 重要的是速度 多盘做池 RAM 512G 起步 768G 更好 |
59
firefox12 1 day ago
@Lighfer 如果我单机 有个 4090 或者 4080 自己一个人用 现实吗? 是不能用呢? 还是很卡 还是一个人可以用? 你 4×5090 我只需要支持一个人 可以吗?
|
60
fanhed 1 day ago
先确定想用什么模型, 然后根据并发数和上下文要求, 确定多大显存, 然后再根据要求的 prefill 和 decode 速度, 确定具体的显卡型号
|
61
slowgen PRO 如果 MiniMax M2.7 级别的模型能满足你,那么今天 Qwen3.8-27B 的能力就超越了 M2.7 ,还是多模态,你只需要 5090 就可以了,使用 SGLang 的方案在单个 5090 上,结合 NVFP4 和 DSpark ,解码速度达 206.1 tok/s https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B ,随着人数的增加来加卡就行。
如果你想要更好的模型能力,那么用 DeepSeek V4 Flash 0731 的 NVFP4 量化也行,RTX Pro 6000 现在涨价厉害可以退一步买 RTX Pro 6000D 这个被砍一刀的卡,2 张有点吃紧但是能跑,4 张就最好,我这里 4 张卡一天跑 20 亿 token 没问题,最大的问题就是这个成本对比买 API 哪一个划算,哪一个符合你们要求。 用多台 DGX-Spark 串联跑,也 ok ,https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark 最好使用 LMCache 来把 KV Cache 转移到内存,这样显存放模型,内存放 KV Cache ,速度也不会慢多少,显存容量的要求也降低,可以让更多的大上下文进来,工程上都是这么玩的。 结合好的 Agent 比如最近的 DeepSeek Harness ,缓存利用率大部分都是 95%~99%,对 prefill 速度友好。 |
63
roygong 1 day ago via iPhone
想用的爽最好上 8 卡 H20
|
64
lx0758 18h 5m ago
我司花了据说是 400W 搞了一套某为的平台,结果只能满足 30 个人左右使用,体感很慢。
|
65
shelken 5h 4m ago via iPhone
@Yserver 因为在我跟不同提供商的体验中发现了,8bit 原生和 4bit 量化差别就是很大,这也是为什么除非资源紧张否则一般各家官方都是提供 8bit 版本,4bit 会更高概率出现幻觉/指令跟随差的问题,实际生产的话真不建议
|