Chihaya0824

Chihaya0824

🏢  雑魚
V2EX member #432561, joined on 2019-07-28 21:24:43 +08:00
Today's activity rank 3185
Per Chihaya0824's settings, the topics list is only visible after you sign in
Deals info, including closed deals, is not hidden
Chihaya0824's recent replies
@Chihaya0824 游戏显卡少 2 倍的 tensor core 性能的 “游戏显卡的 2 倍的 tensor core 性能的” 打错了不好意思
@Gnnbb BF16 over TF32 accumulation 怀疑是有 5090 一样的游戏显卡的非解锁算力,总之就是很慢
pro 卡一般是和同 die 的游戏显卡少 2 倍的 tensor core 性能的
@yiranw09 是,没有 matmul 加速导致的,但是 m5 也并没有解决什么问题,目前只支持 fp16/bf16/int8 的加速,不恰当的例子你可以理解为他停留在 sm80(A100)时代
@yiranw09 不是,Mac 带宽可以的,我说的是 prompt processing 慢,就是你给他大量长文本的时候你要等很久才会开始吐字,以及并发使用的时候会很慢
还有别买 pro 6000D ,一买一个不吱声
别买 mac, PP 拉完了,同理由不推荐 dgx spark/AI max 395 ,除非是愿意等那其实 ok ( 395 问题更大,fp8 都不支持)
正经用就是最低 2 个 pro 6000 或者 4 个多人大 context
如果电够多也可以选择 8 个 5090 的方案也行

@vandort 靠谱,sm80 系列其实就是会有不支持 fp4 的问题,就是没办法跑原版(
Jul 30
Replied to a topic by aimuz DeepSeek DeepSeek 4 正式版是不是鸽了
@Yadomin 你是天才吗
@Maerd
试一下 https://docs.vllm.ai/en/stable/features/kv_offloading_usage/
我是觉得超过 256K 输出就没那么可用了,所以我一直都管理到 256k 以下(
如果实在是想要再多一点的话可以把 cuda graph 关掉,应该能更多一点
gguf 是这样的,有几点 op 可以试一下,算是在小显存里挣扎的一些经验
1.用 fp8 的 kv cache
2.尝试用 speculative decoding ,就是说你把 MTP 给打开,应该能够让 tps 变高挺多的,后续如果有 dflash 还可能可以提高更多
3.接受质量损失去用 awq 版,但是肯定不会比 fp8 好
都可以试一下,8 个 h20 肯定可以跑的,而且 kvcache 还可以做 tiering ,可以用内存 swap ,变相支持更多用户(一定程度上)
@murongxdb 你是否在找
https://arxiv.org/html/2605.15184v1
前几天才看见这个 paper
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5427 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 06:05 · PVG 14:05 · LAX 23:05 · JFK 02:05
♥ Do have faith in what you're doing.