» 您尚未登录:请 登录 | 注册 | 标签 | 帮助 | 小黑屋 |


发新话题
打印

5090 32G这卡你觉得现在值多少钱?

posted by wap, platform: iPhone
想玩本地模型,瞄准Qwen3.6 27B FP8能跑256K就行了,花不了几个钱,不用盯着5090或者pro 6000。

4卡V100 16G就能入门,短上下文prefill 2000输出50 t/s,满上下文prefill 700输出20
4卡 2080ti魔改版,输出比V100快点,prefill不如v100。
有更高显存需求就上V100 32G,并发数能开多点

如果只是单并发 v100 16G就够了最便宜,想显存宽裕点就2080ti,处理不能上云的本地知识库够够的,生图生视频也能满足。并且V100已经有民间FA2,vllm,comfyui都可以适用,Z-image,WAN2.2也能并行生图,生视频。除了功耗高,略折腾外其他没毛病

以上方案PLX扩展卡是刚需,卡间必须要p2p连接不能过CPU,不然慢得你怀疑人生。2080ti需要折腾驱动,打个补丁。v100可选NVLINK,短上下文prefill能涨个几百,但不是刚需,满上下文区别不大

搞本地知识库用pi agent,上下文200K左右开压缩,但是要保留最后的20%上下文不压缩,效果一流。
编程可用claude code或自己高度定制的pi agent。
以上均为实际使用感受,最后我留了4卡V100 16G+NVLINK,日常高强度使用27B FP8来写文和做PPT

补一句,AI不是许愿机,本地模型也不差,但你要会用,丢一句“我要XXXX”就算Opus 或GPT也不会一轮回答就给你能用的产出

本帖最后由 xif7456 于 2026-6-3 23:45 通过手机版编辑


本帖最近评分记录
  • urtoys 激骚 +2 感谢分享 2026-6-4 09:49

TOP

posted by wap, platform: iPhone
再补一条,最近火热的MTP和KV量化会降智和降prefill速度,如果你是办公写文,做ppt,编程用不要开。
日常对话搜索可以开,用llama.cpp的话k可以开量化,v不要开,这样精度损失最小



TOP

发新话题