• 请不要在回答技术问题时复制粘贴 AI 生成的内容
ashong
V2EX  ›  程序员

编程效果对比 本地 Qwen3.8-27B vs Deepseek

  •  
  •   ashong · 7h 12m ago · 1529 views

    提示词

    需要一个 svg 动画页面, 内容为一只鹈鹕骑自行车。要求:
    - 鹈鹕生动形象
    - 关节运动要自然、不生硬
    

    除了 Deepseek 网页版,其他都是用 Deepseek Harness.

    Qwen 模型均来自 unsloth

    模型 缓存量化(ctk:ctv) 耗时 轮数 平均输出速度 t/s 缓存命中率% 总输入 总输出 预览 费用(元)
    Deepseek 网页 - 12 分 32 秒 2 - - - - https://dspage.previewship.net/ 0
    Deepseek Flash - 38 分 27 秒 1 123 99 11.9M 266K https://dsflash.previewship.net/ 1.93
    Qwen3.8 27B Q5_K_M q8_0:q4_0 5 分 52 秒 1 77 98 95.5K 26.5K https://q5kmq8q4.previewship.net/ 0.02
    Qwen3.8 27B Q5_K_M q8_0:q8_0 23 分 20 秒 1 69 98 818K 111K https://q5kmq8q8.previewship.net/ 0.09
    Qwen3.8 27B Q4_K_M q8_0:q8_0 16 分 13 秒 1 63 94 631K 67.7K https://q4kmq8q8.previewship.net/ 0.06
    Qwe3.8 27B UD_Q4_K_XL q8_0:q8_0 16 分 59 秒 1 58 94 131K 57.8K https://udq4kxlq8q8.previewship.net/ 0.06

    电费按 0.5 元/度计算

    提示词语义比较模糊, 所以思考时长会多一些

    本地环境

    硬件:7900xtx

    系统:ubuntu 26.04

    软件: llama.cpp + vulkan

    更喜欢哪一个结果?

    22 replies    2026-08-21 21:30:24 +08:00
    woodfizky
        1
    woodfizky  
       6h 59m ago
    dsflash 怎么是倒着蹬啊(恼
    而且自作主张给你加了倍速调节。。
    towser
        2
    towser  
       6h 57m ago
    看起来 27b 运行的还可以,超过我的预期
    ashong
        3
    ashong  
    OP
       6h 56m ago
    @woodfizky 迷惑啊, 等谷期再用 Pro 版试一下
    sentinelK
        4
    sentinelK  
       6h 53m ago
    这种纯视觉效果的 deepseek 吃了没视觉能力的亏,没法重复验证。
    我的实际运行体验,确实 qwen3.8-27B 至少是能生产的。只是 256k 上下文稍短。

    如果不是要跑 Minimax H3 总是倒腾显存,我就让 sglang+27B-fp8 常驻显存了
    1258
        5
    1258  
       6h 52m ago
    flash 想的太多了吧
    ashong
        6
    ashong  
    OP
       6h 51m ago
    @towser 能力可以,配合 dsh 比 opencode 效果好一些
    yagamil
        7
    yagamil  
       6h 50m ago
    运行起来 A 卡和 N 卡去吧大吗?
    是不是只要显存大就行了?
    ashong
        8
    ashong  
    OP
       6h 47m ago
    @sentinelK 模型不支持,harness 自动下载安装了 pillow 截图,对比像素,其实之所以用了这么长时间就是验证耗时太长, 实际生成也就 10 分钟, 后续的验证修改了个寂寞
    ashong
        9
    ashong  
    OP
       6h 46m ago
    @yagamil 没 N 卡, 只有一张 7900xtx , 显存肯定越大越好
    sentinelK
        10
    sentinelK  
       6h 44m ago
    @ashong 有种说法是说,多模态模型对于视觉的理解,和第三方理解并文字化后输入,理解程度是指数级别的差距,但是不太懂这块,所以不敢下结论。

    我的体感上确实多模态模型对于图片的认知会更好。比如我用 qwen3.8-27B 去给 H3 理解图片素材并喂提示词,效果远强于纯文本模型。
    sentinelK
        11
    sentinelK  
       6h 40m ago
    @yagamil 可以参照我的经验帖: https://www.0.51bbc.workers.dev/t/1235518
    wjxd
        12
    wjxd  
       5h 6m ago
    @ashong 我的是 7900xt ,昨天也试了这个 qwen3.8 ud q4 k m 的版本,你是用什么加载模型?是 window 环境还是 linux 环境啊?
    wjxd
        13
    wjxd  
       5h 5m ago
    @ashong 忽略。我没仔细看帖子最后。。。
    Seanfuck
        14
    Seanfuck  
       4h 14m ago
    最后一个好。Qwen 明显比 Deepseek 强。
    honjow
        15
    honjow  
       3h 23m ago
    同 7900xtx 。op 感觉用哪个量化最均衡啊
    coefu
        16
    coefu  
       3h 16m ago
    鹈鹕很 Q 。
    xuhengjs
        17
    xuhengjs  
       1h 57m ago
    要不,用 deepseek 最新的 flash-vision-exp 试试?
    ashong
        18
    ashong  
    OP
       1h 38m ago
    @honjow Q5_K_M
    jhytxy
        19
    jhytxy  
       1h 32m ago
    建议量化模型至少还是用到 q6

    q5 离原版差的比较远
    honjow
        20
    honjow  
       55 mins ago
    @ashong #18 上下文能开多少啊。我试了很多次都达不到 77tps 这个速度
    ByteZone
        21
    ByteZone  
       44 mins ago
    48GB 的 mac mini 跑 QWen 3.6 27B 做 rag 慢的要是
    硅基流动一到两分钟 本地 ollama 要 10 到 60 分钟不等
    大佬知道问题出在哪里了吗
    ashong
        22
    ashong  
    OP
       37 mins ago
    @honjow

    启动参数供参考:

    -t 10
    -b 512
    -ub 256
    --spec-draft-n-max 3
    --fit off
    --no-context-shift
    --metrics
    --kv-unified
    --jinja
    --cache-type-k q8_0
    --cache-type-v q8_0
    -fa on
    --spec-type draft-mtp
    --ctx-size 131072
    --parallel 1
    -ngl -1
    --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
    --no-mmap
    --temp 0.6
    --top-p 0.6
    --top-k 15
    --repeat-penalty 1
    --repeat-last-n 64
    --override-tensor blk\.\d+\.ffn_.*_exps\.=CPU
    --image-min-tokens 1024
    --no-warmup -
    -cache-ram 16384
    --alias qwen3.8-27b-q5km
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2832 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 53ms · UTC 14:07 · PVG 22:07 · LAX 07:07 · JFK 10:07
    ♥ Do have faith in what you're doing.