foryou2023
V2EX  ›  问与答

如果 2 - 3 万人民币设备,部署本地 dsv4flash , token 基本够用,你是会选择本地部署还是接云 api?

  •  
  •   foryou2023 · 20h 38m ago · 2909 views

    The current q2 results use ds4-bench with the standard Promessi sposi input, 2048-token context steps, and 128 greedy generation tokens at every frontier. Each prefill number is for the next 2048-token chunk. The complete sweeps are in m5_max.csv and gb10.csv.

    Machine Backend Context Prefill Generation
    MacBook Pro M5 Max, 128 GB Metal 2048 790.18 t/s 39.35 t/s
    MacBook Pro M5 Max, 128 GB Metal 16384 572.53 t/s 36.14 t/s
    MacBook Pro M5 Max, 128 GB Metal 32768 557.04 t/s 34.36 t/s
    MacBook Pro M5 Max, 128 GB Metal 65536 398.50 t/s 27.64 t/s
    DGX Spark GB10, 128 GB CUDA 2048 825.76 t/s 18.05 t/s
    DGX Spark GB10, 128 GB CUDA 16384 872.44 t/s 15.10 t/s
    DGX Spark GB10, 128 GB CUDA 32768 855.94 t/s 14.43 t/s
    DGX Spark GB10, 128 GB CUDA 65536 822.98 t/s 13.84 t/s

    Older measurements for machines and model variants not rerun in this pass are kept for reference. They used the earlier CLI prompt procedure and are not directly comparable with the table above.

    Machine Quant Prompt Prefill Generation
    MacBook Pro M3 Max, 128 GB q2 short 58.52 t/s 26.68 t/s
    MacBook Pro M3 Max, 128 GB q2 11709 tokens 250.11 t/s 21.47 t/s
    Mac Studio M3 Ultra, 512 GB q2 short 84.43 t/s 36.86 t/s
    Mac Studio M3 Ultra, 512 GB q2 11709 tokens 468.03 t/s 27.39 t/s
    Mac Studio M3 Ultra, 512 GB q4 short 78.95 t/s 35.50 t/s
    Mac Studio M3 Ultra, 512 GB q4 12018 tokens 448.82 t/s 26.62 t/s
    Mac Studio M3 Ultra, 512 GB PRO q2 32768 tokens 138.82 t/s 9.56 t/s

    以上是看 https://github.com/antirez/ds4 这个仓库的数据。

    最近 dsv4 涨价太猛了,所以尝试找找本地部署的方案,找到这个方案,由于手里也没有设备同时也不太懂这个 速度的问题,也无法测试具体的实践效果如何,不知道有相关设备的朋友,能不能帮忙看看或者测试一下。

    目前看了咸鱼 M3 MAX 128G 的大概 2.5 万左右,感觉按照 dsv4 flash 的价格的话可以接受本地部署了。M5 MAX 苹果官网看了一下要 5 万多,暂时没有这么多预算。

    Supplement 1  ·  20h 3m ago
    看了大家的大部分人的回复,本地部署暂时不考虑,只能继续上云 api 了。
    29 replies    2026-08-24 23:22:42 +08:00
    donaldturinglee
        1
    donaldturinglee  
       20h 32m ago via iPhone
    2.5 万部署的能用在工作吗?生产环境还是直接上 API 吧
    cvooc
        2
    cvooc  
       20h 29m ago
    现在迭代这么快, 本地部署 每秒几十 token 只能个人同一时间跑单任务用, 除非极度缺乏安全感,
    真不如 api 跑批量来的爽.
    FakerLeung
        3
    FakerLeung  
       20h 15m ago
    我看双 DGX 好像能干到 4 人同时 50t/s ?还是 FP8 的精度?
    xing7673
        4
    xing7673  
       20h 9m ago
    你这又是 q2 又是几十 k 的上下文,部署起来也基本没啥用
    darksword21
        5
    darksword21  
       20h 6m ago
    没有意义,发这种 bench 的人也是闲的
    crocoBaby
        6
    crocoBaby  
       20h 5m ago
    很多人早算过这笔帐,肯定是云 api 划算的
    op351
        7
    op351  
       19h 59m ago
    现阶段肯定是直接买云服务商的算力
    云服务商都还在算力设备采购难,到货周期长,回本周期长的阶段,就不用想本地部署省钱这码事了
    现在本地部署的好处就一个 安全合规
    不存在本地部署吊打云服务商的算力和质量还能省钱的
    ff521
        8
    ff521  
       19h 50m ago
    hx170 这个破解的显卡有人玩过吗
    rming
        9
    rming  
       19h 47m ago
    如非必要 勿增实体
    xylitolLin
        10
    xylitolLin  
       19h 43m ago
    如果 2~3 万能部署到官方 api 的能力(能打个 8 折也可以)。官方也不至于涨价这么多吧
    longaiwp
        11
    longaiwp  
       19h 41m ago
    这还用算吗?就现在这个硬件成本,买 API 必然更划算。
    imdoge
        12
    imdoge  
       18h 51m ago
    不是满血版,还 40token/s ,一个人用都嫌慢还不是满血
    zisen
        13
    zisen  
       18h 49m ago
    如果考虑硬件涨价的背景,可以买来玩玩,记得在暴跌之前出手就行
    sillydaddy
        14
    sillydaddy  
       18h 45m ago
    DeepSeek 自部署可以 1 年左右就回本,但要跑满负载,单纯编程肯定跑不满。
    而且,考虑到各大厂的订阅套餐非常便宜,一般比 API 价格便宜 10x~20x 倍,订阅够用的话肯定订阅划算:
    https://0.51bbc.workers.dev/t/1235609#r_17991716
    Retas
        15
    Retas  
       18h 44m ago
    本地部署难崩的是算力只有下限,多个 Agent 就拉闸了。 用 API 跑上百个 Agent 并发洒洒水的事
    gpt5
        16
    gpt5  
       18h 38m ago
    本地部署有其应用场景 但绝不是来当主力代码 agent
    RandomJoke
        17
    RandomJoke  
       18h 37m ago
    你要达到 API 的推理效果,基本上硬件得投入百万级别。。。,还不算维护成本
    kuhung
        18
    kuhung  
       18h 35m ago
    除非极度重视隐私,不然写代码自己搞一套没有性价比。
    keppelfei
        19
    keppelfei  
       17h 55m ago
    就目前市场看,2~3w 想部署一个 dsv4f,想常用感觉很困难
    geese1028
        20
    geese1028  
       17h 43m ago
    我个人会选择订阅,不会考虑本地部署。3 万我可以把 super grok heavy 和 5x 的 GPT 订阅一整年了。1 年时间我觉得我的需求应该都能干完了。


    我个人并不在意大厂获取我的个人数据用于训练(我不用中转站)。如果我的数据对于训练下一代模型能有帮助,我将感到非常荣幸。
    iv8d
        21
    iv8d  
       14h 15m ago via Android
    有设备必须本地,要求并发后并且能开 max ,除此之外还是上 api 吧
    refear99
        22
    refear99  
       14h 9m ago
    M3 MAX 128G ,应该只能跑个 qwen 3.8 27b 吧? 还不是 8bit 的
    mingtdlb
        23
    mingtdlb  
       13h 54m ago
    量化的跟原生精度的比,能力差点吧
    HENQIGUAI
        24
    HENQIGUAI  
       13h 43m ago
    这个价格的设备怕是不行吧
    foryou2023
        25
    foryou2023  
    OP
       13h 5m ago
    @HENQIGUAI 看到有人说部署这个,满足正常使用,所以来求证一下,速率就是上面测试的结果。
    @refear99 跑的就是我说的这个。
    ooppstef
        26
    ooppstef  
       12h 0m ago
    如果自己部署划算,那云怎么赚钱呢。。。商业模式就不成立啊。
    foryou2023
        27
    foryou2023  
    OP
       11h 48m ago
    @ooppstef 不知道,我也在想这个问题,如果未来 2 万块钱就能部署本地的大模型日常够用的话,我肯定不会订阅了。这样想的话,大模型公司一定是赚企业的钱。
    wwhc
        28
    wwhc  
       8h 16m ago
    Deepseek v4 flash 能用的起点是两块 RTX PRO 6000
    Maxwe11
        29
    Maxwe11  
       8h 3m ago
    这个就像自己种菜和从农业工厂订菜,平摊成本决定了一定是工业化生产的平均成本更低,本地部署的,除非是有特别法律法规、隐私需求或其他官方不支持导致的无法使用因素,否则一定是 API 的成本更低(再补个漏洞:就是大模型这个也不能存在少数垄断,必须保持当下这种有开源有竞争的市场,否则垄断收割的镰刀更锋利)
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1137 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 62ms · UTC 23:25 · PVG 07:25 · LAX 16:25 · JFK 19:25
    ♥ Do have faith in what you're doing.