coefu

coefu

V2EX member #616381, joined on 2023-02-28 17:15:35 +08:00
Today's activity rank 3998
Per coefu's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
coefu's recent replies
5h 9m ago
Replied to a topic by ashong 程序员 编程效果对比 本地 Qwen3.8-27B vs Deepseek
鹈鹕很 Q 。
10h 4m ago
Replied to a topic by sNullp 分享发现 网络大神搞出来的 queqiao
@shunia 他搞 agent 才是跨度。本身就是做 infra 的。
11h 28m ago
Replied to a topic by coefu Local LLM mac ultra deepseek harness & qwen3.8-27B 几点经验
最新进展:

因为 qwen3.8 27B 是一个非常典型的 Hybrid / Gated DeltaNet + Attention 模型.

整个 kvcache 包含了 Attention KV Cache+Recurrent State ,llama.cpp 的 context-shift 只能搞经典 attention ,没办法搞 recurrent state ,用不了 context shift 。通过缩小整个 context ,让 tg 一直保持一个比较高的状态,这条路走不通。

很烦,😡
当前模型的攻击能力已经远超人类的防护能力了。你只能找一个每个周期都能保证最先进的模型,做防守。
@txican 公式有那么点儿意思,能完善指标的定义,会更好。
还很年轻,不过鉴于行业已经日薄西山了,有点回忆留个念想也还行。

不过这种回忆录看多了,不免有点聒噪矫情。
不然怎么按量收费?
你应该把 杰哥相亲的视频,看个起码三分之二,问题都迎刃而解了。
最新进展:

1 ,又用回了 llama.cpp ,mlx-dspark 不能量化 context kvcache ,导致 64k context 都能 oom 。

2 ,llama.cpp 加上 -b 4096 -ub 2048 ,保证更多的压榨 Metal gpu ,pp 阶段有提升。

3 ,加上 --slot-save-path ./kv_cache_saves --cache-idle-slots ,保证 llama.cpp 当前进程 crash 之后,再启动的时候 能快速 prefill 。

4 ,用 hindsight 记忆组件,显示声明 deepseek harness 每次会话完结 都把当前进展存入记忆,保证重开会话的工作进展延续性。

5 ,在 225k 输入,10.6k 输出的时候,还能稳定平均 8 tok/s 。

爽,😊
@turing518 当然不是,成了我还和你合作?想什么呢,😂,当然是有风险的。不过我看还是算了。不让你为难了。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2517 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 9ms · UTC 16:00 · PVG 00:00 · LAX 09:00 · JFK 12:00
♥ Do have faith in what you're doing.