比如 codex ,一个 5.6 就好几个版本,推理强度还搞好几个梯度。 Claude 的话模型少一点,一般就 opus 系列开 medium ,不知道是否有更精细化的用法。 大家都是怎么分配这些模型和任务呢,最常用哪种。
比如 codex ,一个 5.6 就好几个版本,推理强度还搞好几个梯度。 Claude 的话模型少一点,一般就 opus 系列开 medium ,不知道是否有更精细化的用法。 大家都是怎么分配这些模型和任务呢,最常用哪种。
1
passive 2h 23m ago via Android
本地 deepseek v4 flash 默认 thinking 一把嗦。Depseek 搞不定的,换个模型或者加强 thinking 也只是赌概率,还不如手工介入或者引导 agent plan 出正确的计划更有效率。
|
2
zemin 1h 2m ago
|
3
canyue7897 56 mins ago
如果对成本不是很敏感的话,就选最贵的那个最高档次的模型。如果说对成本特别敏感的话,那就只能选择大家认为合适的。但是大家认为合适的可能不太适合你的工作流,这个需要自己一个一个测试。
|
4
maolon 44 mins ago
这个没有定论的,都是看你的任务来决定,
方法论基本就是:时间,成本,质量这三个条件来权衡, 时间是平均完成一个任务所需的时间而不是 tps , 成本也是平均完成一个任务所需的成本,比如你的 plan 的 quota 消耗或者直接就是 api 的价格, 质量就是能不能满足你对项目的需求。 一般对于普通编程任务来说,推理强度是有一个上限的,旗舰模型( sol,opus,fable )最高的那一档思考强度一般是给科研用的,如果编程使用就会出现很明显的慢,过度思考,以及比次一档贵一倍的价格。但是次旗舰模型以及国产最好的模型一般都可以使用最高一档强度。 最后你可以参考 deepswe,或者 aa 的帕累托前沿来选择模型和强度,我一般参考 deepswe 多一些 |
5
kamisamayo OP @maolon 感谢详细解答
|
6
maemolee 15 mins ago
VibeCoding 一直选最贵的,实际业务要调用 LLM 的话,不追求最佳效果,只追求及格线+成本尽量低。
比如说我,Vibe 的时候目前默认 GPT5.6-Sol-极高,但是我的实际业务要用图像识别,是 doubao-seed-2.0-mini/lite ,我的音频视频识别业务用的是 mimo-v2.5😂 |