LINUX DO · AI8/3 11:4495 分精选
对主流的几种coding model一次测试,包括GPT 5.4、GPT 5.6 luna、Deepseek v4 flash正式版、Claude sounet 4.6
作为coding model,核心是理解现有代码库、准确遵循需求、代码质量稳定、使用工具能力强、低幻觉、低越界、上下文大、成本与速度优秀等等。想着Deepseek v4 flash正式版出来了,也想测试一下。 本次测试使用GPT-5.6-SOL(high)出题,题目简单要求为: 题目有些难点,例如要求正确处理依赖图、并发调度、失败阻塞和无关分支继续执行;实时区分并转发 stdout/stderr,同时可靠管理多个子进程,超时或 Ctrl-C 时必须终止整个进程树,包括忽略 SIGTERM 的顽固后代等等不一一列举。 分开4个独立区间,每个独立区间给 Implementation Plan,独立运行cli,根据文档进行编写并最终交付成
关联讨论 · 11 条
LINUX DO · AIOpenCode Go套餐 DeepSeek V4 Flash用量参考(CPA优化缓存版)延伸讨论LINUX DO · AIDeepSeek-v4-flash的自动压缩上下文设多少合适延伸讨论LINUX DO · AI实际开发任务测下来 deepseek v4 flash表现还是一般延伸讨论LINUX DO · AI千问套餐也上 v4 正式版了延伸讨论LINUX DO · AIDeepSeek v4 Flash 调用量好高延伸讨论LINUX DO · AIOpenCode Go套餐 DeepSeek V4 Flash GA还是必须选择路由到中国吗延伸讨论LINUX DO · AI今天才发现deepseek v4模型新增了一个role,似乎是为了Harness延伸讨论LINUX DO · AIDeepseek v4 flash的性价比很强哇但更期待Pro延伸讨论LINUX DO · AI公允地评估deepseek v4 flash的性价比延伸讨论LINUX DO · AIdeepseek v4 flash 最长只能跑3小时么延伸讨论即刻·AI探索站DeepSeek-V4-Flash正式版超越Claude-Opus-4.8,Arena代码榜升至第7延伸讨论