LINUX DO · AI8/3 11:4495精选

对主流的几种coding model一次测试,包括GPT 5.4、GPT 5.6 luna、Deepseek v4 flash正式版、Claude sounet 4.6

阅读原文
作为coding model,核心是理解现有代码库、准确遵循需求、代码质量稳定、使用工具能力强、低幻觉、低越界、上下文大、成本与速度优秀等等。想着Deepseek v4 flash正式版出来了,也想测试一下。 本次测试使用GPT-5.6-SOL(high)出题,题目简单要求为: 题目有些难点,例如要求正确处理依赖图、并发调度、失败阻塞和无关分支继续执行;实时区分并转发 stdout/stderr,同时可靠管理多个子进程,超时或 Ctrl-C 时必须终止整个进程树,包括忽略 SIGTERM 的顽固后代等等不一一列举。 分开4个独立区间,每个独立区间给 Implementation Plan,独立运行cli,根据文档进行编写并最终交付成

关联讨论 · 11

来源与依据

时间证据
8/3 11:44
收录于 8/3 13:10
交叉线索
1 个独立来源
内容可信度:待积累