Codex Spark 模型实测体验
这篇文章记录我在 Codex 额度用完后实际切换到 Codex Spark 的体验,重点比较它与 GPT-5.3-Codex 在响应速度、任务边界、上下文能力和复杂任务表现上的差异,并总结它适合快速修改、原型验证和结对编程的场景,以及不适合深度重构的原因。
什么是 Codex Spark?
GPT-5.3-Codex-Spark 是 OpenAI 于 2026 年 2 月发布的轻量级编程模型,主打实时协作与超低延迟,而非深度推理。它运行在 Cerebras 的 WSE-3 晶圆级芯片上,推理速度超过 1000 tokens/秒,大约是标准 GPT-5.3-Codex 的 15 倍,客户端往返延迟降低了 80%。
实测结果
任务表现
| 任务 | 结果 | 判断 |
|---|---|---|
| 文档改写 | 成功 | 适合目标明确的局部修改 |
| 执行简单命令 | 成功 | 适合即时反馈和快速验证 |
| 大范围中译英 | 受限 | 出现编译错误,需要人工收尾 |
| 大范围改写 CSS 样式和 HTML 布局 | 受限 | 样式偏差大,并频繁压缩上下文 |
提示词特征
系统提示中含 spark 模型标识:
"You are super fast model; your sampling speed is 1.5k tokens per second"
这是 Codex 的 spark 快速档模型的特征字符串。
为什么复杂任务不太行?
Codex Spark 的"短板"是刻意的设计取舍,核心原因可以归纳为以下几点:
1. 它是"小模型",参数规模大幅缩减
Codex Spark 是 GPT-5.3-Codex 的精简版,推测激活参数约 30B 级别。模型容量直接决定了其对复杂逻辑、长程依赖和多文件架构的理解上限。OpenAI 官方也明确承认:"新模型的性能将不如 GPT-5.3-Codex,但能够在极短时间内完成任务"。
2. 基准测试成绩明显落后
在考察软件工程综合能力的 SWE-Bench Pro 和 Terminal-Bench 2.0 测试中,Codex Spark 的得分显著低于完整版。例如 Terminal-Bench 2.0 中,Spark 得分为 58.4%,而 GPT-5.3-Codex 达到 77.3%。这说明它在需要多步规划、深度调试和自主执行的复杂任务上确实力有不逮。
3. 上下文窗口与功能受限
发布时仅支持 128K 上下文(标准版为 200K),且仅支持文本输入,没有多模态能力。对于需要分析大量代码库、处理复杂文档或理解图像界面的任务,这构成了硬性瓶颈。
4. 行为模式偏向"轻量编辑"而非"深度重构"
OpenAI 对 Spark 的调优目标是快速、可中断、可引导。它默认进行轻量级、针对性的代码修改,倾向于最小化编辑而非大规模重写,也不会自动运行测试。这种设计非常适合实时迭代,但面对需要数小时自主工作的复杂重构或架构设计时,它缺乏完整版那种"深度推理 + 长时执行"的能力。
小结
OpenAI 对 Codex Spark 的定位非常清晰:它不是 GPT-5.3-Codex 的替代品,而是互补品。当你需要快速改一行代码、调整样式、验证原型或和 AI "结对编程"时,Spark 的即时反馈体验极佳;但遇到需要深度推理、多文件协调、长时间自主运行的复杂任务时,仍然需要切换回完整的 GPT-5.3-Codex 或其他大模型。