
OpenAI 紧急发布 GPT-5.1-Codex-Max,在 SWE-Bench Verified 中以 77.9% 准确率超越 Gemini 3 Pro。新模型引入原生多窗口“压缩”机制,支持 24 小时连续工作,并在后端逻辑与终端操作上展现压倒性优势,但在前端领域 Gemini 3 Pro 仍是首选。
朋友们,OpenAI 这次是真的“人狠话不多”。
没有 Sam Altman 的自拍,没有炫酷的发布会视频,甚至连一篇高调的公关稿都没怎么推。就在昨天,OpenAI 悄无声息地扔下了一枚深水炸弹——GPT-5.1-Codex-Max。
现在的感受只有两个字:恐怖。前天被谷歌 Gemini 3 Pro 抢走的“编程最强”头衔,OpenAI 又硬生生夺回来了。

我们来看看这次升级到底有多硬核,以及——作为一个开发者,你现在到底该用哪个?
AI 编程圈子,Gemini 3 Pro 确实风光了一阵。但这次 Codex-Max 的数据出来,可以说是“贴脸开大”。
看看这组硬碰硬的数据:

OpenAI 重新夺回了综合编程能力的 T0 位置,而 Claude Sonnet 4.5... 咱们还是给它留点面子,暂时不提了吧。
这次升级最让我兴奋的不是跑分,而是那个叫“压缩(Compaction)”的新机制。

以前的模型,代码写长了就“健忘”,上下文一多就开始胡言乱语。GPT-5.1-Codex-Max 是 OpenAI 第一个“原生训练支持多窗口上下文”的模型。
效果炸裂:
数据是冷的,手感是热的。我也实测了一把,有几个点必须得夸:


灵魂拷问:现在我该用谁?
虽然 Codex-Max 登顶了,但我还是要说句公道话:Gemini 3 Pro 并没有输光。

经过交叉对比,我的建议非常明确:
搞前端: 请死守 Gemini 3 Pro。谷歌在前端审美、CSS 动效还原、React 组件状态管理上,依然有着玄学般的优势。Codex-Max 写的界面虽然逻辑对,但总感觉像“后端工程师画的 UI”,你懂我意思吧?
搞后端/架构/算法/修Bug/运维: 无脑冲 GPT-5.1-Codex-Max。逻辑缜密,鲁棒性强,特别是那个 24 小时连续工作的能力,太香了。
Claude Sonnet 4.5: 呃... 可以先放假休息一阵子了。
想立刻上手的兄弟们注意了,目前没有公共 API(官方说快了,别急)。
现在的上车姿势:
老鸟升级指南:如果你之前装过 Codex CLI,直接终端敲一行命令: npm install -g @openai/codex@latest
新来的朋友: npm install -g @openai/codex
装好后,GPT-5.1-Codex-Max 就是你的默认副驾驶了。
针对使用 AI 编程时“任务成功但理解失败”的空心化问题,作者基于 Anthropic 的理解验证思路与自身四个真实项目的迭代实践,提炼出一套极简实操工作流:通过剖析理解流失的三大漏点(会话内/会话间/未落纸),确立“任务完成”与“理解完成”两条并行验收线,利用固定三问复述与 Harness/CLAUDE.md 沉淀,把技术认知从脑内传话筒升级为机器可驻留的环境资产。
同类内容
过度依赖 AI 编程易导致开发者沦为麻木的“审批按钮”——点同意只需 3 秒,看懂却要 30 分钟。这种决策疲劳会导致“智能体黑箱”,造成任务成功但认知完全空心化的隐形负债。本文提出 5 信号自测清单与 3 道关键防线,帮助开发者把技术判断权从 AI 手中拿回来。
同类内容
字节跳动旗下 Xpert 专家平台上线“AI 语音对话录制”项目。本文详细拆解了该项目的作业形式(双人对录扮演 AI 与用户)、两套计价机制(陪聊 100-125 元/棚时 vs 主发音人最高约 5500 元/成品小时)、试音通关技巧、周结打款周期及六大方向的门槛要求,为想低门槛试水 AI 训练副业的人提供真实参考。
同类内容
人工“跑一遍主流程”是 AI 编码交付中最脆弱的一环,极易漏掉边界输入、异常状态与暗中改坏的旧模块。本文提出“AI的能力边界由可验证反馈决定”,并通过三句轻量级 Prompt 动作将验证动作外包给 AI,把每一次踩坑转化成自动拦截的机器资产。
同类内容
加载评论中…