
最近兩個月我把主力開發(fā)工具從 Claude Code 換成 Codex。主要原因是 Computer Use 對桌面自動化有幫助我也在同步推進幾個項目。實際用下來用量和結果都給了我壓力。我訂閱的是每月 200 美元那檔這一周兩次用量重置仍不夠。我把調研拆到 ChatGPT 網(wǎng)頁版再讓 Codex 做實施但產出還是沒有達到預期。一個具體任務來自旅行導覽 App。我想解決規(guī)劃大旅行時外部信息過載的問題把需要查看的內容做得更有結構減輕查資料的心智壓力。這要求我采集原始資料、整理再重寫成能用的內容。在這項資料工作上我試了 Codex 的 Sol 和 Astra結果都不夠穩(wěn)定。換回 Claude Code 后兩個來回就通過了。Opus 5.5 在這個具體項目上的表現(xiàn)讓我重新評估工具選擇。這不是一份模型基準測試也沒有代碼或量化指標可以外推到所有開發(fā)任務。對我更直接的提醒是把模型放進自己正在做的任務里驗證。深夜一點等一份跑了很久卻不能用的結果時工具之間的差別會非常實際。