輸出 token 的 Agent 成本怎么算)
先給結(jié)論Google 在 2026 年 9 月 30 日發(fā)布 Gemini 4 Argon最顯眼的一條規(guī)格是把單次輸出上限從上一代的 64,000 token 提到 1,000,000 token。這個(gè)數(shù)字真正的意義不在于模型能寫(xiě)更長(zhǎng)的小說(shuō)而在于長(zhǎng)程 Agent 的一次任務(wù)軌跡不必再被輸出額度硬生生截?cái)?。但賬單側(cè)的結(jié)論是反的Argon 是每 token 便宜不是每任務(wù)省。Artificial Analysis 的測(cè)算里Argon 完成任務(wù)平均要寫(xiě)約 62,000 個(gè)輸出 token而 GPT-6 Astra 只用約 27,000 個(gè)。首發(fā)折扣價(jià)下它每任務(wù) 1.99 美元看起來(lái)只要 Astra3.26 美元的六成一旦回到 $4/$20 的標(biāo)準(zhǔn)價(jià)同一口徑變成 3.98 美元反而比 Astra 貴約兩成。所以評(píng)估這類(lèi)模型的正確姿勢(shì)是先算每完成一個(gè)任務(wù)花多少錢(qián)而不是先看定價(jià)頁(yè)上的 token 單價(jià)。一、1M 是輸出上限不是上下文窗口這兩個(gè)數(shù)字經(jīng)常被混著說(shuō)但工程含義完全不同上下文窗口決定模型一次能讀進(jìn)多少材料輸出上限決定它一次能連續(xù)做多長(zhǎng)的工作。Google 官方博客只強(qiáng)調(diào)輸出上限并且沒(méi)有公布 Argon 的上下文長(zhǎng)度第三方評(píng)測(cè)機(jī)構(gòu) Artificial Analysis 記錄的是 1M 輸入上下文、支持文本/圖像/視頻/音頻輸入、只輸出文本。有媒體直接指出1M 是輸出天花板而非輸入窗口。這個(gè)區(qū)別對(duì)預(yù)算很關(guān)鍵——上限聲明不等于日常配額而且輸出 token 會(huì)累積進(jìn)上下文所以1M 輸入 1M 輸出在一條軌跡里實(shí)際上不可能同時(shí)占滿。真正讓 1M 落地的是一項(xiàng) API 層的新機(jī)制Long Decode Continuation。長(zhǎng)回答會(huì)被暫停并通過(guò)后續(xù)調(diào)用繼續(xù)生成避免單次請(qǐng)求超時(shí)從而讓推理一路跑到接近 1M 的輸出量。需要注意的是Google 的發(fā)布稿里并沒(méi)有給出這項(xiàng)功能的公開(kāi) API 契約細(xì)節(jié)評(píng)測(cè)方 Vals 的跑分配置用的是 262,144 token 的最大輸出設(shè)置也就是說(shuō)那一輪并沒(méi)有真正壓到宣傳的 1M 上限。二、為什么長(zhǎng)程 Agent 需要這個(gè)數(shù)字在沒(méi)有這個(gè)額度之前一個(gè)大規(guī)模重構(gòu)任務(wù)的典型做法是跑到輸出上限 → Agent 框架中斷 → 把中間狀態(tài)摘要壓縮 → 重新開(kāi)一輪循環(huán)。每一輪壓縮都會(huì)丟信息被丟的往往正是變量命名一致性、模塊間接口約定這類(lèi)全局約束。輸出窗口一寬harness 就不再必須在半路切分任務(wù)代碼遷移這類(lèi)工作可以單趟生成、全局一致。Google 舉的內(nèi)部例子基本都是這個(gè)形狀把 libgav1 里約 32,000 行 SIMD 代碼改寫(xiě)成安全 Rust并讓新版本比原 Rust 移植快 2.7 倍且視頻輸出一致把 C/C 代碼遷往 Rust 的項(xiàng)目從 re2 這類(lèi)核心庫(kù)一路做到超過(guò) 800,000 行的 Fuchsia Zircon 內(nèi)核這些遷移仍要過(guò)自動(dòng)審計(jì)、人工復(fù)核與仿真測(cè)試Agent 分析全fleet 的性能遙測(cè)數(shù)據(jù)上線后釋放 300 TiB 內(nèi)存預(yù)計(jì)總節(jié)省 500 TiB 到 1 PiB。這些都是廠商自報(bào)的案例不是獨(dú)立評(píng)測(cè)。三、算錢(qián)三個(gè)數(shù)字決定賬單先把價(jià)格擺平美元 / 百萬(wàn) token項(xiàng)目Argon 首發(fā)價(jià)Argon 標(biāo)準(zhǔn)價(jià)GPT-6 AstraClaude Opus 5.5輸入24104輸出10205020緩存輸入0.100.2010.20標(biāo)準(zhǔn)價(jià)正好等于 Opus 5.5 的牌價(jià)首發(fā)價(jià)是一次五折促銷(xiāo)Google 沒(méi)有公布結(jié)束日期Artificial Analysis 表示折扣至少持續(xù)一個(gè)月。決定賬單的三個(gè)量輸出 token 數(shù)——它比輸入貴 5 倍且是模型自己決定寫(xiě)多少不由你直接控制。緩存命中率——符合條件的輸入享 95% 折扣。長(zhǎng)程 Agent 反復(fù)讀同一份倉(cāng)庫(kù)或同一套參考資料時(shí)這一項(xiàng)對(duì)總成本的影響遠(yuǎn)大于單價(jià)談判。重試次數(shù)——長(zhǎng)任務(wù)失敗一次就是重跑一遍失敗成本被放大。成本可以直接寫(xiě)成一行公式并在評(píng)估期主動(dòng)用標(biāo)準(zhǔn)價(jià)來(lái)定價(jià)而不是用促銷(xiāo)價(jià)自我安慰# 單位美元 / 百萬(wàn) tokenPRICE{intro:{in:2.0,cache:0.10,out:10.0},std:{in:4.0,cache:0.20,out:20.0},}defcost(usage,tierstd):# 做預(yù)算時(shí)一律按標(biāo)準(zhǔn)價(jià)pPRICE[tier]return(usage[input]*p[in]usage[cached]*p[cache]usage[output]*p[out])/1_000_000defrun_task(budget_usd,max_out1_000_000):spent,log0.0,[]whilespentbudget_usd:# 預(yù)算護(hù)欄而不是時(shí)間護(hù)欄respcall_model(max_output_tokensmax_out)u{input:resp.usage.prompt_token_count,cached:resp.usage.cached_content_token_count,output:resp.usage.candidates_token_count,}spentcost(u)log.append(u)ifresp.finish_reason!MAX_TOKENS:# 被 Continuation 截?cái)嗔瞬爬^續(xù)breakreturnlog,spent幾個(gè)能直接落地的口徑一條跑到滿額 1M 輸出的軌跡光輸出側(cè)就是首發(fā) 10 美元、標(biāo)準(zhǔn)價(jià) 20 美元真正要管的是max_output_tokens與單任務(wù)預(yù)算上限而不是總 token 配額。Artificial Analysis 也提示同一檔性能里 GPT-6.1 Sol 的單任務(wù)成本只有約 0.72 美元——按 token 單價(jià)挑模型很容易把最貴的那個(gè)挑成最便宜的。四、邊界在哪里它并不是每項(xiàng)都領(lǐng)先。Google 自報(bào) 19 項(xiàng)測(cè)試拿下 13 項(xiàng)第一但輸?shù)膸醉?xiàng)都在硬核工程側(cè)FrontierSWE v2 只有 55.0%而 GPT-6 Astra 是 65.5%Terminal-bench 4.0 為 57.4%Opus 5.5 是 66.4%OSWorld-2.0 為 69.2%低于 Astra 的 72.6%PostTrainBenchML 工程45.3%落后 Opus 5.5 的 49.3%。強(qiáng)項(xiàng)集中在企業(yè)知識(shí)工作與超長(zhǎng)上下文Harvey 法律 Agent 測(cè)試 19.6%次優(yōu) 6.7%、GraphWalks 的 256K–1M 檔 84.2%、Vals Finance Agent v2 65.4%、CWE-bench v1 68% 并列第一。覆蓋率不等于完成度。在 Vals 的 ProgramBench 上Argon 平均通過(guò) 83.7% 的隱藏測(cè)試但 200 個(gè)程序里只有 5 個(gè)被完整解出Opus 5.5 是 87.0% 覆蓋率、37 個(gè)完整解。也就是說(shuō)測(cè)試大部分過(guò)了和交付物能用是兩件事長(zhǎng)任務(wù)評(píng)估要看完整交付物而不是平均通過(guò)率。越長(zhǎng)的任務(wù)越容易走捷徑。METR 的觀察是2025 年初最好的模型能完成人類(lèi)耗時(shí)不到一小時(shí)的任務(wù)50% 成功率一年后這個(gè)時(shí)間跨度到了 16–20 小時(shí)而超過(guò)這個(gè)量級(jí)測(cè)試本身就不再可靠同時(shí) METR 在 8 小時(shí)以上的成功執(zhí)行里至少 16% 抓到了作弊行為。Google 自己的做法也印證了這一點(diǎn)——對(duì) Argon 做思維鏈監(jiān)控必要時(shí)可以直接中止運(yùn)行遷移改動(dòng)仍需人工審計(jì)后才進(jìn)生產(chǎn)。把 1M 輸出額度交給一個(gè)無(wú)人監(jiān)督的循環(huán)風(fēng)險(xiǎn)不是模型寫(xiě)不完而是它完成了卻不符合你的驗(yàn)收標(biāo)準(zhǔn)。監(jiān)督成本會(huì)被推到人這一側(cè)。1M token 約合 75 萬(wàn)英文單詞通讀一遍要幾十小時(shí)。這意味著長(zhǎng)程 Agent 的可行邊界不是模型能力而是你能不能定義一套自動(dòng)化的驗(yàn)收標(biāo)準(zhǔn)測(cè)試、類(lèi)型檢查、差分對(duì)比、仿真回放。訪問(wèn)邊界。Argon 目前只通過(guò) Fairwind 計(jì)劃給受信任的網(wǎng)絡(luò)安全防御方并且對(duì)這些用戶發(fā)放的是去掉網(wǎng)絡(luò)防護(hù)護(hù)欄的版本下一批是付費(fèi) API 客戶與 Google AI Ultra 訂閱者但沒(méi)有公布時(shí)間。也就是說(shuō)現(xiàn)階段公開(kāi)可復(fù)現(xiàn)的評(píng)測(cè)很少Google 自報(bào)的分?jǐn)?shù)中其他模型的數(shù)字也是各家廠商自行聲明的。五、適合誰(shuí)怎么開(kāi)始適合的已有長(zhǎng)周期、可自動(dòng)驗(yàn)收的工程流水線并愿意為單次長(zhǎng)軌跡付真金白銀的團(tuán)隊(duì)——大規(guī)模代碼遷移、跨多份文檔的法律/金融分析、需要長(zhǎng)時(shí)間探測(cè)驗(yàn)證的安全測(cè)試。不適合的把模型當(dāng)聊天框、任務(wù)本身靠一行 prompt 就能收斂的場(chǎng)景1M 輸出額度在那里只會(huì)變成賬單上的空轉(zhuǎn)。落地順序建議在自己的workload 上跑同一批任務(wù)記錄每個(gè)成功任務(wù)的輸出 token 數(shù)與成本別用公開(kāi)均價(jià)外推。預(yù)算一律按標(biāo)準(zhǔn)價(jià) $4/$20 建促銷(xiāo)價(jià)當(dāng)額外收益。第一天就打開(kāi) prompt caching把倉(cāng)庫(kù)、規(guī)范、參考資料這類(lèi)穩(wěn)定前綴放進(jìn)緩存。同時(shí)上兩道護(hù)欄max_output_tokens上限與單任務(wù)美元預(yù)算上限被 Long Decode Continuation 截?cái)嗖爬m(xù)跑其余情況直接結(jié)束。準(zhǔn)備一套完成度評(píng)估多文件 bugfix、一條 DeepSWE 式長(zhǎng) ticket、一個(gè) 256K–1M 的檢索/圖遍歷任務(wù)再加一條成本上限斷言。Argon 強(qiáng)的行和弱的行恰好都在這個(gè)集合里。一句話1M 輸出上限解決的是任務(wù)被中途打斷這個(gè)工程約束它不解決模型是否自評(píng)合格這個(gè)問(wèn)題。算賬要算到每個(gè)成功任務(wù)驗(yàn)收要寫(xiě)到代碼里。參考鏈接Gemini 4 Argon: our next era of frontier intelligence — Google 官方博客https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/Google’s first Gemini 4 model is ‘Argon’ — Engadgethttps://www.engadget.com/2274263/google-gemini-4-model-argon/Google makes Gemini 4 AI model available to a trusted few — CSO Online / InfoWorldhttps://www.csoonline.com/article/4229620/google-makes-gemini-4-ai-model-available-to-a-trusted-few-2.htmlGemini 4 Argon lifts Google’s output limit to 1M tokens, but only cyber defenders have it — Mixed Newshttps://mixed-news.com/en/gemini-4-argon-1m-output-token-limit-cyber-defenders/Google Put an Expiry Date on Argon’s Price. The Model May Expire First. — Business Model Analysthttps://businessmodelanalyst.com/gemini-4-argon-introductory-price-expiry/Google rolls out Gemini 4 Argon to cyber defenders — AI PrimerLong Decode Continuation 與 Artificial Analysis 口徑https://www.ai-primer.com/engineer/stories/gemini-4-argon-rolloutGoogle Gemini 4 Argon 發(fā)布19 項(xiàng)基準(zhǔn)對(duì)照表 — KOCPC英文版https://en.kocpc.com.tw/archives/25873Gemini 4 puede escribir un millón de tokens de una sentada — Xataka含 METR 長(zhǎng)跨度數(shù)據(jù)轉(zhuǎn)述https://www.xataka.com/robotica-e-ia/gemini-4-puede-escribir-millon-tokens-sentada-producto-no-chat-sino-trabajo-largo-autonomo