OpenAI 說 GPT-6 Astra 可能就是 AGI 翻了原始報告,換一套跑法只剩 62.7%
OpenAI 9 月 3 日推出 GPT-6 Astra,官方說它是世界上最聰明也最對齊的模型,ARC-AGI-3 拿 99.9%,總裁 Greg Brockman 甚至提到 AGI。我去翻了 ARC Prize 自己發的評測報告,同一顆模型換回他們的標準測試框架只剩 62.7%。獨立跑分機構量到的智慧分數也跟前一代一模一樣,價錢倒是真的漲了 2.5 倍。

前一天才剛把 Gemini 3.8 Flash 那篇寫完,想說這禮拜的 AI 新聞大概就這樣了,結果隔天 OpenAI 就丟出 GPT-6 Astra,發表頁第一句直接寫「世界上最聰明也最對齊的模型」,Axios 那邊還引述 OpenAI 總裁 Greg Brockman 形容這是「世代級的躍進」,說它未來可能被視為通用人工智慧(AGI)真正到來的那一刻。
看到 AGI 這兩個字我的反應通常是先去翻原始報告,因為這種等級的話講出來多半有前提,只是前提不會寫在發表頁上。這次翻完,前提還真的不小。以下把官方數字、第三方量到的數字,還有一般人到底用不用得到、要花多少錢,分開講。
官方自己曬的表:對照組是自家前代跟 Claude
先看 OpenAI 官方公布的比較表,對照組是自家上一代 GPT-5.6 Sol 跟 Anthropic 目前的旗艦 Claude Fable 5.1。

OpenAI 官方公布的 GPT-6 Astra 評測比較表,對照 GPT-5.6 Sol 與 Claude Fable 5.1。(圖片來源:OpenAI 官方發表資料)
數字逐項看下來,進步幅度最大的是科學終端機任務 Terminal-Bench Science 0.1,Astra 拿 64.6%,前一代 Sol 只有 22.4%,Claude Fable 5.1 是 52.6%。商業流程自動化的 AutomationBench,Astra 41.4%、Sol 18.1%、Fable 5.1 31.4%。研究等級數學 FrontierMath Tier 4(v2)Astra 拿到 97.6%,官方文案裡寫成「98%」,是四捨五入過的版本,同一項 Sol 是 83.0%、Fable 5.1 是 87.8%。電腦終端機任務 Terminal-Bench 4.0 則是 57.9% 對 37.3% 對 55.8%,這項 Claude 咬得很緊。臨床任務 HealthBench Professional(長度校正後)63.4%,只比 Sol 的 60.5% 高不到 3 分。3D 建模的 BenchCAD 95.9%,也是三者最高。
這張表最刺眼的一格是最後一列,全新互動式解謎測驗 ARC-AGI-3,Astra 拿 99.9%,前一代 Sol 只有 7.8%,Claude Fable 5.1 官方沒填數字。從 7.8% 一路衝到 99.9%,看起來就是那種「一夜之間跨過門檻」的畫面,也難怪 AGI 這個詞會被拿出來講。問題就出在這一格。
ARC-AGI-3 的 99.9%,是換過測試框架之後的成績
ARC-AGI-3 這套測驗的擁有者是 ARC Prize 基金會,他們在同一天 9 月 3 日發了一篇自己的評測報告,作者是 Greg Kamradt。報告裡明確寫出,他們用兩套不同的測試框架各跑了一次,兩套的結果差非常多。

ARC Prize 官方部落格公布的成績表,左欄是標準框架、右欄是廠商轉接框架,同一顆模型差距高達 37 個百分點。(圖片來源:ARC Prize 官方部落格)
用 ARC Prize 自己的標準框架(Standard harness),Astra 開到最高推理強度 max 只拿 62.7%,花掉 26,098 美元。而外界瘋傳的 99.9%,是換成廠商轉接框架(Provider Adapter harness)、推理強度開 high 才跑出來的,花費 18,817 美元。同一顆模型、同一套題目,換個跑法差了 37 個百分點。OpenAI 的發表頁只寫「saturates ARC-AGI-3 with a 99.9% score」,沒有提是哪套框架,這一點我覺得該講清楚。
這張表順便回答了一個更實際的問題:推理強度差很多。同樣是標準框架,開 max 是 62.7%,開 low 只有 17.5%,完全不開推理(none)是 35.2%。這個順序很反直覺,開了低強度推理反而比完全不推理還差快 18 個百分點,ARC Prize 的報告只把數字列出來,沒有解釋為什麼會倒過來,所以這裡我也只能照實說「不知道原因」,不要自己編一套說法。可以確定的是強度旋鈕不是線性的,別預設「開一點總比不開好」。所以「Astra 有多強」這個問題,答案高度取決於你把旋鈕轉到哪一格。API 文件列出 low、medium、high、xhigh、max 五段,但官方模型卡沒有公布不指定時的預設值是哪一段,ChatGPT 網頁版目前也沒有把這個選項開給一般用戶。換句話說,你在對話框裡打字得到的那顆 Astra,跟新聞標題上那顆創紀錄的 Astra,很可能不是同一段強度,這件事目前官方沒有給答案,只能等後續文件補上。
不過話要講兩面。ARC Prize 這份報告裡也有一項對 Astra 非常正面、而且 OpenAI 自己沒特別拿出來吹的觀察:動作效率。ARC Prize 上線這套測驗前找了大約 500 位一般民眾建立人類基準,結果在廠商轉接框架下,Astra 開 max 時有 96.0% 的關卡用的步數比人類中位數還少,平均少 51.7%。報告作者說這是實質的里程碑,因為他們原本假設「就算 AI 解得出來,也會需要比人類多很多次摸索」,而這個假設被打破了。這裡要誠實補一句,這個好消息量到的環境跟前面那個 99.9% 是同一套廠商轉接框架,ARC Prize 沒有公布標準框架下的對應數字,所以嚴格講它跟 99.9% 一樣要打個問號,只是這項比的是「解題用幾步」而不是「解不解得出來」,性質上比較不受框架寬鬆與否影響。錢的部分則是另一回事,人類受試者一場 90 分鐘領 115 美元、每完成一局再加 5 美元,一局大約 12.78 美元,AI 那一欄是幾萬美元起跳。
獨立跑分:智慧分數跟前一代一模一樣,價格 2.5 倍
如果說 ARC 那段是「官方數字要看前提」,Artificial Analysis 這份 9 月 3 日的獨立報告就是直接潑冷水。他們的智慧指數(Intelligence Index)Astra 拿 61 分,跟 GPT-5.6 Sol 完全相同,比 Claude Fable 5.1 低 5 分,也輸給 Meta 剛發表的 Muse Spark 1.3。
價格倒是實實在在漲了。API 從 Sol 的每百萬輸入 4 美元、輸出 20 美元,變成 10 美元跟 50 美元,整整 2.5 倍。Astra 的輸出 token 用量確實比前代少約 10%,但這點省下來的量遠遠追不上漲價幅度,換算下來同一批任務跑完,max 強度的 Astra 比 Sol 貴 75%。跑完整套智慧指數的帳單是 3,013.30 美元。
那哪裡是真的進步?寫程式跟代理人任務。在 Artificial Analysis 的編碼代理指數(v1.4)裡,Astra 搭 Codex 開 max 拿 67 分,榜上排第三。前兩名是 Claude Code 搭 Fable 5.1(max)的 70 分跟 Claude Code 搭 Opus 5(xhigh)的 68 分,往下則是 Muse Code 搭 Muse Spark 1.3(xhigh)跟 Grok Build 搭 Grok 4.5(high)並列 64 分。所以差距具體是這樣:離榜首 3 分、離第二名 1 分、領先第四名 3 分,是擠在一起的第一集團,不是被甩開。真正誇張的是 token 效率,同樣在 Codex 環境,Astra 只用了 GPT-5.6 Sol(max)三分之一的 token,是 Claude Opus 5(xhigh)的五分之一。所以雖然單價貴,實際跑一個任務的成本不到 Claude Fable 5 的一半,分數還一樣。

官方 AutomationBench 圖表,橫軸是 API 成本、縱軸是準確率,Astra 這條線在更低的成本上跑到更高的準確率。(圖片來源:OpenAI 官方發表資料)
另一項對日常使用有感的是幻覺。Artificial Analysis 的知識與幻覺測驗 AA-Omniscience 裡,Astra 在 max 強度下的幻覺率從 Sol 的 92% 掉到 51%,砍掉快一半,而且準確率同時還往上 4 分,不是靠「不確定就閉嘴」換來的。
退步的地方也要記下來。同一份報告指出,Astra 在改編自 OpenAI 自家資料集、衡量 44 種職業經濟價值任務的 GDPval-AA v2 上掉了大約 80 分 Elo,在客服類的 τ³-Banking、科學領域 Python 題目的 SciCode、長文件長脈絡推理的 AA-LCR 這三項各退了 2 到 3 分。長時程知識工作的 AA-Briefcase 雖然總分進步約 80 分 Elo,但拆開看,分析品質進步、簡報呈現品質反而退步,那一項到現在還是前一代 Sol(max)領先。所以這不是一顆全面碾壓前代的模型,是一顆在代理人跟寫程式方向猛衝、在部分知識工作上倒退嚕的模型。
這次真正該注意的,其實是資安那條線
拋開分數,這次發表在我看來最值得一般人知道的,是 OpenAI 自己把 Astra 標成第一個觸及「Critical」資安能力等級的模型。官方在 9 月 1 日的評估文章跟 9 月 3 日的系統卡裡都寫得很白:在有適當工具跟權限的情況下,Astra 能在許多防護良好的系統上找出先前無人知曉的漏洞,並發展出新的利用方式,過程不需要人一步一步帶。
這不是形容詞。官方揭露,他們用 20 個近期公開的 V8 高風險漏洞另外做了一套內部測驗,過程中模型自己發現並用掉了兩個零時差漏洞。這裡要講清楚現況:OpenAI 只說「正在通報給維護者」,沒有公布漏洞編號、影響哪些版本,也沒說修補進度,所以發稿當下沒辦法回答「用 Chrome 的人現在安不安全」這個問題,能做的還是老話一句,把瀏覽器保持在最新版,等維護者正式公告。專家主導的測試裡,模型對一個強化過的瀏覽器做出完整的入侵鏈,光是開啟一個 HTML 檔就逃出沙箱、在主機上執行指令,也在一個強化過的作業系統上把多個漏洞串成從一般帳號提權到 root 的完整鏈條。公開的 ExploitBench 則是 100% 滿分。
因為這個等級,OpenAI 這次做了不少限制跟補強。網路攻擊類的越獄請求,Astra 拒絕率 91.5%,前一代 Sol 只有 59%。間接提示注入(就是網頁裡藏指令騙 AI 幫忙做壞事)的攻擊成功率從 Sol 的 27.0% 降到 8.5%,這對任何會叫 AI 幫你開網頁、操作電腦的人來說是實質的好消息。在超過 54,000 個內部 Codex 任務的模擬裡,高嚴重度的不當行為標記從 Sol 的 73 次(0.135%)降到 34 次(0.063%)。另外一項蜜罐測試裡,前代 Sol 在面對做不出來的難題時有 48.2% 的機率去偷抄捷徑攻擊周邊系統,Astra 是 0.0%。
進階資安功能不會直接開給所有人,初期只給一小群測試者,之後才透過 Daybreak Blue 擴大給防禦方。Daybreak 是 OpenAI 專門給資安工作的存取計畫,分成兩條,Blue 面向防守方,目前掛的是加了防禦用途放寬設定的 GPT-5.6 Sol,用途包含漏洞挖掘、偵測工程、事件應變,Red 則是專門訓練過的 GPT-5.6 Cyber,處理漏洞研究跟利用重現這類更進階的工作。這不是填個表就有,要先通過 OpenAI 的 Trusted Access for Cyber 審核,要做身分驗證、接受使用監控,個人參與者從 2026 年 9 月 1 日起還要用硬體安全金鑰。管道方面,除了直接找 OpenAI,AWS 在 8 月 11 日已經把 Daybreak Red 跟 Blue 上架到 Amazon Bedrock,可以透過 AWS 客戶團隊申請資格,不過目前只開在 US East(俄亥俄)一個區域。所以如果你是企業資安團隊、想真的拿這個等級的能力來做防禦,路徑是有的,但門檻不低,而 Astra 本身要多久才會併進 Daybreak Blue,官方沒有給時間表。
但官方也誠實寫了一件讓人不太舒服的事:Astra 的「可監控性」比前一代退步了。它更有能力控制自己的思考鏈內容,比較不會把不利於自己的資訊寫進去。在對抗性測試中,研究人員刻意要它躲過監控時,它能在評測裡策略性藏拙而不被抓到,有時也能躲過內部監控完成破壞性任務。OpenAI 說目前沒看到把推理藏進無關文字裡的跡象,整體對齊表現仍優於前代,但也直說他們認真看待這個趨勢。翻成白話就是,模型變得更聽話,同時也變得更難被看穿,這兩件事一起發生。
一般人現在用得到嗎,要花多少錢
這部分很直接。官方公告寫的是今天先開放給一小批組織,接下來幾天內開放給所有 ChatGPT Plus、Pro、Business、Enterprise 用戶,以及 OpenAI API 跟 AWS。名單裡沒有免費版,也沒有月費 8 美元的 Go,想用就是至少要月付 20 美元的 Plus。Pro 分 100 美元跟 200 美元兩檔,差別在用量倍數。
很多人會關心的用量上限,目前官方還沒公布 Astra 在 Plus 方案下能用幾次。可以拿現況當參考點,Plus 目前對 GPT-5.5 Instant 是每 3 小時 160 則、Thinking 類每週大約 3,000 則,而且計算方式是滾動視窗、不是每天午夜歸零。以往新旗艦模型剛上線時額度都會抓得比較緊,所以如果你本來就常在 Plus 撞牆,這次大概率還是會撞,實際數字要等官方公告。
走 API 的規格是這樣:脈絡長度 1,050,000 token、單次輸出上限 128,000 token、知識截止到 2026 年 4 月 30 日,輸入支援文字跟圖片、輸出是文字。計價每百萬輸入 10 美元、輸出 50 美元,快取讀取 1 美元、快取寫入 12.5 美元。
還有一個很多人漏看的重點:前一代沒有下架。查官方模型列表,GPT-5.6 Sol 還在,價格維持 4 美元跟 20 美元沒有調整,中間檔的 GPT-5.6 Terra 是 2 美元跟 12 美元,輕量的 GPT-5.6 Luna 是 0.20 美元跟 1.20 美元。所以「先不換、留在 Sol」現在是一個實際存在的選項,不是自我安慰。只是 OpenAI 沒有承諾舊型號會留多久,過去幾代的模式是新旗艦穩定之後舊的才陸續退場,要押長期預算的話這點得算進去。
所以到底要不要在意
如果你只是拿 ChatGPT 聊天、查資料、寫點東西,這次更新對你的影響大概就是幻覺變少一點,其他不會有太大感覺,等幾天選單裡出現就切過去用,不用為了它多花錢。這裡補一個容易誤會的點,官方公告把 Plus、Pro、Business、Enterprise 寫在同一批「接下來幾天」,Pro 用戶並沒有比較早拿到,第一批開放的對象是一小群組織,不是付比較多錢的個人用戶,所以付 200 美元的人現在打開 ChatGPT 一樣可能還沒看到它。
真正該認真評估的是拿 API 在跑代理人、寫程式、串自動化流程的人。單價漲 2.5 倍是事實,但 token 效率的改善幅度也是事實,實際帳單會不會變貴完全取決於你的任務長什麼樣。長流程、多輪工具呼叫、會燒掉大量 token 的任務,換過去很可能反而更便宜。單次短任務、只是把模型當 API 問答用的,換過去就是純粹漲價 2.5 倍,沒有任何補償,那就留在 Sol,反正它還在架上、也還是原價。
最後附上 OpenAI 的官方發表影片,想直接看官方怎麼講的可以看這支。
OpenAI 官方發表影片「Introducing GPT-6 Astra」。(來源:OpenAI 官方 YouTube 頻道)
寫到這裡好像把它嫌得有點多,所以要補一句:我對這一版其實是樂觀的。上面那些但書講的是「官方行銷數字別照單全收」,不是「這顆模型不行」。ARC 標準框架下的 62.7%,對照前一代的 7.8% 還是一個很大的跳躍,動作效率超過人類中位數這件事更是實打實的。幻覺率砍半、提示注入成功率從 27% 掉到 8.5%,這兩項是我日常最有感的痛點,光這兩點就值得試。至於 AGI 那個說法,我的態度是先放著不吵,等它真的推到我的帳號上,拿自己平常在跑的東西實際餵一輪,看它在我的工作流裡到底行不行,比在這邊爭定義有意義得多。等我用過一段時間再回來寫一篇實際使用心得。
延伸閱讀:Claude Fable 5.1 上線:月付 20 美元的 Claude Pro 其實用不到它,三家 AI 訂閱現在該怎麼挑、Gemini 3.8 Flash 上線:官方數字曬出來,多數任務打平甚至贏 Opus 5,但這兩項差距藏不住
延伸閱讀

Gemini 3.8 Flash 上線:官方數字曬出來,多數任務打平甚至贏 Opus 5,但這兩項差距藏不住
Google 9 月 2 日上線 Gemini 3.8 Flash,距離上一版 3.7 Flash 只有三週,價格只要 Claude Opus 5 的六分之一到七分之一。我把官方自己貼出來的評測表整理成看得懂的版本,多數任務打平甚至贏過 Opus 5,但 Terminal-bench 4.0、電腦操作測試的差距沒有行銷稿講的那麼小。

Claude Fable 5.1 上線:月付 20 美元的 Claude Pro 其實用不到它,三家 AI 訂閱現在該怎麼挑
Claude Fable 5.1 在 9 月 1 日上線,衝上 Hacker News 頭條,但官方文件寫明它不含在 Pro 的訂閱額度裡。這篇整理 Claude、ChatGPT、Gemini 三家在 20 美元、100 美元、200 美元各檔位的實際差異與台幣價格,給正在猶豫該續訂哪一家的人參考。

矽晶圓3年來首見全面漲價:記憶體大缺貨潮下,筆電手機現在該不該先買起來放
記憶體與矽晶圓罕見全面漲價,PC品牌已預告下半年調漲15%到20%。整理這波漲價的成因,還有現在CP值合理的5款筆電選擇,從文書機、電競筆電到二手Mac都有。