There is no item in your cart
北京時間凌晨三點半,OpenAI 正式發布 GPT-6 Astra 模型的相關資訊。事實上,Agent(智能代理)進入瀏覽器、讀懂介面並連續完成多步操作的能力,在過去並非新穎概念。Astra 真正的推進重點在於:同樣是讓 AI 操作電腦,它能否做得更快、出錯更少,在更複雜的軟體環境中減少人為接管的次數,並留下真正可繼續使用的成果。本文將自官方評測數據、長任務改進,以及五個真實應用案例三個維度,系統性拆解 Astra 的實際能力與侷限。
一、官方定位與三大核心優勢
依據 OpenAI 官方推文所述:「This is GPT-6 Astra. 凡是在電腦上能做的,Astra 都能幫您做,而且速度很快。」此推文於發布後獲得熱烈迴響,互動數據包括留言 3.6K、轉推 25K、喜歡 152K、總瀏覽量 3,200 萬次。
OpenAI 將 Astra 的核心優勢歸納為三項:
- 更快:任務執行速度相較前代模型顯著提升;
- 更穩:在長時間流程中減少卡住、返工的機率;
- 更少接管:降低人為介入頻率,提升自動化完成度。
上述定位由 OpenAI 官方資料與首批創作者的公開實測共同佐證,而非僅為行銷口號。
二、官方評測數據:成功率與速度雙重提升
(一)同類電腦任務:成功率更高、速度更快
依據 OpenAI 公布的數據,於 OSWorld 2.0 基準測試中,Astra 的得分為 72.6%,GPT-5.6 Sol 為 65.7%;平均完成一項任務的耗時,Astra 約為 40 分鐘,GPT-5.6 Sol 則約為 75 分鐘。換言之,Astra 並非「突然學會了新技能」,而是將既有的電腦操作能力進一步推向「少卡住、少返工」的階段。
(二)專業工具支援:從瀏覽器延伸至桌面軟體
Astra 的任務覆蓋範圍已擴展至 Premiere、CAD、Blender、Unreal Engine 等專業創作工具,以及財務核對、科研軟體等專業領域。在 BenchCAD 測試中,Astra 得分 95.9%,GPT-5.6 Sol 為 83.3%;於 AutomationBench 中,兩者得分分別為 41.4% 與 18.1%。
此項進展的關鍵意義在於:Astra 開始處理過去被視為「需要高度專業知識」的桌面軟體任務,而不再僅限於瀏覽器內的網頁操作。
三、長任務處理能力的具體改進
相較於過往的 Agent 設計,Astra 於長任務場景下展現三項明顯改進:
- 保留原目標:面對中途新增的補充資訊,仍能持續聚焦於最初設定的任務目標;
- 接受中途調整:使用者於任務進行中改變方向時,能靈活配合;
- 懂得何時詢問:一般細節會結合上下文自行判斷,真正影響結果的決策則會主動停下詢問。
此一改變意味著 Agent 的能力並非「從無到有」,而是從「看起來能做」邁向「更接近可以交活」階段。
四、開放時程與「重置卡」補償機制
Astra 目前採分批限量開放機制,尚未對所有付費使用者全面開放。OpenAI Codex 負責人 Tibo 於 X 平台宣布,自發布日起,付費 ChatGPT 計畫用戶每等候一天未能取得 Astra 訪問權限者,將獲發一張「完全重置」卡作為補償,首張補償卡約於公告後三小時內到位。
作者實際查詢帳戶後確認,已收到兩張「完全重置」卡,分別於 9 月 21 日與 10 月 4 日到期,可手動啟用於 Astra 任務。
五、五個真實應用案例
案例一:Premiere 視頻剪輯
從事視頻剪輯的工作者皆知,剪輯過程中最耗時的環節並非構思轉場建議,而是「找素材、對軌道、調節奏」,並反覆確認修改後整條時間線是否保持一致。這項作業極為複雜且考驗耐心與準確度。
於 Every 團隊的公開實測影片中,Astra 能直接進入 Adobe Premiere Pro 軟體內部,於一條已放入真實素材、音訊與多層軌道的時間線上繼續編輯作業。這意味著 Astra 並非僅於對話框中列出剪輯步驟,而是開始面對專業軟體中不斷變化的素材狀態,於軌道、預覽視窗與素材狀態同時變動的環境中推進任務,相較過往 Agent 剪輯能力被評為「質的飛躍」。
不過,由於影片未公開完整的提示詞、總耗時、修改輪數與最終成片驗收方式,目前仍難以斷定 Astra 是否已具備成熟的剪輯能力,但確實已具備初步雛形。
案例二:CRM 客戶分配流程自動化
CRM(客戶關係管理)的常見任務為:新客戶進入系統後,自動判斷該筆線索應分派給哪位負責人(A 或 B),再由正確人員生成定制郵件與日曆邀請。@How I AI 的 Claire Vo 表示,她曾親自操作此流程,耗時一小時仍未順利完成。
Astra 接入既有工作流後,自主完成以下作業:
- 分析背景資訊;
- 新增「判斷客戶歸屬」的決策節點;
- 補上兩條負責人分支邏輯;
- 重新串接後續動作;
- 配置郵件所需欄位(收件人姓名、主旨、客戶摘要等);
- 最終接上 Slack 通知節點,將生成的郵件以「待審草稿」形式提交人工檢查。
此案例彰顯 Astra 的核心能力:能將自然語言中的業務規則,翻譯為軟體流程中的判斷節點、分支邏輯與待審結果,並於流程末端加入人工覆核機制以確保品質。
案例三:Blender 與 Unreal Engine 遊戲原型開發
YouTuber @Matt Wolfe 並不熟悉 Blender(3D 建模與動畫軟體)與 Unreal Engine(遊戲與即時 3D 場景開發引擎),但在 Astra 協助下,順利完成一款可運行的遊戲原型。實際操作流程與耗時如下:
- 第一次提示後,Astra 約耗時 8 分鐘 生成第一版人形狼角色模型;
- 第二次提示後,Astra 約耗時 6 分鐘 移除底座、綁定 50 根骨骼,並生成 8 秒循環動畫;
- 隨後,Astra 於 Unreal Engine 5.7 中耗時約 35 分鐘 生成森林場景,將角色整合進場景,使其可執行移動、奔跑與跳躍等動作。
誠然,最終成果仍屬粗糙原型,距離專業遊戲的品質標準尚有差距。然而,此案例證明 Astra 確實能協助非專業人士快速產出可運行的原型,大幅降低 3D 內容創作的入門門檻。後續的審美調整、動作打磨、性能優化與正式交付等環節,仍需仰賴專業能力。
案例四:連續五日運行的《模擬城市》開發實驗
YouTuber @Matthew Berman 進行了一項更長期的測試:運用 Astra 結合 /goal 長任務模式(讓 Agent 持續圍繞單一目標推進的指令模式),製作一款類似《模擬城市》的 3D 城市建造遊戲。此項任務連續運行五天,遊戲場景中已陸續出現道路、住宅區、商業區、鐵路系統、能源設施、人口統計與城市資金等多項核心系統。
實測結果顯示:
- 使用
/goal模式時,Astra 可將複雜任務連續推進數日; - 未使用
/goal模式時,Astra 約每 30 分鐘便會停下,需人為介入調整提示。
此案例提醒使用者:即使 Astra 具備長任務耐力,「持續執行」並不等於「已完成」。因此於任務啟動前應預先設定明確的驗收標準,否則 Agent 可能無限擴建功能,無法判斷何時應交付成品。
案例五:41 份文檔審閱(最貼近日常工作的案例)
於 OpenAI 官方案例中,Astra 於單次 Agent 運行中審閱了 41 份文檔,並成功找出全部 4 個預先埋入的錯誤。客戶 Legora(一家位於歐洲的科技新創公司)表示,此項財務核對工作過去通常需耗費一整晚甚至數日,Astra 僅於數分鐘內即完成第一輪核對,並留下完整的檢查記錄,供專業人士後續判斷。
關鍵成效數據:
- 相較 Legora 既有基準,財務報表流程的表現提升 40%;
- 於單次 Agent 運行中,於數分鐘內完成 41 份文檔審閱;
- 於預先埋入的錯誤中,4 項全部正確識別。
此案例或為多數職場工作者最為需要的綜合能力:將重複性高、耗時長的文件審閱作業,大幅縮短為可於短時間內完成的第一輪核對,並保留完整的稽核軌跡供人工覆核。
六、已知局限性
儘管 Astra 於任務執行能力上展現明顯進展,首批創作者的實測亦揭露若干待改進之處:
- 長任務仍需專門提示:欲使 Astra 連續運作多日,須採用
/goal等特定長任務模式; - 設計風格單一:Astra 生成的頁面常帶有相似的綠色調、柔和配色與平面化設計,新意有限;
- 寫作仍帶有「AI 味」:相較前代已有提升,但文字仍可辨識為 AI 生成。
整體而言,Astra 此次提升最為明顯的面向,偏向「任務執行能力」,而非審美、寫作或產品判斷等相關能力。
七、結語:真正好用的 AI,應潤物細無聲
過去,使用者經常扮演 AI 與各種軟體之間的「傳送帶」:讓 AI 撰寫方案,再手動複製至表格或網頁;軟體報錯後,再將錯誤訊息複製回來詢問 AI。舊一代的 Agent 雖已能協助處理部分搬運作業,但仍經常卡住、做錯、跑偏,或需使用者不斷接管。
Astra 此次的突破重點,正是於同樣的任務執行過程中,大幅降低人為接管的次數,並提升整體準確率。對一般使用者而言,真正好用的 AI,應能於無形之中完成工作,低調且可靠,讓使用者減少協助與分神,使任務得以流暢完成。
讓我們一同期待大模型持續進化。















