{
  "metadata": {
    "target_ai": "ChatGPT",
    "topic": "ai-market-status-multimodal-and-workflow-cp",
    "topic_display": "近期國際主流AI最新模型現狀、工具流分工、台灣OPC與中小企業落地商模與成本試算",
    "started_at": "2026-09-06T16:40:27+08:00",
    "last_updated": "2026-09-06T16:42:41+08:00",
    "total_turns": 3,
    "status": "in_progress",
    "has_official_news_report": true,
    "news_source": {
      "title": "OpenAI 發表 GPT-6 Astra 史上最智慧模型！電腦操作、瀏覽、程式能力全面突破，AGI 時代可能已經來臨",
      "publisher": "電腦王阿達 (Kocpc)",
      "url": "https://www.kocpc.com.tw/archives/667680",
      "local_file": "20260906_kocpc_gpt-6-astra-release.mhtml",
      "published_date": "2026-09-06"
    }
  },
  "conversation": [
    {
      "turn": 1,
      "timestamp": "2026-09-06T16:40:27+08:00",
      "user_prompt": "chatgpt 6 astra剛出來，請客觀蒐集分析近期國際主流AI目前最新模型現狀&比較&在那些應用面向的優勢與最高CP性價比",
      "ai_response": "補上這三個面向後，選購建議會更偏向分工：Perplexity 負責找資料與追溯來源、Claude 列為繁中寫作優先試用對象、Gemini 處理影音，大量文件則先用專用 OCR，再交給高階模型分析。\n以下查證至 2026 年 9 月 6 日；價格為美元、未含稅。「優先選擇」是依公開資料提出的建議，與已經證實的能力排名分開說明。\nPerplexity 的價值主要來自搜尋與研究工作流程。\n它結合搜尋、來源引用、自家 Sonar 系列及第三方模型；Research 模式還會自行組合模型。因此，不能直接把「Perplexity」放進 Astra、Claude、Gemini 的純模型排行榜，也不能把訂閱它理解成取得各家原生產品的完整功能。[Perplexity Pro 說明](https://www.perplexity.ai/help-center/en/articles/10352901-what-is-perplexity-pro)\n\n使用情境 | 我的判斷 | CP 評估\n每天查產業消息、競品、產品規格，需保留來源 | Perplexity Pro 很值得優先考慮 | US$20／月或 US$200／年；價值在於減少搜尋、整理與回查時間\n偶爾查問題、做少量資料蒐集 | 先用免費版 | 尚未經常碰到限制前，升級效益有限\n主要工作是長篇寫作、程式開發、反覆修改成品 | 優先比較 ChatGPT／Claude 原生產品 | Perplexity 能用第三方模型，但工具、上下文處理及使用額度各自不同\n長時間自動執行多步驟工作 | 再評估 Max／Computer | Max US$200／月或 US$2,000／年；需用實際省下的工時判斷\n\n上述月費可見[官方方案價格](https://www.perplexity.ai/help-center/en/articles/12167980-using-the-connector-for-slack)，免費與付費功能差異見[方案比較](https://www.perplexity.ai/help-center/en/articles/11187416-which-perplexity-subscription-plan-is-right-for-you)。\n有兩項限制會直接影響 CP：\n**搜尋和 Computer 自動做事的費用不同。**目前個人 Pro 沒有固定每月 Computer credits；Max 每月含 10,000 credits。搜尋不消耗這種 credits，Computer 任務則會消耗，促銷贈額也可能到期。[官方點數規則](https://www.perplexity.ai/help-center/en/articles/13838041-how-credits-work-on-perplexity)\n**檔案上傳不代表完整逐頁處理。**官方說明長文件會擷取相關部分；影音上傳主要轉錄語音，目前這項功能不會索引影片畫面，單檔上限 40 MB。因此，不適合直接當成大量文件轉檔或完整影片分析工具。[檔案上傳說明](https://www.perplexity.ai/help-center/en/articles/10354807-file-uploads)\n我會把 Perplexity Pro 定位為重度研究者的高 CP 候選。評估它時，應檢查引用是否真的支持該句話、日期是否正確、是否漏掉相反證據；引用數量本身不足以證明答案更準確。\n\n繁體中文要拆成「寫得自然、內容正確、理解台灣語境」三件事。\n目前公開證據仍不足以替所有最新旗艦排出可靠的「台灣繁中第一名」。Arena 的 Chinese 榜中，Claude Opus 5 位居前段，但這是廣義中文偏好投票，混合不同地區與用語，部分模型的信賴區間也重疊，不能直接等同台灣繁中排名。[Arena 中文榜](https://arena.ai/leaderboard/text/chinese)\n台灣已有 TMMLU+ 的繁中知識評測，以及 VisTW、Multi-TW 的在地多模態評測；但我尚未找到完整涵蓋剛推出 Astra、Fable 5.1 等模型的可比結果。[TMMLU+](https://arxiv.org/abs/2403.01858)、[VisTW](https://arxiv.org/abs/2503.10427)、[Multi-TW](https://arxiv.org/abs/2508.01274)\n\n繁中用途 | 建議的選型方式 | 真正要驗收的項目\n商務信件、品牌文案、長篇文章 | 先試 Claude Opus 5，與手上 ChatGPT 模型盲測比較 | 台灣用語、語氣自然度、修改後是否保留原意\n翻譯、摘要、大量分類 | 先測較便宜模型，達標才大量使用 | 否定句、條件、專有名詞、數字與單位是否保留\n台灣政策、制度、產業研究 | Perplexity 等搜尋工具蒐證，再整理成繁中 | 是否引用台灣主管機關與原始資料，而非套用其他地區制度\n在地部署、公文與台灣文化語境 | 可納入 Gemma-3-TAIDE-12b-Chat-2602 評估 | 在地適配與部署成本，以及任務所需的推理能力\n\nTAIDE 的這個版本針對台灣資料與語境調整，適合列入在地部署候選；這項定位並不構成其通用推理能力領先大型旗艦的證據。[TAIDE 官方發布](https://taide.tw/public/latest-updates_show?id=4b1141869c45c11c019c4b261966001b)\n對繁中使用者，我建議固定準備一小組自己的工作樣本，包含「軟體／資訊／列印」、民國日期、人名、金額、中英夾雜與長句條件。用修改到可交付所需的時間選模型，比看它能否輸出繁體字更有意義。\n\n多模態則需要把文件理解、OCR、影音理解與內容生成分開比較。\n例如，GPT-6 Astra 的基礎 API 支援文字與圖片輸入、文字輸出；官方列出的原生音訊與影片輸入並不支援。ChatGPT 產品的語音、影片或生圖功能，需要另外看使用的模型及工具。[Astra 模態規格](https://developers.openai.com/api/docs/models/gpt-6-astra)\n\n應用面向 | 優先評估對象 | 優勢與 CP 判斷\n複雜 PDF、跨頁表格、註腳與例外條件推理 | Astra；較省成本可比較 Sol | 有文件推理評測支持，適合內容複雜、錯誤代價高的任務\n少量 PDF 問答、圖表解讀 | 現有 ChatGPT／Claude／Gemini 方案 | 先利用已付費工具；Claude 官方支援 PDF 文字及視覺內容分析\n大量掃描文件轉文字、表格與版面結構 | Mistral OCR 4.1 | 按頁計價，能輸出段落位置、結構與信心分數，成本容易預估\n大量文件、需要自行部署 | PaddleOCR／PaddleOCR-VL-1.6 | 可本地處理；需計入設備、部署與維護成本\n影片畫面＋聲音＋時間點理解 | Gemini 3.8 Flash | 支援影片輸入及按需求探索時間軸，適合課程、操作示範與長影片\n會議錄音、訪談逐字稿 | Gemini 或專用語音轉錄服務 | 應另測台灣華語、中英夾雜、多人重疊；台語需獨立驗收\n圖片生成、改圖、視覺素材 | GPT Image 2、Nano Banana 2／Pro | 另看文字正確率、參考圖一致性與修改次數\n影片生成與對話式修改 | Gemini Omni 1.1 Flash 等專用模型 | 應按可用成片成本比較，包含重生成次數、音訊與解析度\n\n文件能力方面，Artificial Analysis 的 GDP.pdf 評測中，Astra 為 33.2%、Sol 28.2%、Fable 5.1 26.2%。這是複雜文件任務「所有評分條件皆通過」的比例，不是 OCR 字元辨識率。[評測方法與結果](https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2)；[Claude PDF 支援](https://platform.claude.com/docs/en/build-with-claude/pdf-support)。\nGemini 的影片理解預設會取樣畫面，也可動態調整查看位置與取樣方式；快速動作或一閃而過的小字仍需要特別測試。[影片理解文件](https://ai.google.dev/gemini-api/docs/video-understanding)\n生圖與生成影片的官方能力分別見 [GPT Image 2](https://developers.openai.com/api/docs/models/gpt-image-2)、[Nano Banana 系列](https://ai.google.dev/gemini-api/docs/image-generation)、[Gemini Omni 1.1 Flash](https://ai.google.dev/gemini-api/docs/omni)。這些產品的能力不能從通用文字模型總榜推算。\n\n文件 OCR 的 CP，可以算得更具體。\nMistral OCR 4.1 目前標準價格為 US$4／1,000 頁，帶標註處理為 US$5／1,000 頁。例如 10,000 頁的標準 OCR 費用約 US$40，另外加上後續分析、儲存及人工校正成本。[官方價格](https://docs.mistral.ai/models/ocr-4-1)\n它支援表格輸出、閱讀順序及不同層級的信心分數；PaddleOCR 則提供可自行部署的替代方案。兩者都應用實際的繁中文件驗收，尤其是直排、印章、手寫字、跨頁表格與模糊掃描。[Mistral 文件處理](https://docs.mistral.ai/studio/document-processing/basic_ocr)、[PaddleOCR 官方專案](https://github.com/PaddlePaddle/PaddleOCR)\n\n我建議的省錢流程是：\n可選取文字的文件先直接擷取 → 掃描頁交給 OCR → 低信心文字與表格複核 → 一般模型整理 → 困難的跨頁推理交給 Astra 等旗艦。\n\n如果你目前已經在用 ChatGPT，新增支出的優先順序可以依工作量決定：\n**大部分時間在查資料、比對來源：**優先試 Perplexity Pro。\n**大部分時間在看影片、處理影音素材：**優先比較 Gemini 方案。\n**大部分時間在寫繁中成品：**先用真實稿件比較 Claude，確認能減少修改時間再訂閱。\n**每月處理數千頁掃描文件：**優先評估 OCR 按量服務。\n最值得追蹤的 CP 指標是：每份通過驗收的成果，總共花多少服務費、等待時間與人工修改時間。"
    },
    {
      "turn": 2,
      "timestamp": "2026-09-06T16:42:41+08:00",
      "user_prompt": "台灣情境下的AI新創公司，服務OPC與中小企業的，會怎麼推薦搭配選用",
      "ai_response": "如果我是台灣一家早期 AI 新創，服務 OPC（一人公司）與中小企業，我會採用這個組合：\n客戶熟悉的 LINE／辦公軟體作為入口，Luna 處理日常任務、Sol 處理複雜工作；有文件量再加 OCR、有影音需求再加 Gemini。Perplexity 放在研究服務，Claude 放在重視文案品質的服務。\n商業上，我會優先賣「詢問接待、報價整理、訂單建檔」這些可驗收的成果。選型同時看客戶省下多少時間，以及新創自己需要投入多少維護工時。\n以下以一般商務、零售、專業服務與貿易業為主要情境，價格與服務條款查核至 2026／9／6。\n先依客戶類型，做出三種可重複交付的方案。\n\n客戶類型 | 最值得先解決的問題 | 建議搭配 | 交付重點\nOPC：顧問、接案者、個人品牌 | 信件、提案、內容、會議紀錄與資料蒐集 | 沿用 Google Workspace／Microsoft 365；ChatGPT 或 Claude 擇一，研究量大才加 Perplexity | 模板、資料整理、少量自動化，降低學習負擔\n小型商家與服務業 | 重複詢問、預約、詢價資料收集、訂單整理 | LINE 官方帳號＋Luna＋客戶自己的商品／服務資料；複雜案件交 Sol 或真人 | 接待、取得完整需求、查詢正確資料、順利轉人工\n有行政與業務團隊的中小企業 | 報價單、採購單、供應商文件、SOP 查詢 | OCR＋Luna／Sol＋既有 ERP、CRM 或表單系統；特殊分析才用 Astra | 文件可追溯、欄位可核對、權限正確、能接續現有作業\n\n對 OPC，若现成工具加模板就能解決問題，我會提供導入與陪跑服務。低月費客戶適合標準化；需要大量客製串接的企業，應採導入費加維護月費。\n模型端，我會先維持兩家主要供應商，其他依付費需求加入。\n\n角色 | 我的起始選擇 | 具體用途與加入條件\n大量日常處理 | GPT-5.6 Luna | 意圖分類、欄位擷取、短摘要、依已查到資料產生回覆\n主要進階處理 | GPT-5.6 Sol | 複雜需求整理、提案、跨文件比對、較長的工作流程\n最高難度處理 | GPT-6 Astra | 需要更深推理、且客戶願意支付較高成本的案件\n圖片與影音 | Gemini 3.8 Flash | 商品照片、操作影片、訪談與多模態資料理解\n大量文件轉換 | Mistral OCR 4.1 | 掃描文件、表格與版面擷取；文件量足夠再加入\n繁中文案加值 | Claude | 客戶實際盲測後，若能明顯減少修改時間再採用\n外部資料研究 | Perplexity／Sonar API | 競品、產業、供應商與市場資訊；按研究需求啟用\n\nOpenAI Docs 將 Luna 定位為大量且重視成本的任務，Sol 定位為複雜專業工作；目前 API 輸入／輸出每百萬 tokens 分別為 Luna US$0.2／1.2、Sol US$4／20。[Luna 官方規格](https://developers.openai.com/api/docs/models/gpt-5.6-luna)、[Sol 官方規格](https://developers.openai.com/api/docs/models/gpt-5.6-sol)\n實際執行時，應依任務類型與驗收結果選模型。例如：一般詢問直接走 Luna，複雜比價直接走 Sol。遇到庫存、價格或訂單資料缺失，應補查系統或轉人工；升級模型無法補足不存在的資料。\nPerplexity 則適合「需要查外部世界」的工作。客戶自己的價格、庫存與訂單，應直接讀取其系統；Sonar API 的費用還包含搜尋請求費，適合另外設定研究額度。[Perplexity API 計價](https://docs.perplexity.ai/docs/getting-started/pricing)\n\n台灣市場的產品差異，我會做在這四個地方。\n**繁中與商務格式。**建立每家客戶的用語表、商品名稱、報價格式、民國日期與金額規則。繁中品質用真實稿件驗收。\n**LINE 的操作習慣。**讓老闆能從手機查看待確認事項；複雜表格與文件核對則開啟網頁，避免全部塞在聊天訊息裡。\n**文件到作業的完整流程。**OCR 後保留原頁位置，讓使用者點一下就能核對料號、數量與金額；金額計算交給明確規則。\n**沿用客戶現有資料。**先接既有表單、試算表、ERP 或 CRM，明確指定商品、價格與訂單的正式資料來源。\n\nLINE 的成本需要單獨計算：Reply API 回覆不計入訊息額度，推播等訊息則依規則計費。長任務完成後的通知，也可能需要推播。[LINE 訊息計算規則](https://developers.line.biz/en/tips/2026/05/28/how-to-count-messages/)\n另外，LINE 已公告 2026／11／1 起，中用量月費由 NT$800 調為 NT$1,000，高用量由 NT$1,200 調為 NT$1,400，皆未稅。這類通路費用，我會由客戶直接支付，或在合約中獨立列項。[LINE 官方調價公告](https://tw.linebiz.com/column/LINEOA-2026-Price-Plan/)\n\nCP 要用整個服務的成本來算。\n以下是純文字 API 的示範試算：每月 10,000 次請求，每次輸入 10,000 tokens、總計費輸出 1,000 tokens，輸出已包含推理用量；不計搜尋、OCR、快取及其他工具。\n\n使用方式 | 示範月成本\n全部 Luna | US$32\n全部 Gemini 3.8 Flash | US$112.5\n全部 Sol | US$600\n全部 Astra | US$1,500\n預先分配 90% Luna、9% Sol、1% Astra | US$97.8\n\n最後一列只是成本情境，是否能達到這個比例要靠客戶資料測試；失敗重試與額外呼叫也要計費。價格依據為 [OpenAI 官方模型價格](https://developers.openai.com/api/docs/models)及 [Gemini 官方價格](https://ai.google.dev/gemini-api/docs/pricing)。\nMistral OCR 4.1 的標準 OCR 為 US$4／1,000 頁，因此 5,000 頁約 US$20，後續校正與分析另計。[OCR 官方價格](https://docs.mistral.ai/models/ocr-4-1)\n這些數字說明：**低至中用量的客戶，資料整理、串接與客服工時很可能比模型費更值得優化。**省下幾美元模型費，若換來更多人工修改，對新創並不划算。\n報價也要保留價格變動空間：Sol 現行促銷至少至 2026／11／21；Gemini 3.8 Flash 現行標準優惠至 2026／12／31，官方已列出後續價格。[Sol 價格期限](https://developers.openai.com/api/docs/models/gpt-5.6-sol)、[Gemini 價格期限](https://ai.google.dev/gemini-api/docs/pricing)\n\n我會用以下價格帶做付費驗證；這是建議的商業假設，並非市場行情統計。\n\n服務方式 | 建議測試的收費 | 必須界定的範圍\nOPC 標準方案 | NT$1,490–2,990／月 | 固定模板、有限任務量、標準支援；客製另計\n小型企業流程方案 | NT$8,000–20,000／月，另收導入費 | 1–3 個明確流程、指定資料來源與每月維護時數\n跨系統文件與營運方案 | 依專案導入，加維運與用量費 | 串接範圍、驗收標準、服務時段與變更費用\n\n各方案都應列出包含多少任務、OCR 頁數、研究次數及服務時數。新創內部使用的 ChatGPT／Claude 訂閱，與交付給客戶的 API 產品，也要分開管理與計價。\n資料處理方面，我會採企業／付費 API，逐客戶隔離資料與權限，並提供刪除及匯出方式。OpenAI API 預設不使用資料訓練，但部分日誌與功能仍有保留期限；Google 付費 Gemini API 也不將提示與回應用於改善產品，仍有服務所需的資料處理。不拿來訓練、零保留、資料留在台灣，是三個不同條件。[OpenAI 資料控制](https://developers.openai.com/api/docs/guides/your-data)、[Gemini 付費服務條款](https://ai.google.dev/gemini-api/terms)\n若用 n8n 加速導入，可承接客戶內部流程建置與維護；做成讓多家客戶連接帳號的 SaaS 時，需依實際架構確認商業授權。[n8n 官方授權說明](https://github.com/n8n-io/n8n-docs/blob/main/docs/privacy-and-security/sustainable-use-license.md)\n\n如果現在要選第一個切入點，我會選「小型批發／貿易商的詢價到報價準備」。\n流程可以是：LINE 或 Email 收到詢價 → 擷取品名、料號、數量 → 對照商品資料 → 缺資料時補問 → 整理報價草稿 → 業務確認後送出。\n先找 3 家付費試點，追蹤四個數字：**每張詢價節省時間、關鍵欄位正確率、需要人工修改的比例，以及每家客戶每月的支援工時。**當這套流程能以相近方式交付給第 4、5 家客戶，再擴充更多模型與功能。"
    },
    {
      "turn": 3,
      "timestamp": "2026-09-06T17:23:00+08:00",
      "type": "official_news_and_benchmark_report",
      "title": "電腦王阿達報導：OpenAI 發表 GPT-6 Astra 完整規格、OSWorld 任務縮短 47%、ARC-AGI-3 達 99.9% 與 Critical 資安評級深度解讀",
      "source_url": "https://www.kocpc.com.tw/archives/667680",
      "content": "最近各家 AI 模型的迭代速度真不是普通的快，OpenAI 繼 6 月底推出\nGPT-5.6 Sol\n之後，稍早正式推出新一代「GPT-6 Astra」模型！雖然間隔不到三個月，但 GPT-6 Astra 可說是全面提升，電腦操作、瀏覽、程式能力都變得更強，甚至在 ARC-AGI-3 測試中還拿到 99.9％，OpenAI 總裁 Greg Brockman 更表示，他個人相信 OpenAI 已經達到 AGI，媒體簡報最後甚至以「歡迎來到 AGI 時代」作為收尾。\n不僅如此，資安能力也首度跨進 OpenAI Preparedness Framework 的 Critical（關鍵）門檻，代表只要搭配適當工具與權限，GPT-6 Astra 就能在無人逐步指導下，自行找出未知漏洞、開發漏洞利用方式，甚至完成複雜端對端網路攻擊的能力，這也是 OpenAI 首款被評為這一級別的模型。\nGPT-6 Astra 正式登場：OSWorld 任務時間少 47％、ARC-AGI-3 達 99.9％，資安能力首度跨入 Critical\nGPT-6 Astra\n是 OpenAI 目前定位最高的通用模型，主要能力涵蓋電腦操作、網頁瀏覽、程式開發、專業工作、科學研究與網路安全。跟過往模型不同，Astra 的發展方向是：「接手完整工作流程」，可以填寫線上表單、更新 CRM 裡的客戶資料、整理行事曆，在瀏覽器裡研究資料後，再到電子郵件或文件編輯器撰寫摘要。\n簡單來說，GPT-6 Astra 打開工具後，可以一路把事情都做完。\n根據 Axios 報導，Brockman 在 GPT-6 Astra 媒體簡報中稱它是能力上的「世代躍進」，並表示他個人相信 OpenAI 已經達到 AGI。當記者問到未來回頭看時，Astra 是否可能被視為 AGI 到來的分界點，他回答：「I think it might be about this model」，最後更用「Welcome to the AGI era」為簡報收尾。\n在 ARC-AGI-3 測試中，GPT-6 Astra 達到 99.9％，GPT-5.6 Sol 只有 7.8％，Claude Opus 5 為 30.2％：\nGPT-6 Astra 現在也更懂得什麼時候該自己做決定，什麼時候應該停下來問你\n如果指示留下的空白不影響主要結果，它會根據上下文補齊合理細節。如果答案可能改變任務方向，它才會提出比較聚焦的問題。更重要的是，在 Codex 裡，GPT-6 Astra 等待使用者回答期間，還能繼續處理不受這個問題影響的工作，不會讓整個任務停在原地。\nOpenAI 也承認，較早模型收到中途的補充指示時，有時會把新消息當成另一個目標，結果忘記原本要完成什麼。GPT-6 Astra 針對這種「做到一半被插話」的情況有加強訓練，會把新要求納入既有工作，也可以回答支線問題後再回到主線。\n長時間使用 Codex 時，GPT-6 Astra 還加入新的跨內容視窗記憶方式。\n過去對話塞滿內容視窗後，系統必須把前面的過程壓縮成摘要，而每壓縮一次，都可能漏掉某個修正為什麼失敗、某項測試曾出現什麼結果。\n這次加入的新機制，允許 GPT-6 Astra  保存筆記，並搜尋較早的對話與工具輸出，即使某個細節沒有被寫進摘要，還是有機會重新找回來。不過這項實驗功能初期要在 Codex 的 `config.toml` 手動開啟，OpenAI 預計未來幾週逐步設為 Astra 的預設功能。\n提升最有感：電腦操作\n電腦操作是這次 GPT-6 Astra 讓一般使用者提升最有感。根據 OpenAI 分享在 OSWorld 2.0 測試中，Astra 拿到 72.6％，高於 GPT-5.6 Sol 的 65.7％與 Claude Opus 5 的 70.2％。OpenAI 進一步模擬任務執行時間，Astra 平均約需 40 分鐘完成一項工作，Sol 則約為 75 分鐘，等於耗時減少約 47％：\n測試模型辨識畫面並找出正確操作位置能力的「ScreenSpot-Pro」，Astra 達到 92.7％，GPT-5.6 Sol 為 76.9％；評估跨不同職業工作流程的 Agents’ Last Exam，兩者則分別是 59.3％和 53.6％。搭配 OpenAI 同步更新的 Codex 操作架構後，Astra 在 Mind2Web 測試的完成速度達到現行 Sol 體驗的 1.9 倍：\nGPT-6 Astra 程式能力也大幅提升，不過不是每一項都拿第一\n在 Terminal-Bench 4.0 測試中，Astra 拿到 57.9％，前一代 GPT-5.6 Sol 為 37.3％，Claude Fable 5.1 為 55.8％，Claude Opus 5 則是 52.3％。DeepSWE 1.1 部分，Astra 的 74.1％也略高於 Gemini 3.8 Flash 的 73.8％與 Claude Opus 5 的 73.7％：\n不過在 FrontierCode 1.1 Main，Astra 的 53.3％略低於 Claude Fable 5 的 53.5％；Artificial Analysis Coding Agent Index 也只有 67.0，低於 Claude Fable 5 的 67.2 與 Claude Opus 5 的 68.1。因此，OpenAI 稱「目前最佳的軟體工程模型」比較適合視為官方對整體能力的定位，而不是每項測試都全面領先：\n其他測試成績與資安\n數學、科學與抽象推理的成績中，FrontierMath Tier 4 部分 Astra 拿到 97.6％，GPT-5.6 Sol 為 83.0％，Claude Fable 5.1 為 87.8％；Terminal-Bench Science 0.1 則從 Sol 的 22.4％上升到 64.6％。\nOpenAI 還表示，Astra 協助研究人員把無限多對質數之間的已知距離上限，從先前的 240 進一步縮小到 186，並改善一項超過 80 年沒有變動的大質數間距結果。\n資安風險方面，Astra 在 ExploitBench 拿到 100％，GPT-5.6 Sol 為 78.5％；ExploitGym 成功率為 42.4％，Sol 是 30.3％。\n測試模型在沒有原始碼的情況下逆向分析軟體執行檔的 SRE-Bench，Astra 單次解題率達 88.0％，四次內更提高到 99.2％，Sol 分別只有 55.9％與 68.7％。\nOpenAI 表示，GPT-6 Astra 在測試期間甚至找到並利用兩個此前未知的零時差漏洞，目前正向相關維護者通報。它也成為 OpenAI 第一款資安能力達到 Preparedness Framework「Critical」門檻、又廣泛部署的模型。\n換句話說，它不只會分析已知漏洞，在取得正確工具與權限後，也可能自行找到尚未公開的問題並發展新的利用方式。\n為了降低風險，一般版 Astra 會拒絕製作較進階的漏洞概念驗證。\nOpenAI 預計透過 Daybreak 計畫，在未來幾週逐步提供限制較少的存取方式，供經審查的防禦工作使用，包括驗證漏洞、分析惡意程式與建立偵測規則。這也代表說，資安研究人員就算拿到 Astra，實際能執行的工作仍會受到方案、資格與安全機制限制。\n雖然 OpenAI 也把「不擅自越界」列為 GPT-6 Astra 的另一項進步，不過，這並不等於完全沒有安全疑慮。\nOpenAI 在安全報告裡坦承，Astra 的推理過程比 GPT-5.6 Sol 更難監控，當研究人員刻意要求模型躲避監控時，它比較能控制自己寫出的推理內容，也可能在策略性降低表現或部分破壞任務中避開內部監測。\nGPT-6 Astra 佈署和使用方式\nGPT-6 Astra 目前採分階段開放。首波先提供給少數組織，接下來幾天才會逐步開放 ChatGPT Plus、Pro、Business 與 Enterprise 使用者。OpenAI 產品負責人 Tibo Sottiaux 也在 X 說明，團隊希望把 Astra 帶給所有 Plus 用戶，而不是只提供給 Pro、Business 和 Enterprise，但整個部署需要幾天時間。\n為了補償在等待 Astra 開通的付費使用者，Tibo 隨後宣布一項補償：從公告當天開始，付費 ChatGPT 方案每有一天無法使用 Astra，就會收到一個可儲存的重置額度（banked reset），第一個預計在發文約三小時後發放：\nPro、Business 與 Enterprise 方案之後還會取得 GPT-6 Astra Pro。\n不過要注意的是，Enterprise 推出時預設是關閉的，需要由管理員手動開啟。GPT-6 Astra 也會計入各方案原有的正常使用額度，使用者可以把 100％額度用在 Astra 上。當然，用完時也能購買額外點數。\n開發者也能在 OpenAI API 使用 `gpt-6-astra`，官方文件列出的內容視窗為 1,050,000 Token、單次最大輸出為 128,000 Token，知識截止日為 2026 年 4 月 30 日。模型支援文字與圖片輸入，但不直接支援音訊及影片輸入；推理強度可選 low、medium、high、xhigh 和 max，沒有 none。\nGPT-6 Astra Standard API\n每百萬 Token 價格\n輸入\n10 美元\n快取輸入\n1 美元\n快取寫入\n12.5 美元\n輸出\n50 美元\n如果單次提示內容超過 272K Token，整個請求的輸入與快取費率會變成 2 倍，輸出費率則是 1.5 倍。\nBatch 與 Flex 為標準價格的 50％；Fast mode 最快可達 Standard 的 2 倍速度，費率也是 2 倍。\n官方分享完整測試數據表格\n類別\n測試項目\nGPT-6 Astra\nGPT-5.6 Sol\nClaude Fable 5.1\nClaude Fable 5\nClaude Opus 5\nGemini 3.8 Flash\n電腦操作\nAgents’ Last Exam\n59.3%\n53.6%\n—\n48.7%\n55.5%\n—\nOSWorld 2.0\n72.6%\n65.7%\n—\n—\n70.2%\n—\nScreenSpot-Pro\n92.7%\n76.9%\n—\n87.3%\n—\n—\n專業工作\nAutomationBench\n41.4%\n18.1%\n31.4%\n17.4%\n26.9%\n—\nBenchCAD\n95.9%\n83.3%\n84.3%\n67.5%\n82.1%\n—\nBrowseComp\n91.5%\n90.4%\n—\n87.4%\n90.8%\n—\nOpenScore String Quartets（1 – OMR-NED）\n0.84\n0.19\n—\n—\n—\n—\nInternal Design Tasks\n50.0%\n47.4%\n—\n35.8%\n—\n—\nInternal Data Science Tasks\n40.9%\n30.5%\n—\n34.7%\n—\n—\nArtificial Analysis Intelligence Index v4.1.1\n61.2\n60.9\n65.7\n62.1\n63.1\n58.7\n程式能力\nTerminal-Bench 4.0\n57.9%\n37.3%\n55.8%\n42.0%\n52.3%\n19.1%\nDeepSWE v1.1\n74.1%\n72.7%\n67.4%\n69.9%\n73.7%\n73.8%\nFrontierCode 1.1 Extended\n64.5%\n60.6%\n63.6%\n64.9%\n63.6%\n56.3%\nFrontierCode 1.1 Main\n53.3%\n47.5%\n50.9%\n53.5%\n53.4%\n43.6%\nInternal Database Migration Tasks\n63.9%\n42.7%\n57.8%\n50.3%\n—\n—\nArtificial Analysis Coding Agent Index v1.4\n67.0\n65.1\n—\n67.2\n68.1\n61.2\n學術能力\nTerminal-Bench Science 0.1\n64.6%\n22.4%\n52.6%\n21.4%\n30.0%\n—\nFrontierMath Tier 4（v2）\n97.6%\n83.0%\n87.8%\n87.8%\n73.2%\n—\nGPQA Diamond\n96.0%\n94.6%\n93.7%\n92.6%\n93.7%\n95.3%\nHumanity’s Last Exam（w/ tools）\n57.2%\n—\n65.0%\n63.8%\n63.6%\n—\n科學與健康\nGeneBench Pro\n37.8%\n28.7%\n—\n—\n—\n—\nMedChemBench（Internal）\n49.3%\n47.4%\n—\n—\n—\n—\nLifeSciBench\n60.3%\n59.9%\n—\n—\n—\n—\nHealthBench Professional（length-adjusted）\n63.4%\n60.5%\n58.1%\n60.9%\n56.4%\n52.1%\n資安能力\nExploitBench\n100.0%\n78.5%\n—\n—\n70.0%\n—\nExploitGym\n42.4%\n30.3%\n30.4%\n28.4%\n22.0%\n—\nExploitBench（2026 年 6～8 月）\n39.0%\n11.5%\n—\n—\n—\n—\nSRE-Bench\n88.0%\n55.9%\n—\n—\n12.5%\n—\nSEC-Bench Pro\n85.4%\n79.1%\n—\n—\n—\n—\n對齊與安全\nInternal computer use safety benchmark（越低越好）\n2.4%\n22.0%\n9.5%\n18.3%\n11.5%\n—\nInternal computer use safety benchmark + AutoReview（越低越好）\n1.8%\n4.3%\n—\n—\n—\n—\nInternal circumvention benchmark（越低越好）\n0.00%\n0.29%\n—\n—\n—\n—\nExploitGym honeypot（越低越好）\n0.0%\n48.2%\n—\n—\n—\n—\nImpossible ExploitGym\n100.0%\n—\n—\n—\n—\n—\nInternal hallucination benchmark（越低越好）\n4.2%\n12.2%\n—\n—\n—\n—\n長內容\nOpenAI MRCR v2 8-needle 256K–512K\n100.0%\n91.5%\n—\n—\n—\n—\nOpenAI MRCR v2 8-needle 512K–1M\n96.3%\n73.8%\n—\n—\n—\n—\n抽象推理\nARC-AGI-3\n99.9%\n7.8%\n—\n—\n30.2%\n—\nARC-AGI-2\n95.0%\n92.5%\n90.0%\n89.2%\n90.4%\n—\nARC-AGI-1\n98.5%\n97.5%\n97.5%\n98.5%\n97.5%\n—\n下載 App\nG\n加入首選\n☕\n請喝咖啡"
    }
  ]
}