Opus 5.5 真的太厲害了,而 GPT-6-Sol 也已經發布了

2026-09-23 14:238 分鐘 閱讀

這段影片是對同一天發布的兩款重大 AI 模型的快速初步評測:Anthropic 的 Claude Opus 5.5,以及 OpenAI 的 GPT-6 Soul/Luna。 講者認為 Opus 5.5 是最亮眼的版本,形容它比 Anthropic 先前的旗艦模型更快、更便宜也更聰明,並在基準測試上取得強勁進步,同時在程式編寫、自動化、圖形、遊戲與動畫等方面展現了令人印象深刻的實際示範。 OpenAI 的新模型則被描述為有用,但提升幅度沒那麼戲劇性,主要亮點是更低的定價與更廣泛的可用性。 整體而言,這段影片強調 AI 能力正在迅速進步,尤其是在創意與代理式任務方面,同時也預告之後會有更完整的每週總結。

關鍵信息

  • 演講者正在帕羅奧圖參加 Meta Connect 期間,回顧當天發布的重大 AI 模型公告。
  • Anthropic 發布了 Claude Opus 5.5,該模型被描述為比先前的 Claude 模型更好、更快,而且更便宜。
  • 據報導,Claude Opus 5.5 在多項基準測試中表現相當甚至超越許多模型,包括代理程式設計、程式設計,以及通用智能指標。
  • 講者強調,Opus 5.5 現已廣泛提供,而且儘管使用了更多 token,但每項任務的成本更低。
  • 這段影片展示了使用 Opus 5.5 製作的令人印象深刻的示範,包括動畫、Game Boy 模擬器、遊戲,以及基於 Blender 的作品。
  • OpenAI 也發布了 GPT-6 Soul 和 GPT-6 Luna,但它們被描述為不如 Opus 5.5 令人印象深刻。
  • GPT-6 Soul 和 Luna 據說比先前版本更便宜也更快,但不如 Anthropic 的新模型那麼強。
  • 講者比較了基準排名,指出 Opus 5.5 在某些綜合分析中領先,而 GPT-6 Soul 的排名較低。
  • 一個關鍵主題是,真實世界的輸出、示範,以及每項任務成本,比原始基準測試分數更重要。
  • 演講者總結道,Opus 5.5 是今日的主要新聞,而本週稍晚還預期會有更多 AI 公告和示範。

時間軸分析

內容關鍵字

Claude Opus 5.5

Anthropic 發布了 Claude Opus 5.5,並將其定位為新的頂級模型。 講者表示,它比 Claude 5.1 更好,比 Opus 5 更便宜,而且速度更快,在代理程式設計、編碼、電腦使用、視覺辨識以及智慧基準測試方面都表現出色。 它也已在 Claude 中向付費用戶開放。

GPT-6 靈魂與 GPT-6 月神

OpenAI 在 Anthropic 公布後不久就釋出了 GPT-6 Soul 和 GPT-6 Luna。這些模型比先前版本更便宜、速度也更快,但講者認為它們不如 Claude Opus 5.5 令人印象深刻,而且在整體表現上仍落後於 Anthropic 最強的模型。

AI 模型基準測試與成本效率

這段影片比較了各個模型在多項基準測試中的結果與定價,包括 Artificial Analysis、BusyBench、Terminal Bench 以及其他測試。 Claude Opus 5.5 在智慧評分方面領先,而 GPT-6 Soul 則展現出更好的性價比,但整體表現較弱。 主要主題是,新一代模型正在變得更具成本效益。

AI 生成的動畫和遊戲

講者強調了使用 Claude Opus 5.5 製作的令人印象深刻的示範,包括 JavaScript 動畫、Game Boy 模擬器、貪吃蛇遊戲、飛行模擬器,以及一個類《黑暗靈魂》風格的專案。 這些例子被用來展示 AI 生成的圖形、遊戲和動畫已經進步到了多麼遠的程度。

Meta Connect 與每週 AI 新聞彙總

講者正在帕洛阿爾托現場報導 Meta Connect,並提到 Meta 以及 YouTube 的 Made on YouTube 活動可能還會有更多公告。 他表示,他會在週五的整理影片中報導 Opus 5.5、GPT-6 Soul、Jev,以及其他 AI 新聞。

相關問題與答案

在影片中公布了哪些新的 AI 模型?

這段影片討論了兩項重大發布:Anthropic 的 Claude Opus 5.5,以及 OpenAI 的 GPT-6 Soul 和 GPT-6 Luna。

使用者問題是英文,且你要求翻譯文章,但目前未提供文章內容;就這個問題本身,我無法判斷「speaker」指的是哪篇文章中的說話者。如果你要我回答這個問題,請先貼上原文或相關段落。

演講者表示,Claude Opus 5.5 是主要新聞,也是最令人印象深刻的發佈。

Claude Opus 5.5 與先前的 Anthropic 模型相比如何?

據描述,它比 Claude 5.1 更好,且比 Opus 5 更便宜,同時速度也更快。

以下是對該句的繁體中文翻譯:**關於 Claude Opus 5.5 提出了哪些性能主張?**

Anthropic 聲稱,在大多數任務上,它的表現可達到 Claude 5.1 的水準,而且成本更低。

與 Opus 5 相比,Claude Opus 5.5 便宜多少?

演講者表示,它的價格比 Opus 5 低 40%。

Claude Opus 5.5 的定價變更是什麼?

據說輸入 token 的費用為每百萬 4 美元,而初始 token 的費用為 20 美元,先前則分別為 5 美元和 25 美元。

為什麼講者說,對於 Opus 5.5 而言,整體任務成本仍然沒有明顯降低?

因為儘管 token 價格下降了,Opus 5.5 每個任務使用的 token 數量卻顯著更多。

演講者提到用來評估 AI 模型的基準是什麼?

演講者提到了像 Agent Programming、Terminal Bench、Automation Bench、人文學科考試、Artificial Analysis 以及其他一些基準。

Claude Opus 5.5 在 Artificial Analysis 上得分是多少?

演講者表示,Claude Opus 5.5 以 58 分領先。

Claude Opus 5.5 在 Artificial Analysis 中與 Fable 5.1 和 GPT-6 Astra 相比如何?

講者表示,Fable 5.1 和 GPT-6 Astra 先前並列 53 分,而 Opus 5.5 現在以 58 分領先。

講者對基準測試的重要性有什麼看法?

演講者表示,基準測試的重要性不如在現實生活中真正看到、測試和使用這些模型。

以下是原文的繁體中文逐句翻譯:Claude Opus 5.5 被強調了哪些類型的示範?

這段影片展示了 AI 生成的動畫、Game Boy 模擬器、一款受安提基特拉機械啟發的遊戲、飛行模擬器、一個類似《Mario Maker》的示範,以及其他創意作品。

演講者對這些動畫示範的哪一點感到印象深刻?

講者表示,這些動畫看起來令人驚艷,而且很難相信它們是在沒有像 After Effects 之類工具的情況下生成的。

說話者首先提到的是哪個與遊戲相關的示範?

由 Claude Opus 5.5 製作的 Game Boy 測試或模擬器示範。

同一天還發布了哪一個其他 OpenAI 模型?

OpenAI 在 Opus 5.5 公布後幾個小時內,發布了 GPT-6 Soul 和 GPT-6 Luna。

GPT-6 Soul 與 Claude Opus 5.5 相比如何?

講者表示,GPT-6 Soul 更便宜也更快,但沒有 Claude Opus 5.5 那麼令人印象深刻。

GPT-6 Soul 與 OpenAI 之前的模型相比如何?

據說它比前一代 Soul 車型稍微好一些,但並沒有重大飛躍。

我可以幫你比較,但目前我沒有可靠資訊能確認 **GPT-6 Luna** 和 **GPT-6 Soul** 的正式規格或差異,因為它們可能不是已公開、可驗證的模型名稱。如果你是想要我做以下其中一種,我可以直接幫你:1. **根據你提供的文章逐句翻譯成繁體中文**2. **比較兩個模型的功能、速度、推理能力、成本**3. **整理成表格** 如果你有原文文章,請貼上來,我可以**逐句翻譯,不漏句**。

GPT-6 Luna 被描述為一個較低階的模型,價格比 Soul 更便宜,並且可供更多使用者使用。

以下是該句的繁體中文翻譯:**GPT-6 Soul 的定價變動是什麼?**

影片表示,輸入 token 成本已從每百萬個 token 4 美元降至 2 美元,而輸出 token 成本則從每百萬個 token 20 美元降至 10 美元。

抱歉,我目前沒有關於 **GPT-6 Luna** 的定價變更資訊。 如果你指的是某個特定產品、服務或官方公告,我可以幫你:1. 整理你提供的原文內容 2. 翻譯成繁體中文 3. 幫你查找/解讀定價變更的重點(如果你貼上內容)如果你有相關文章或公告,直接貼上來,我可以逐句翻譯。

演講者說,其進場價格從 20 美分減半到 10 美分,而其出場價格則從 1.20 美元降到 0.50 美元。

I’m missing the article or passage you want me to translate, so I can’t determine which model the speaker thinks is best overall.Please paste the article/text, and I’ll:1. translate it into Traditional Chinese sentence by sentence, and2. answer the question about which model is best overall.

講者個人認為 Claude Opus 5.5 是最令人印象深刻的模型,雖然排行榜上的一個 LLM 評判把 GPT-6 Soul 排在第一。

說話者對排行榜排名的看法是什麼?

講者說,對排行榜排名要持懷疑態度,並且要相信自己的眼睛。

Claude Opus 5.5 在哪裡可以使用?

講者說它幾乎在任何地方都可用,現在也可以在 Claude 中使用。

誰可以使用 GPT-6 Soul 和 GPT-6 Luna?

它們可供付費的 ChatGPT Work 和 Codex 使用者,以及 Pro、Business、Enterprise 和 EDU 使用者使用;免費和 Go 使用者則可在桌面應用程式中使用 GPT-6 Luna。

關於 **GPT-6 Soul** 和 **Luna** 的早期存取,說話者表示了什麼?

說話者表示,這些內容似乎尚未廣泛分發供搶先體驗使用,因為可參考的示範很少。

說話者對這兩次模型發布得出什麼結論?

演講者總結認為,Anthropic 的發布更具優勢,因為 Opus 5.5 比其先前的模型更快、更便宜且表現更好,而 OpenAI 的發布則相對較為溫和。

更多視頻推薦

分享至: