AI編碼模型王座爭奪戰 Kalshi與專家對冠軍看法分歧

商傳媒|責任編輯/綜合外電報導
在預測市場平台 Kalshi 上,一項引人注目的合約正吸引著人工智慧領域的關注。這項合約將預測哪家公司旗下的 AI 模型,能在 2026 年 12 月 31 日北美東部時區上午 10 時,於 LiveBench.ai 平台的「Coding Average」(編碼平均)榜單上奪冠。Kalshi 平台是一個提供預測市場(類似於體育博弈,但涵蓋各種事件結果)的線上交易所,讓用戶能根據對未來事件的判斷進行交易。
LiveBench.ai 的「Coding Average」分數由程式碼生成與程式碼完成任務所組成,且平台會定期改寫問題,以防止模型單純記憶答案。一旦期限過後,榜單的任何修訂都不會被採納。
目前,Anthropic 公司旗下的 Claude Fable 5 模型在 LiveBench.ai 的「Coding Average」榜單上暫居首位,獲得 85.99 分。然而,Claude Fable 5 的發展並非一帆風順。該模型於今年 6 月 9 日宣布,三天後即因美國出口管制而被迫暫停使用。雖然 Anthropic 已於 7 月 1 日重新上線該模型,並聲明導入新的安全分類器,但這也以犧牲部分良性請求(指日常編碼與除錯任務)的辨識精準度為代價。有專家認為,目前的 85.99 分已是經過安全分類器調整後的成績。
與此同時,OpenAI 公司在「Coding Average」榜單上表現強勁,前六名中有四個席次由其模型佔據,包括 GPT-5.6 Sol(83.94 分)、GPT-5.2 Codex(83.62 分)和 GPT-5.6 Luna(82.91 分)。專家評審團的八位成員中,有七位指出,OpenAI 的 GPT 5.6 系列中缺乏 Codex 品牌的模型,是今年底前最可能改變市場局勢的關鍵因素。
谷歌的 AI 模型表現相對落後,其 Gemini 3.7 Flash 模型以 78.89 分位居第十六名。報導指出,谷歌 DeepMind 團隊在推出 Gemini 3.5 Pro 時面臨內部延遲,因難以達到內部設定的性能目標。儘管如此,谷歌仍被專家評審團視為潛在競爭者,因為該公司是除了 Anthropic 和 OpenAI 之外,唯一曾領先 LiveBench.ai 「Coding Average」榜單的公司。月之暗面的 Kimi K3 以 81.45 分位居第九,而 Abacus.AI, Inc. 旗下的 Smaug-Agentic 模型(由月之暗面的 Kimi K3 微調而成)以 82.47 分排名第五,但 Abacus.AI, Inc. 並未在 Kalshi 平台上有交易合約。
Kalshi 平台的市場交易者目前看好 Anthropic,其合約出價接近六十美分,顯示市場認為 Anthropic 擁有兩分的領先優勢。然而,由八位專家組成的 AI 評審團(本文指由不同領域專家針對特定 AI 議題進行評估與預測的團體)則有不同看法。他們給予 Anthropic 的中位數預測機率為 35.0%,而 OpenAI 則略高一籌,達到 36.7%。評審團還預測,若最終由未在 Kalshi 平台上列名的公司奪冠,其機率為 9.5%。目前在 Kalshi 平台上,DeepSeek、阿里巴巴和百度並無出價紀錄。
專家評審團認為,OpenAI 若能在年底前推出 Codex 品牌的模型,或是 Anthropic 推出一個分數超越 85.99 的全新前沿模型,都可能大幅改變目前的競爭格局。此外,第四季若有新的開源模型推出,也可能推升「未列名公司」獲勝的機率,並降低所有已列名公司的勝率。Kalshi 的合約條款規定,若 LiveBench.ai 的榜單上由未列名的公司奪冠,所有現有九份合約將歸零。