27B 量化大型語言模型 編碼效能媲美頂尖 AI

商傳媒|責任編輯/綜合外電報導
根據科技媒體《Wccftech》報導,一款經 4 位元(4-bit)量化處理的 270 億參數大型語言模型(LLM,一種基於巨量資料訓練的 AI 模型,能理解並生成人類語言),Qwen3.8-27B,在某項特定的編碼基準測試(coding benchmark,用於評估 AI 模型程式開發能力的標準化測驗)任務中,展現出足以媲美甚至超越頂尖雲端 AI 模型的優異表現。
這款相對較小型的模型,在 DeepSWE 編碼基準測試的一個單一任務中,通過了 98% 的測驗,更在程式碼審查任務中取得 12 分滿分。報導指出,即使是業界頂尖的雲端模型,在同樣的任務中平均通過率約為 96.6%,且僅約三分之二的機會能完美無瑕地完成。雖然在 DeepSWE 整個 113 個任務的基準測試中,頂尖雲端模型平均仍能獲得約 70% 至 74% 的分數,但 Qwen3.8-27B 在單一任務上的出色表現,凸顯了量化技術的潛力。
「量化模型」指的是透過降低模型權重數值精確度來縮減模型大小,進而降低硬體運行門檻的技術。Qwen3.8-27B 的 4 位元版本大小約在 13GB 到 18GB 之間,這意味著它可以在配備足夠 GPU 記憶體的現代電腦硬體上運行。舉例來說,在具備 24GB VRAM 的 NVIDIA RTX 4090 顯示卡上,Qwen3.8-27B 可以每秒處理 115 個 Token(用於表示文字或程式碼的最小單元),運作速度流暢且能充分利用顯示卡資源。
不過,一位進行這項測試的 Reddit 用戶強調,該結果僅來自單一任務,不代表 Qwen3.8-27B 在所有方面都全面超越頂尖模型。該用戶也澄清,儘管該模型通過了 43 個隱藏測試中的 40 個,但其提交結果並未完全解決該任務(二元結果為零),且 98% 的通過率可能受到其通過 109 個既有測試的影響。儘管如此,中型 LLM 在消費級硬體上處理實際程式開發任務時,已屢次證明其卓越性能。
相關新聞
「雙編碼」AI模型精準糾錯 提升學生英文語法學習效率
醫療AI應用面臨關鍵盲點:大型語言模型難以獨撐數據語義基礎
Anthropic 推 Claude Opus 5.5 模型,效能成本雙優更強調 AI 安全
iPhone 18 Pro本地AI效能大增 特定模型測試速度達前代兩倍
Anthropic 推經濟型 AI 模型 Sonnet 5.5 鎖定企業例行任務
智慧眼鏡AI輕量化再突破 高通攜PrismML實現1位元運算
交通安全不停歇 台南警持續強化大型車稽查 維護山區用路安全
交通安全不停歇 玉井分局持續強化大型車稽查 維護山區用路安全
文化大學拓展東亞視野 Eurasia講座探索AI日語新趨勢
AI金融模型創建能力躍進 專家:可匹敵初級分析師
AI巨頭激戰!Anthropic、OpenAI齊發新模型 效率與成本成核心
Prism ML 發表 Bonsai 2 27B 輕量高效能 AI 讓個人裝置也能運行
大型語言模型現「視覺幻覺」 學者憂 AI 可靠性挑戰應用
AI不只屬於資工人 曾志雄博士前進文化大學 帶50名財金學生培養「AI就業力」