美國 NIST 推新 AI 評估平台 強化模型可靠與安全

商傳媒|林昭衡/綜合外電報導
美國國家標準及技術研究所(National Institute of Standards and Technology, NIST)於今日(7月27日)宣布推出全新的 AI Technology Evaluation (AITE) 平台。此平台旨在提供研究人員與開發者一個獨立的測試環境,以公正且嚴謹的方式評估人工智慧(AI)模型的性能。
根據國家標準及技術研究所於今天發布的公告,AI Technology Evaluation (AITE) 平台的核心理念,是透過在「盲數據集」(blind datasets)上進行評估,來防止測試數據被整合到模型訓練中,進而確保評估結果的客觀性與可靠性。該計畫將由國家標準及技術研究所的 Technology Test and Evaluation Division 領導,初期將重點評估大型視覺語言模型(VLMs),涵蓋量子科學、基因組學及公共安全等多個應用領域。
該平台設有兩種參與模式:數據提供者可提交原創數據集及相關評估任務,以獲得其數據集上領先 AI 模型的性能測量結果;模型提供者則可提交 AI 模型進行測試,了解其模型在多個領域的表現,並與其他模型進行比較。國家標準及技術研究所表示,其提供的基礎設施將提供共同的數據、指標和評分標準,以協助開發者理解其模型性能。任何同意平台參與協議與規則的組織及個人,皆可參與。
這項計畫是川普(Donald Trump)政府推動 AI 模型安全策略的最新舉措。美國商務部已在今年五月與 Google DeepMind、微軟(Microsoft)及 xAI 等三家公司重新達成協議,將透過 Center for AI Standards and Innovation 評估這些大型科技公司的 AI 模型。《Nextgov.com》報導指出,AI Technology Evaluation (AITE) 平台的第一批評估工作預計將於 2026 年 8 月啟動。
相關新聞
Baseten 聯手 Hugging Face、Goodfire AI 強化開放 AI 模型安全
SecEdge 拓展 AI 安全平台 助 NVIDIA Jetson 強化邊緣 AI 防護
Salesforce國防AI平台升級 聯手輝達OpenAI強化美國政府應用
勿將「Meta 對話平台」視為傳統 API 釋放 AI 模型溝通潛力
Google助Vitality將AI健康平台引進美國 促民眾建立健康行為
入門機也講究耐用與安全 AQUOS wish6 支援 120Hz、IP 防護與 AI 防詐
Shield 推 MCP Server 強化工業監控 網際網路安全中心發布安全基準
再生醫療科技強化 AI 平台 助醫師精準制定治療計畫
AI 發展新瓶頸:模型之外,上下文與控制架構成關鍵挑戰
OpenAI 將定期追蹤模型失調 六起 AI 異常行為揭自主風險
美國再供波蘭 40 億美元軍事融資 助其強化北約東翼安全
美國參院協商AI安全規範 擬賦予聯邦政府攔阻權
Salesforce 簽約 Anthropic 後自研 AI 新模型 Koa 攜手輝達出擊
美國支援泰國小型模組核反應爐可行性研究 強化印太能源安全