原始來源Tech Times
摘要
Google DeepMind 於 8 月 27 日宣布完成史上首次雙盲 AI 基準評估,使用加密硬體將模型權重與評測提示封存在安全 enclave 中。該測試評估 Gemini 2.5 Flash Lite,由 DeepMind、新加坡 AI 安全研究所、OpenMined、MLCommons 與 AVERI 共同執行,透過遠端證明與 PySyft 治理防止資料外洩。重點在於程序完整性與加密信任,而非模型分數。先前的先導測試與 NIST 合作顯示安全設計的 AI 評測日益受重視。
重點整理
- 可提高 AI 模型評測的公信力,促進更可靠的模型比較。
- 了解 AI 評測技術的進展,對於需要可信模型評測的開發者與監管者有意義。
編輯說明
本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。