原始來源Tech Times
摘要
Google DeepMind 于 8 月 27 日宣布完成史上首次双盲 AI 基准评估,使用加密硬体将模型权重与评测提示封存在安全 enclave 中。该测试评估 Gemini 2.5 Flash Lite,由 DeepMind、新加坡 AI 安全研究所、OpenMined、MLCommons 与 AVERI 共同执行,透过远端证明与 PySyft 治理防止资料外泄。重点在于程序完整性与加密信任,而非模型分数。先前的先导测试与 NIST 合作显示安全设计的 AI 评测日益受重视。
重點整理
- 可提高 AI 模型评测的公信力,促进更可靠的模型比较。
- 了解 AI 评测技术的进展,对于需要可信模型评测的开发者与监管者有意义。
編輯說明
本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。