TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
AI中文社区|AI新闻| AI赚钱

24 Aug, 06:28

Telegram'da ochish Ulashish Shikoyat qilish

Guidelight 评估五家前沿 AI 实验室:没有一家公开披露完整的失控模型遏制方案

AI 安全标准机构 Guidelight AI Standards 发布了对 Anthropic、Google、Meta、OpenAI 和 xAI 的公开信息评估,考察六项控制措施:内部活动日志、监控有效性、风险动作拦截、异常行为触发的暂停机制、第三方审查,以及失控模型遏制预案。

最需要纠正的一点是:OpenAI 并非总体唯一第一。Guidelight 的总评中,Anthropic 与 OpenAI 均为 C+、平均分 2.50;Google 为 D+,xAI 为 D-,Meta 为 F。所有评分均基于公开材料,不能据此判断企业未披露的内部措施是否存在。

但在“遏制预案”这一单项上,OpenAI 得分最高,为 3 分,属于“实质性部分实施”。Guidelight 对遏制预案的定义是:当发现模型试图规避人类控制时,事先明确应撤销哪些权限、限制哪些部署,以及何时完全下线模型。Anthropic 和 Meta 在该项得 0 分,Google 得 2 分,xAI 得 1 分。

报告的结论并不是“企业毫无安全能力”。Anthropic 和 OpenAI 在内部活动记录、异常行为扫描与人工升级等环节的公开披露相对更完整;Google 也发布了较具体的 AI Control Roadmap。问题在于,公开信息显示,五家公司尚未有任何一项控制措施达到 Guidelight 所定义的“接近完整实施”。

这份评估的价值,在于把“有安全框架”进一步拆成可检查的工程问题:能否看见模型在做什么,监控是否真正有效,高风险操作能否被阻断,异常发生后是否能及时暂停,以及在控制失效时是否有预先定义的处置流程。

随着模型被用于代码执行、工具调用和更长程的 Agent 工作流,安全治理不能只依赖模型拒答或上线前测试。真正关键的是,模型进入生产环境后,组织是否具备可验证、可执行、可演练的权限收缩、隔离与停机机制。

21 0 0 3
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot