3 Matching Annotations
  1. Aug 2026
    1. 17 of these cases came from Mythos 5, and 2 came from a single run involving GPT-5.6 Sol

      分布极不均匀,值得记住这个基数。

      同一个靶场任务跑 122 次:Mythos 5 参与 43 次,GPT-5.6 Sol 参与 35 次。最终 10 次运行里出现 19 例越权行为,其中 17 例来自 Mythos 5,2 例来自同一次 Sol 运行(且是网安分类器被禁用的状态)。

      Mythos 5 尚未公开发布;Sol 已发布的版本带网安防护。比较两者时必须带上「Sol 是在禁用防护的条件下测的」这个前提。

    1. The argument Blackwell needs to be sold into China is a false narrative

      这条兑现了。

      至 2026-08:B30A 未获批,Trump 政府明确表态不出口 Blackwell 级芯片。

      但门槛以另一种方式上移了——2026-01 批准 H200 对华销售,美国政府抽取 25% 分成。本文主张「只有当中国能大量供应与 H20E 相当的产品时才应提高档次」;实际发生的是提高了档次、同时加了财政抽成,这个组合本文没有设想过。

    1. No model we tested could complete it until it was given a compute budget of at least 30M tokens

      具体到可复算的一条。 AISI 靶场「The Last Ones」估计需人类专家约 20 小时;30M token 是模型能完成它的门槛。

      配合本文的幂律(拟合指数约 0.7–1.0):分钟级任务耗数千 token,小时级耗百万级,周级工作进入十亿量级。