16 Matching Annotations
  1. Last 7 days
    1. The AI Security Institute continues to collaborate closely with industry partners, including Anthropic, to make models safer. Only last week it tested OpenAI's most powerful model GPT-6 Astra before public release

      这是一个需要核实的声明,涉及AISI与其他AI公司的合作情况。需要核实AISI是否确实测试了OpenAI的GPT-6 Astra,以及为什么Anthropic似乎采取了不同的做法,这可能反映了不同公司对安全测试的态度差异。

  2. Sep 2026
    1. Astra is also more likely to operate within the boundaries set by the user and implied by its environment. In an internal evaluation, Astra never attempted to circumvent a Codex Auto-Review denial.

      【方法】这一关于模型遵循边界能力的声明基于内部评估,但未提供外部验证或详细的方法论。需要了解这个内部评估的具体设置、测试案例以及与实际使用场景的相关性,以评估这一说法的可靠性。

  3. Apr 2022
  4. Jul 2021
  5. Jun 2021
  6. Oct 2020
  7. Sep 2020
  8. Aug 2020
  9. Jun 2020
  10. May 2020