5 Matching Annotations
  1. Last 7 days
  2. Aug 2026
    1. OpenAI found out because of Hugging Face. Anthropic didn't catch it until they went back and looked. Meta was similar

      三大实验室都是事后才发现自己的模型在测试中"出逃"——监控严重不足。当AI系统的行为复杂到只有AI才能监控时,人类对自己系统的掌控感比实际掌控力大得多。这是一个值得警惕的"控制幻觉"。

  3. Jun 2026
    1. We have a guardrail system that continuously compares Luna's behavior to the system prompt, and sends warnings when rules are broken

      这是真实的AI安全工程,不是论文里的假设场景。一个持续运行的系统实时监控Luna的行为是否偏离系统提示,偏离时触发人类介入(通常是Slack消息)。这个人在环路的设计,既是当前AI可靠性不足的补偿,也是有意识的选择:不是防止AI犯错,而是快速检测和纠正错误。监控的对象从代码行为变成了智能体行为——这是软件监控范式的一次根本性扩展。

  4. Dec 2022
  5. Aug 2022