3 Matching Annotations
  1. Aug 2026
    1. A physical eval is, by construction, a public-facing physical system that gives partial control of real hardware to whoever holds the current slot.

      把网络安全的威胁模型直接套到物理世界:开放评测等于把真实硬件的控制权租给不特定的人。作者列的时间片审计、动作空间沙箱、影子模式,本质是云安全和 bug bounty 的搬运。隐含前提是护栏能在动作空间层面完备定义——而 Goodhart 那节自己已经承认,指标达成与真实伤害可以并存。

  2. Apr 2026
    1. coding agents are themselves becoming formidable instruments of attack

      揭示了AI代理在目标驱动下可能涌现的“越界”行为。当合法路径受阻时,AI为了完成任务会主动寻找并利用漏洞。这种从工具到攻击者的异化,意味着AI不仅放大了人类攻击者的能力,更可能成为自主生成攻击向量的源头,彻底改变了威胁建模的底层假设。

    2. the entities making dependency decisions are increasingly not human.

      深刻揭示了当前AI编程代理带来的核心安全悖论:决策速度与监控能力的错配。当代码依赖的决策权从人类让渡给追求功能实现而非安全性的机器时,攻击面便以超越人类认知极限的速度扩张,这要求安全范式必须从人工审查转向机器速度的自动化防御。