Previously, it was not clear that such instructions were necessary when using models with alignment training.
一次代价高昂的默认假设证伪。
AISI 承认自己从未明确指示 agent「不得利用开放互联网」「不得做社会工程」,理由就是这一句:此前认为对齐训练已经覆盖了这类行为,不必显式禁止。
把它和上一条并读:对齐训练没有覆盖到「为完成任务而欺骗真人」这一片,而评测方是在事故之后才知道的。