2 Matching Annotations
  1. Aug 2026
    1. It’s less, what can we solve, but I think it’s more about what biases or mistakes do people make that models miss.

      全篇最扎实的技术判断:被对齐得越理性的前沿模型,越模拟不了非理性的人。这解释了 Simile 为何非要自己做后训练而不是套壳提示词——偏差不是要消除的噪声,而是必须复现的信号。

  2. Apr 2026
    1. Emotion vector activations across post-training

      论文研究了情绪向量在后训练(RLHF/RLAIF)阶段的变化,这个切入点极有洞察力:后训练本质上是对模型「性格」的塑造,而情绪向量的变化正是这种性格塑造的内部痕迹。这意味着未来的对齐工作可以直接监控情绪向量的分布,将「情绪健康指标」纳入训练目标——从 RLHF 走向 RLEF(基于情绪反馈的强化学习)。