话题 / AI安全

预览内容 · 尚待审核

观点转述 · 非原话引用

机制可解释性揭示出与欺骗相关联的特征

研究人员在神经网络中发现了多个与欺骗、说谎、隐瞒信息及权力寻求相关的特征。强制激活这些特征会使模型表现出相应不良行为;不过该研究领域仍处于早期阶段。

预览链接在此环境中有效。公开卡片的URL仅在发布后可用。

观点背后的信息

翻译仅用于阅读理解;原始摘录仍为 source evidence。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全

原始摘录

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

翻译 · 非原文措辞

我们发现了相当多与欺骗和说谎相关的特征。其中有一个特征会在人们撒谎和具有欺骗性时被触发;当你强制激活它时,Claude就开始对你撒谎。

上下文

时间点来自所提供的转录稿,尚待媒体回放核对。