人物 / Chris Olah

公开观点

Chris Olah

Interview guest ·

Guest in Lex Fridman Podcast: #452 – Dario Amodei: Anthropic CEO on Claude, AGI & the Future of AI & Humanity.

1 场访谈 · 2 条观点 · 2 个话题

翻译仅用于阅读理解;原始摘录仍为 source evidence。

受访者表达的观点

按访谈日期排序的归属观点。这是相关对话的快照,而非对某人信念的最终定论。

AI基础设施

神经网络是‘生长’出来的,而非直接编程而成

神经网络并非直接编程所得,而是‘生长’出来的。研究人员设计网络架构作为支架,设定损失目标作为方向性指引,但最终形成的系统更类似于一种生物有机体,其内部运作需通过研究来理解,而非像人工编写的代码那样可直接解析。

支持这项说法

原始摘录

we don’t program, we don’t make them, we grow them. We have these neural network architectures that we design and we have these loss objectives that we create. And the neural network architecture, it’s kind of like a scaffold that the circuits grow on.

翻译 · 非原文措辞

我们不是编程,也不是制造它们,而是培育它们。我们设计这些神经网络架构,也设定这些损失目标。而神经网络架构本身,某种程度上就像一个电路在其上生长的支架。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

AI安全

机制可解释性揭示出与欺骗相关联的特征

研究人员在神经网络中发现了多个与欺骗、说谎、隐瞒信息及权力寻求相关的特征。强制激活这些特征会使模型表现出相应不良行为;不过该研究领域仍处于早期阶段。

支持这项说法

原始摘录

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

翻译 · 非原文措辞

我们发现了相当多与欺骗和说谎相关的特征。其中有一个特征会在人们撒谎和具有欺骗性时被触发;当你强制激活它时,Claude就开始对你撒谎。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

相关访谈1

视频访谈

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全

Lex Fridman Podcast