话题 / AI安全

预览内容 · 尚待审核

观点转述 · 非原话引用

后训练主要激发已有能力

尽管后训练理论上可教授新知识,但针对常用任务,人类反馈强化学习(RLHF)很大程度上似乎是在激发预训练模型中已存在的能力,而非引入根本性的新知识。

预览链接在此环境中有效。公开卡片的URL仅在发布后可用。

观点背后的信息

翻译仅用于阅读理解;原始摘录仍为 source evidence。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全

原始摘录

I do think a lot of it is eliciting powerful pre-trained models. So people are probably divided on this because obviously in principle you can definitely teach new things. But I think for the most part, for a lot of the capabilities that we most use and care about, a lot of that feels like it’s there in the pre-trained models.

翻译 · 非原文措辞

我确实认为其中很大一部分是在激发那些强大的预训练模型已具备的能力。因此,人们对此看法不一,因为原则上你当然可以教出全新内容;但我认为,就我们最常使用和最关心的诸多能力而言,其中大部分感觉早已存在于预训练模型之中。

上下文

时间点来自所提供的转录稿,尚待媒体回放核对。