RL 环境:让 AI 智能体学会真实工作的训练场
RL 环境包括世界、应用和任务三部分。世界是项目里的消息文档表格,应用是常用软件的高保真复刻,任务是提示词加验证器。理解这个结构,才能明白训练智能体不只是喂问答,而是复刻完整工作现场。
这次分享的主角是 Mercor 的 Brendan Foody。开场主持人提到,公司在很短时间内收入增速很快,而 Mercor 正处在企业做后训练、建自己智能的位置上。Foody 的主题是 RL 环境,他先回顾数据市场,再解释环境怎么做、为什么现在重要、应用层公司可以怎么用。 从众包标注到智能体数据 2020 年前后是众包数据的时代,主要做两类事。一类是行为克隆用的监督微调数据,给输入和输出;另一类是 RLHF 数据,让标注员在几个模型回答里选更偏好的那个。GPT-3 的微调
来源:youtube 原始内容