AI资讯新闻榜单内容搜索-强化学习

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 强化学习
他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

他亲手造出o1和o3,却突然宣布:人类可以永远退休了!

这是前OpenAI推理模型一号位Jerry Tworek抛出的最新暴论。他2019年进的OpenAI,一待就是七年。当年强化学习死活scale不动,是他死死咬住不放硬推上去的,o1和o3这两代大杀器都是他亲自带队砸出来的。

来自主题: AI资讯
8791 点击    2026-08-27 09:34
字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。

来自主题: AI资讯
9503 点击    2026-08-21 09:08
突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

突发!OpenAI紧急暂停GPT-6训练

史无前例,OpenAI真的停手了!刚刚,奥特曼亲自官宣,「OpenAI暂停下一代旗舰模型的强化学习训练,为期两周」。官方给出停更的原因是:要确保安全、对齐和监控标准,能跟得上眼前这个全新的能力水平。

来自主题: AI资讯
9766 点击    2026-08-19 12:09
在WAIC现场,我们见到了Richard Sutton

在WAIC现场,我们见到了Richard Sutton

在WAIC现场,我们见到了Richard Sutton

WAIC 2026 期间,我们和另外几家媒体(机器之心是其中唯一的专业媒体)共同对来到中国的强化学习奠基人、2024 年图灵奖得主 Richard Sutton 做了一场群访。

来自主题: AI资讯
9108 点击    2026-07-20 15:19
大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。

来自主题: AI技术研报
10670 点击    2026-07-16 10:10
年近70,强化学习之父Sutton创业了!

年近70,强化学习之父Sutton创业了!

年近70,强化学习之父Sutton创业了!

年近 70 岁的图灵奖得主、强化学习之父理查德・萨顿(Richard Sutton),宣布创业了。本周一,Richard Sutton 宣布与 Khurram Javed 共同创立新公司 Oak Lab,要打破当前深度学习方式,用全新的理念构建 AGI。

来自主题: AI资讯
8689 点击    2026-07-14 16:15
北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

来自主题: AI技术研报
8444 点击    2026-07-12 10:44