别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透
别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
搜索
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。
先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。
OpenAI被曝正在内部测试GPT-6 Sol,单次速度约为GPT-6 Astra的6倍,同时公开内部数据称研究员每8小时工作日背后并行运行约3.1个Agent工作日、每日Agent推理资源花费超600美元,并宣布已实现"自动化AI研究实习生"目标;其首席科学家Jakub Pachocki同日发文警告AI对齐与监控难题,表示若必要OpenAI不排除单方面暂停扩大模型规模。
OpenAI正式发布GPT-6 Astra,宣称其为"全球最智能且最对齐的模型",在电脑操作(OSWorld完成率72.6%)、ARC-AGI-3(99.9分)、审美判断力、主动性及网络安全(首个达Critical等级)等方面全面升级,Greg Brockman在媒体闭门会上宣布"欢迎来到AGI时代"。
史无前例,OpenAI真的停手了!刚刚,奥特曼亲自官宣,「OpenAI暂停下一代旗舰模型的强化学习训练,为期两周」。官方给出停更的原因是:要确保安全、对齐和监控标准,能跟得上眼前这个全新的能力水平。
Anthropic刚刚发布了一份长达186页的最新Risk Report。如果只是快速扫一眼,这仍然是一份典型的前沿AI安全报告:模型能力评测、生物风险、网络安全、自动化研发、对齐问题,以及各种防护措施。
23岁天才少女,离职OpenAI!早在两周前,OpenAI对齐团队研究员Naomi Bashkansky,悄然递交了辞呈。第二天,她便以「创始研究员」的身份,火速加入初创Conduit,剑指「心灵感应」(Telepathy)。
给图像生成模型一张人物参考图,它大概率能抓住身份特征。