AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
Meshy: 角色驱动下SPMD范式的RL训练框架

Meshy: 角色驱动下SPMD范式的RL训练框架

Meshy: 角色驱动下SPMD范式的RL训练框架

在过去的几年里,LLM RL 系统的工作负载发生了巨大的变化。早期的 RLHF 围绕同步训练展开:模型按固定顺序进行生成、打分和训练,每个阶段之间有着明确的同步边界。如今,系统还需要处理异步生成、持续训练、多轮 Agent 以及与外部环境的交互 —— 那些在同步执行中原本隐含的状态、版本和故障边界,现在都必须显式地进行管理。

来自主题: AI技术研报
10018 点击    2026-09-17 10:11
自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

当大模型已经能够快速生成文案、图片和视频,一个更进一步的问题是:Agent 能否从执行过的任务中积累经验,并在持续交互中改进后续行为?

来自主题: AI技术研报
9538 点击    2026-09-16 14:40
把记忆交给CPU,大模型会变快

把记忆交给CPU,大模型会变快

把记忆交给CPU,大模型会变快

拿Agent做Coding,想必大家都已经很熟悉了。

来自主题: AI资讯
9949 点击    2026-09-16 14:40
复杂的Harness Evolution,甚至不如多跑几遍

复杂的Harness Evolution,甚至不如多跑几遍

复杂的Harness Evolution,甚至不如多跑几遍

一个 Agent 第一次没把任务做对。

来自主题: AI技术研报
6420 点击    2026-09-16 14:40
华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

“智能并不局限于大脑内部。当我们使用纸笔或地图来梳理复杂问题时,这些外部工具就成为了我们‘延展的心智’。”

来自主题: AI技术研报
9712 点击    2026-09-16 10:07
清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么?

来自主题: AI技术研报
10064 点击    2026-09-16 10:06
ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。

来自主题: AI技术研报
6342 点击    2026-09-15 13:36
3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。

来自主题: AI技术研报
8499 点击    2026-09-15 13:35