在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境
在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
搜索
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
Agent爆发时代,我们需要什么样的AI计算底座?
就在刚刚,飞书和豆包工作一起,开了他们的全新发布会。
今天的AI Agent,已经不只是聊天窗口里「会说话」的模型。它们正在接入浏览器、文件系统、终端、API、MCP服务和各种自动化工作流,开始真正替用户执行任务。
让 AI 帮忙发一封邮件,它可能把正文写得妥帖、附件整理得齐全,最后却发错了人。
Grok Bot正式推出网页版,用户可直接在Grok页面使用,同时SpaceX AI发布官方教程《Grok Bot 101》,详解其作为拥有云端电脑的Agent如何创建Bot、调度工作流程并取代人类监控环节。
同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
还得是外滩大会,真!热!闹!啊!
当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。
安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。