GLM-5.3-FlashX 上线:200 tokens/s
GLM-5.3-FlashX 上线:200 tokens/s智谱上线 GLM-5.3-FlashX 模型,推理速度最高达 200 tokens/s,较 GLM-5.3-Flash 提速 5 倍、提价 2.5 倍,API 同步开放,该模型在 10 万张国产芯片提供的推理算力基础上,由 GLM-5.3 驱动 Agent 在两周内完成端到端构建并通过 Infra 侧优化将吞吐提升至初始基线的 3 倍。
搜索
智谱上线 GLM-5.3-FlashX 模型,推理速度最高达 200 tokens/s,较 GLM-5.3-Flash 提速 5 倍、提价 2.5 倍,API 同步开放,该模型在 10 万张国产芯片提供的推理算力基础上,由 GLM-5.3 驱动 Agent 在两周内完成端到端构建并通过 Infra 侧优化将吞吐提升至初始基线的 3 倍。
智谱创始人唐杰发文披露RSI最新进展,称由GLM-5.3驱动的Infra Agent在超过10万卡国产芯片集群上不到两周内完成GLM-5.3 Flash生产级推理服务搭建,将端到端吞吐提升至初始基线的3倍,表明RSI最小闭环已经形成但距离递归自我改进仍很遥远。
智谱首席科学家唐杰发布 GLM-5.3-Flash 推理系统优化成果,模型仅用两周在超 10 万颗国产 AI 加速器集群上完成生产部署,端到端吞吐提升 3.2 倍,并由 GLM-5.3 驱动的 Infra Agent 参与瓶颈分析与代码修改,标志着智谱首个 RSI(递归自我改进)早期形态的落地。
四年前,法国举办的一场 CNCF 大会上,主持人向台下的大模型创业者抛出一个常规问题:“Kubernetes 能为 AI 带来什么?”
AI竞争的焦点,变了。
万象智维的会议室里,一字铺开了市面上主流的AI硬件。CEO王拓为告诉《智能涌现》,最近他们在讨论,一个AI硬件应该被设计成什么样的形态。
Runta 是 Agent Infra 领域的硅谷明星创业公司,刚完成由 a16z 投资的 2000 万美元 Seed 轮;Jeff Dean、李飞飞等也以个人天使身份参与投资。在创立 Runta 之前,冠兰在云计算与基础设施领域深耕十余年:曾任 Cloudflare Edge 边缘云核心技术负责人,后在作为早期核心成员加入 Kong ,担任工程总监,负责云原生网关和 AI 网关的研发。
她是xAI前推理团队负责人。她研究并发起的开源推理引擎SGLang,已经成为众多大模型部署和推理的重要底层工具,也是目前AI infra领域最具影响力的开源推理框架之一。如今,她从SGLang开源生态中孵化出创业公司RadixArk,希望把只有少数科技巨头才能拥有的前沿AI基础设施,变成整个行业都可以使用的开放技术底座。
一家才成立7个月的公司,就拿下100亿美元的算力订单,然而它自己估值才24亿美元。8月5日,TechCrunch援引Bloomberg报道,Anthropic和一家叫Volta Infra的AI云初创公司签了6年算力协议,总价100亿美元。
这篇文章,我们邀请到了由SGLang孵化的RadixArk的联合创始人和核心成员,以及数据中心专家,一起聊聊AI Infra的四层架构、行业如何把“硅”的潜力榨到极限,以及背后的关键技术。