刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一10B参数以内,空间具身能力同档第一的通用多模态大模型来了!
搜索
10B参数以内,空间具身能力同档第一的通用多模态大模型来了!
正式版将在近期推出并开源。
现有的开源多模态搜索智能体普遍受困于「裁剪 - 再搜索」的串行处理模式,面对多目标时往往陷入交互冗长、错误级联累积的泥沼。
独家获悉,字节跳动日前低调公布全球首个25B级、基于混合专家 (MoE) -扩散自注意力机制(DiT) 的开源增强统一多模态模型Mamoda2.5。Mamoda2.5依托Qwen3-VL-8B、128 个专家,Top-8 路由的MoE+DiT架构搭建,最终模型参数高达250亿,而每次仅激活约30亿参数(约12%)。
开源多模态生成领域,迎来架构级的底层突破。
10B参数拥有媲美千亿级模型的多模态推理实力。
全开源多模态大模型(MLLM)的性能,长期被闭源和半开源模型“卡脖子”。
LLaVA 于 2023 年提出,通过低成本对齐高效连接开源视觉编码器与大语言模型,使「看图 — 理解 — 对话」的多模态能力在开放生态中得以普及,明显缩小了与顶级闭源模型的差距,标志着开源多模态范式的重要里程碑。
2B模型在多个基准位列4B参数以下开源第一。 抖音SAIL团队与LV-NUS Lab联合推出的多模态大模型SAIL-VL2。
最新开源多模态智能体,能自动操作手机、电脑、浏览器的那种!开源评测榜单和中文场景交互成绩全面提升。