9 月 22 日,蓝图娱乐在杭州总部举行技术发布活动,正式推出「蓝芯」多模态大模型 3.2 版本。这是一次「效率向」的升级:相比 3.1 版本,多模态推理成本下降 62%,视频理解与 3D 表征两个方向的基准成绩分别提升 21 和 34 个百分点。蓝图娱乐模型团队负责人表示,3.2 版本的目标很明确——让多模态能力从「演示可用」走向「规模可用」。
升级一:视频理解,从「看懂帧」到「看懂事件」
上一代模型处理视频时,本质是逐帧理解再拼接,遇到长镜头和复杂剪辑就容易丢失上下文。3.2 版本引入了事件级时序建模:模型先抽取镜头中的关键事件节点,再在事件图上完成推理。在内部测试集上,对 10 分钟级视频的问答准确率从 3.1 版的 68% 提升到 89%。对内容行业意味着什么?云枢平台的素材检索、长片分段与智能粗剪会明显更准。
升级二:3D 表征,统一点云与网格建模
3.2 版本把点云与多边形网格纳入统一表征空间,模型可以直接「读」未渲染的 3D 资产。这一能力已在蓝图娱乐合作方的虚拟制片项目中验证:数字场景资产的自动标注与检索效率提升数倍,美术团队不必再为每个模型手工写标签。
升级三:成本下降 62% 的三条路径
成本优化没有魔法,只有三件苦功夫:其一,MoE 专家调度策略重写,让视频与 3D 这类重模态任务按需激活专家,平均激活参数下降 38%;其二,动态量化从权重级深入到激活级,显存占用再降三分之一;其三,推理算子针对多模态拼接场景做了融合,长序列吞吐提升明显。三者叠加,才换来 62% 的整体成本降幅。
| 指标 | 蓝芯 3.1 | 蓝芯 3.2 |
|---|---|---|
| 多模态推理成本 | 基准 | 下降 62% |
| 长视频问答准确率 | 68% | 89% |
| 3D 资产理解基准 | 基准 | 提升 34% |
| 平均激活参数 | 基准 | 下降 38% |
按计划,3.2 版本即日起通过 API 逐步开放,云枢平台将在 10 月完成切换;私有化客户可联系商务团队获取升级评估工具,硬件需求较 3.1 版本不升反降。想了解云枢工作流如何吃到这波升级红利,可阅读《云枢 CloudPivot 2.0 上线》;对 AI 内容合规框架感兴趣的朋友,推荐《AI 生成内容的版权实践》。
