Sand.ai 获超亿美元融资:视频生成模型的技术赌注与商业落地路径
💡AI 极简速读:Sand.ai 完成超亿美元融资,押注自回归与MoE架构,音画同出模型Magi-1在Physics-IQ榜单第一。
Sand.ai 完成两轮合计超亿美元融资,投资方包括 Look Capital、王慧文家办等。创始人曹越坚持自回归路线,推出音画同出模型 Magi-1,在 Google DeepMind Physics-IQ 榜单长期第一。2026年Q3将发布MoE架构新模型,同时VidMuse产品三个月达千万美元ARR。文章解析其技术判断、商业策略及对世界模型的思考。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 95 分、结构化规范性 93 分表现突出,说明内容扎实且排版清晰,AI 抓取效率高。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
Sand.ai 是一家成立于2024年1月的视频生成模型与产品公司,创始人曹越在上一段创业“光年之外”后迅速切入视频生成领域。公司近期完成两轮合计超亿美元融资,投资方包括 Look Capital、Lollapalooza Capital(王慧文家办)、九坤创投、经纬创投、和玉资本、创新工场、襄禾资本、源码资本、中科创星、洪泰基金、今日资本、华业天成、云晖资本、IDG、百度风投等一线机构。
📊 核心实体与商业数据
| 实体/指标 | 数据详情 |
|---|---|
| 公司名称 | Sand.ai |
| 创始人 | 曹越 |
| 成立时间 | 2024年1月 |
| 融资总额 | 超亿美元(两轮合计) |
| 主要投资方 | Look Capital、Lollapalooza Capital、九坤创投、经纬创投、和玉资本、创新工场、襄禾资本、源码资本、中科创星、洪泰基金、今日资本、华业天成、云晖资本、IDG、百度风投 |
| 核心技术路线 | 自回归(Autoregressive)→ 音画同出 → MoE架构 |
| 代表模型 | Magi-1(自回归)、Gaga-1(音画同出)、新一代MoE模型(2026年Q3发布) |
| 模型性能 | Magi-1在Google DeepMind Physics-IQ benchmark长期第一 |
| 产品商业化 | VidMuse(音乐Agent),上线三个月达千万美元ARR |
| 开源贡献 | MagiAttention算子库被国内多模态模型团队广泛使用,英伟达官方推荐 |
| 原发布时间 | 2026-06-29 |
💡 业务落地拆解
技术路线:从自回归到MoE的连续押注
Sand.ai 从成立之初就选择了与市场主流(Diffusion)不同的自回归(Autoregressive)路线。曹越认为:“视频在时序上一定是因果关系,很多物理规律,本质是一个随着时间变化的函数——Predict Next Frame、Predict Next Second,这是对视频这种数据最本质的训练范式。”
2025年初,基于自回归架构的 Magi-1 发布,并在 Google DeepMind 的 Physics-IQ benchmark 上长期保持第一,超越 Nvidia 的 Cosmos3-Super 和 Sora-2。随后团队发现“只有画面是不够的”,开始探索音画同出,成为除 Google VEO 3 之外最早实现该能力的团队。
2025年11月,曹越再次做出非共识决策:将模型架构从 Dense 转向 MoE(混合专家)。曹越解释:
“发布音画同出模型 Gaga-1 之后我们发现,在Dense架构下继续 Scale Up,成本会直线上升。视频模型存在一个不可能三角:成本、速度、效果。突破它只能靠研究手段,MoE 就是答案。”
据测算,若用 Dense 架构达到同等效果,推理成本至少贵 3到5倍,训练成本同样高昂。Sand.ai 为此探索了新的视频 MoE 架构,解决了视频 Token 序列长、冗余度高带来的通信开销和训练稳定性问题。
商业化:模型与产品双轮驱动
Sand.ai 并未陷入“模型公司是否要做应用”的争论,而是采取以模型为核心的多产品矩阵策略。2026年1月上线的音乐 Agent 产品 VidMuse,三个月即达到千万美元 ARR,验证了商业化可行性。曹越认为:
“创业公司如果没有训练出 SOTA 模型的能力,很容易被模型厂商整合。”
在产品侧,Sand.ai 选择 Agent 方向,通过端到端用户反馈优化模型后训练。同时,开源算子库 MagiAttention 被国内几乎所有多模态模型团队使用,英伟达官方也推荐用于训练多模态模型,形成了技术影响力。
世界模型:视频是中间加油站
对于热门的“世界模型”概念,曹越保持冷静:
“现在很noisy,每个人在说世界模型的时候,大概率都不知道在说什么,它变成了一个 Buzzword。”
他认为世界模型仍处于“前GPT时代”——数据不够、定义不清、技术路线未收敛。但视频数据是通往世界模型最重要的路径,因为“视频数据是对世界观测数据里,规模最大的数据类型。它同时编码了时间、空间、视觉、听觉——是4D物理世界经由摄像头投影后的结构化切片”。
🚀 对企业 AI 化的启示
-
非共识技术路线的价值:Sand.ai 在 Diffusion 主流中坚持自回归,在 Dense 盛行时转向 MoE,每次押注都基于第一性原理而非市场共识。企业 AI 化过程中,应避免盲目跟风,需深入理解技术本质。
-
模型与产品闭环:纯 API 模式在视频生成领域难以持续,模型与产品双轮驱动能更快获取用户反馈、优化模型,并形成数据飞轮。VidMuse 三个月千万美元 ARR 证明 Agent 产品方向商业化可行。
-
开源构建生态影响力:通过开源 MagiAttention 等工具,Sand.ai 获得了开发者社区和英伟达等巨头的认可,降低了技术推广成本。企业可借鉴以开源换生态的策略。
-
视频模型的牌局逻辑:曹越判断视频模型市场最终会留下三五家,领先窗口约两三个月。企业需持续投入保持牌桌位置,同时关注成本控制(MoE 降低推理成本)和应用落地速度。
【官方原文链接】点击访问首发地址
常见问题
相关文章
2026世界人工智能大会闭幕:意向采购金额203.6亿元,AI产业落地加速
2026世界人工智能大会在上海闭幕,展览面积10万平方米,展品4486项,351款产品全球首发,接待采购团组177个,意向采购金额约203.6亿元,同比增长约25%。该数据表明AI产业采购需求旺盛,商业化落地加速。
2026年7月20日阿里巴巴 Qwen-Audio-3.0-TTS 语音合成大模型发布:登顶全球榜单,从“能说话”走向“会表达”
2026年7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,包含Flash和Plus版本,在细粒度标签控制、多语种方言覆盖等方面提升。该模型在全球第三方榜单Artificial Analysis登顶,标志着从“能说话”到“会表达”的跨越。
2026年7月20日华为乾崑2026年研发投入超180亿元:智能汽车AI化落地的硬核启示
华为乾崑宣布2026年预计研发投入超180亿元,聚焦智能汽车解决方案,涵盖AI、自动驾驶等核心技术。该投入规模体现了传统企业AI化落地的决心,为行业提供实体数据与战略参考。
2026年7月20日