从视觉理解到生成世界,这条路他们走了二十多年。

作者|徐珊

编辑|郑玄

2017 年,微软亚洲研究院。梅涛带着姚霆等团队做出了全球最早的文生视频模型之一,当时无人问津。

九年后的这个夏天,同一群人创办的公司三个月融了超 20 亿,估值突破 10 亿美金,成为独角兽企业。

7 月 15 日,智象未来宣布完成 15 亿元 C 轮融资,本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、华策影视等多家机构跟投。老股东合肥产投、东方富海等科技投资机构持续加注。

智象未来成立于 2023 年,试图通过自研原生全模态世界模型,让 AI 不再只是生成图像、视频和 3D 内容,而是在统一架构中理解空间、时间、运动与物体关系,让 AI 从视觉内容生成,走向对现实世界的理解、预测与重构。

创始人梅涛是加拿大工程院外籍院士,曾先后在微软亚洲研究院和京东工作多年,作为创业家的另一面,他其实也是国际四大学会 Fellow 的知名人工智能学者。

智象所在的视觉模型赛道,是当下竞争最激烈的战场之一。几个月前,就连背靠 OpenAI 的 Sora,都在上线两年后关停。但 Sora 的失败并没有给视觉赛道降温,近期快手为可灵完成上限 30 亿美元的增资,国内视频生成厂商也先后拿到大额融资,产业明显开始更关注多模态大模型的架构创新、工程化能力和商业落地。

不过,这轮融资中更值得关注的或许是给钱的人。公开信息显示,这是社保基金作为 LP 首次投资多模态大模型方向的公司,更是工银资本第一次出手多模态大模型企业。跟投名单里,还站着来自安徽、上海、浙江、福建、湖南多地的国资,以及上影股份和华策影视两家头部影视上市公司。

热钱追风口,慢钱认路线。当最慢的钱不约而同开始为一家大模型公司下注,我们好奇,这些人在智象未来身上看到了什么?

01

「模型把所见的东西都记住,甚至复刻出来」

理解智象未来的不同,要先理解一张图是怎么被生成出来的。想让 AI 学会生成图像,得先让它「看」图。怎么看,行业分成了两派。

主流的行业做法,相当于让模型隔着一层毛玻璃看世界:图片先被压缩,变小、变糊,再喂给模型;文字则由另一个模块单独处理,两边各学各的,最后拼在一起出结果。这么做省算力,训练快,所以几乎所有文生图模型都这么干。但信息一旦被压缩,细节也就丢了,补不回来。

智象干脆把毛玻璃拆了,不压缩,让模型直接看原图,图片和文字也不再分开处理,一起交给同一套自研的原生全模态架构—UiT(Unified Transformer),让它一边看、一边学着画。模型记住的,是世界本来的样子。「我希望模型把所见的东西都记住,甚至复刻出来。」智象未来 CTO 姚霆对极客公园说道。当然,看得越清楚,学得越费劲,模型更大,更吃数据,训练也更慢。

图片由 HiDream-O1-Image-1.5 模型生成|来源:智象未来

选择这条路线背后,同样也离不开智象对「世界模型」的独特理解。

过去,人们常讨论的多模态模型主要是在语言模型之外挂上图片理解、再补一个生成模块,重心仍在文字。而智象说的原生全模态,重心压在所有模态从原始信号出发,进行端到端的全模态对齐:用一个神经网络,同时理解和生成文本、图像、视频、3D 以及动作,各个模态不单独编码,而是统一 tokenization,端到端地在同一套网络里完成。

下一代大模型竞争的关键,不是单一模态能力的叠加,而是能否从多模态走向全模态,以原生统一架构对真实物理世界进行统一建模,构建原生全模态世界模型,这是我们笃定的路线和方向。」智象未来创始人兼CEO 梅涛说道。他认为通往世界模型尚未收敛,目前主要有三条分岔路:一条路线以 3D 原生模型切入,强调空间一致性;另外一条从 Sora、Veo、Seedance 等多模态视频模型切入,用视频生成逼近世界模拟;也有人沿着具身智能路线推进,从 JEPA、VLA 到 WAM,试图解决动作规划、物理交互和长程决策。

比如说,谷歌是目前全模态上走得非常靠前的公司,文本是它最强的地方之一,所以它会沿着 Gemini 的文本架构去扩充其他模态;智象则从自己积累最深的视觉像素出发,以此为底座向外生长。「每家公司一定要立足自己的禀赋,去做自己的判断。两条路无关对错,分出的只是各自能触到的天花板。」姚霆说道。

天花板是有价码的。架构切换之前,团队内部有过一场关键讨论:到底沿着原来的隐式表达继续做,拿个 80 分的效果就知足了,还是换「像素」路线,争取冲击 90 分的机会。「做 90 分是有代价的,这条路本来就不那么容易走通,甚至可能做不成。」姚霆说道。在模型企业创业的早期,团队往往会遇到很多选择的问题,几番纠结后,在正确而难和容易见效的路线上,他们选了前者。

赌注的第一笔回报落在模型榜单上。采用 UiT 架构的 HiDream-O1-Image 开源版本,今年 5 月登顶全球独立模型评测平台 Artificial Analysis 文生图榜单开源模型全球第一,也是该榜单排名前 20 的模型中公开参数最小的模型版本;6 月,商用版 HiDream-O1-Image-1.5 再次成为该榜单排名最高的中国图像模型,位列全球前三,在光影、复杂构图、指令跟随和中英文字渲染上表现突出。这也是原生全模态架构第一次从「技术验证」走到「生产验证」。

数据来源:以上榜单截图时间为 2026 年 6 月 22 日

但榜单第一说服不了客户,架构创新是入场券,真正的问题是谁买单?

02

模型是底座,Know-How 才是卖点

几乎所有的创业团队都离不开一个究极问题:为什么你能做,但大厂不能做。

智象未来对此的破题思路很清晰。首先,没有任何企业能够做出一个完美的模型;其次,没有哪家企业不能做什么模型,不过是时间、资源、金钱投入的力度和选择的方向。因此,在多模态视频赛道,考验的更多的是认知理解,也是关键选择。「我们对行业的认知理解比其他人要领先行业三到六个月,这就是我们的优势所在。」姚霆分析道。

但认知领先无法直接「开发票」,它必须先变成产品,再变成交付,最后变成客户愿意续约的理由。

在智象看来,其针对 OPC 产品的内容创作智能体 vivago 是天然的模型验证场。「C 端产品就是一个放大器。5000 万用户的日常使用,把实验室里看不见的问题成规模地暴露出来;解决这些问题的过程,就是理解模型落进产业会碰到什么的过程。」姚霆说。这是 vivago 好用的原因,也是这套架构能持续转动的原因。

vivago 生成 |来源:智象未来

5 月 17 日,vivago 在全球顶级科技产品首发平台、美国硅谷产品风向标 Product Hunt 上,位列日榜第一,如今 vivago 积累了超 5000 万用户。在刚刚结束的 WAIC 2026 上,智象未来将 vivago 升级为全球首个具备无限时长视频生成与编辑能力的多模态创作智能体 vivago R1,提高了智能体的长程推理能力。这也说明了AI能从辅助生成单点素材的工具,成长为能自主规划、调度并完成长链路创作任务的「AI搭子」。

「这个数字的大部分贡献不仅来自模型能力的本质区别,也来自对影视制作流程的理解能力,比如说,分镜怎么拆,叙事怎么接,策略怎么写。」姚霆认为行业 Know-How 会被沉淀成一个个 Skill,长在模型之上。

不仅如此,智象未来研发的 AI 创作智能体「帧赞」累计制作短漫剧超过 5000 分钟,,平台入驻专业团队近千家。

商业营销方向上,商业营销智能体 HiBurst,已覆盖跨境电商内容营销、媒体运营和应用出海等场景,支持 TikTok、Meta、抖音、小红书等主流平台,并成为 TikTok 官方 top 5 服务商,年生产电商营销视频超过百万条,覆盖 GMV 已超亿元。

这些成果也意味着,如今视觉模型的出路,不再是过去语言模型那样单一卖通用 API,而是「专属模型+工作流+结果交付」,一旦和客户的素材库、业务系统、协作流程绑定,迁移成本就立起来了。「影视公司真正需要的不是单点生成能力,而是能理解镜头语言、叙事节奏,并进入剧本评估、视觉预演、后期制作等真实流程的协同系统。这也是 AI 从工具走向产业工作流的关键。华策影视副总裁张思拓谈及为何投资智象未来时说道。

最直观的体现是营收增速。从 2025 年开始年商业化收入持续快速增长,其中企业业务的占比更高,也说明其订单来自长期愿意续约的企业客户,更为稳定。

如果用一句话概括这门生意:语言模型卖的是 Token,智象卖的是结果。而能把结果卖出去,靠的不是这四年,是过去的二十年。

03

视觉理解这件事,他们做了二十余年

中国 AI 创业公司大多有个「隐疾」,会写论文的不懂产业,懂产业的技术总是靠拿来主义。但想要同时会技术创新、又能做出好的产品,就要求同一群人先后在最好的实验室和竞争最激烈的产业里各泡上几年。智象未来对视觉产业的理解,正是这样泡出来的。

开头那个 2017 年时刻,只是这群人二十年长跑中的一步。他们是投身中国视觉研究的头一批人,在微软亚研院做图像搜索、支撑 Bing 和小冰,对手常年是谷歌与伯克利。「我们天然的成长基因里,就是希望做全世界最好的视觉模型。」姚霆说。

2018 年,这群人做了一个学院派中罕见的选择,加入京东。此后五年是一段学术和产业紧密融合的岁月,他们在京东做拍照购项目,实现 10 亿级别全图库秒级检索,这个功能至今仍然是京东 APP 首页上使用量超高的一个用户入口;让京东亚洲一号物流仓里两套 7×24 小时机械臂实现了持续的稳态运营,支持 10 万+SKU 的拣选——只有真正深入过具身工业应用的行业,才知道这意味着什么。

有关产业的知识在快速积累。大客户为什么买单,产线容忍什么误差,一个模型从惊艳的 Demo 到敢签合同的产品之间,要填多少坑。中国 AI 行业后来反复需要验证的一课,他们花了五年去学习。最后发现,技术的价值,最终以交付的形态存在。

所以 2023 年的创业,是这群人终于等到了自己的时代。「更远的 AI for Science 我们参与不了,只能见证;而视觉生成,是我们坚持做了二十年的事,应该在场。」梅涛把职业生涯再次押进最熟悉的领域。

智象未来 创始人兼 CEO 梅涛 |来源:智象未来

有意思的是,在智象未来内部,学术氛围仍然明显。技术团队的专业交流氛围仍是师生式的,姚霆、潘博这些核心成员之间,称呼和做事的方式仍保留实验室的习惯;企业背后也站着中科大的产学脉络,种子轮甚至都是十五位科大校友凑的钱。来到产业后,他们也没放弃对创新的研究。

「不过,如果只按纯科研的心态做,很难落地,这个时候我会 push 自己往前走半步。」姚霆谈起自己从学界走入产业界时调整姿态的方式。

四年四换架构的大胆与创新,和五千分钟短剧的耐心,体现在这同一群人身上并不矛盾。而现在,有人愿意为这两面同时下注了。

04

国家队入场后,下一站瞄准 IPO

回到开头那个问题:国家队的慢钱到底看到了什么?

除了常见的企业叙事,我们发现这轮融资最强的信号,其实是国家队的入场姿态。工银资本此前从未碰过多模态大模型,这类资本决策周期以年计,多出现在半导体、存储、储能公司的股东名单里,这类资本往往押注的是一个时代的关键判断。

在产业上,国资的偏好向来明确:投一家公司,最好能撬动几条产业链。视觉恰好是大模型里离产业最近的一层,影视、文旅、营销、电商都是现成场景;而智象交出的成果,又都经得起逐项验收。钱穿过公司,落进产业,能用一个支点带起一片规模。

在路线上,谷歌正把全模态收进 Gemini 这一张网中,Sora 退场之后,窗口期内,国内需要有从架构层就完全自研的公司站上视觉模型主赛道的牌桌。智象砍掉 VAE、把像素与文本统一进一套网络的 UiT,成为其核心技术自研的支点。

对公司自己,这份股东名单也是一份隐形的背书。B 端客户签约前掂量的,是一家创业公司靠不靠得住、能走多远,国家级资本的入局,本身就是一种市场信任的背书。

随着赛道整体转入上市竞赛。本次融资的同时,智象未来已经悄然完成股改,第三方企查查平台的工商资料显示,智象未来的合肥主体已经正式更名为智象未来(合肥)科技股份有限公司。接下来,它要做的,是将技术积累与商业落地转化为持续稳健的增长,在多模态大模型赛道的资本角逐中,以第一梯队的姿态进入下一轮竞赛

*头图来源:智象未来

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO