争议天才田柯宇获3000万美元,押注AI自创语言挑战李飞飞

北大博士生田柯宇因字节投毒事件饱受争议,如今以2亿美元估值获五源资本、IDG投资,其团队正研发AI专属符号语言系统,试图在世界模型赛道另辟蹊径。
从投毒争议到2亿美元估值,田柯宇的下一站是世界模型
2026年10月,AI创投圈出现了一笔耐人寻味的交易。一家仅有10人、尚未公布产品名称的实验室,在业内道德争议未消的情况下,获得了五源资本和IDG合计3000万美元的投资,投后估值达到2亿美元。
这家公司的创始人,是2024年因"字节投毒事件"震动国内AI圈的北大博士生田柯宇。彼时他身陷字节跳动800万元索赔诉讼,却同时以第一作者身份摘得NeurIPS 2024最佳论文奖。争议与天才并存,如今顶级VC再次押注,目标直指世界模型——李飞飞的核心赛道。
核心思路:让AI发明自己的语言
田柯宇切入世界模型的角度相当独特。他认为人类语言的信息维度不足以完整描述物理世界,一段橘猫从桌上跳下的视频,文字难以精确表达物体的位置、运动轨迹和光影变化。
他的方案是创造一套AI专属的符号语言。目前团队已搭建包含20万个符号的"视觉词典",这些符号人类无法直接理解,但AI可以用它们来表示、压缩和预测视频内容。据他介绍,这种方法能将生成一秒钟视频的成本降低至少一个数量级。
下一步计划是输入约1亿小时的视频数据,让模型通过这套自创语言学习现实世界,最终打造面向机器人、自动驾驶和交互式视频的基座模型,目标2027年正式发布。团队目前不急于商业化,重心仍在基座模型研发。
有业内人士指出,这套"新语言"的核心价值在于解决视觉模型的"指代不清"问题,让AI在长时间模拟物理世界时保持稳定,从而改良视觉模型的底层架构。
VAR论文:视觉自回归的范式突破
田柯宇的技术根基来自NeurIPS 2024最佳论文《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》,即VAR项目,也是他在字节实习期间参与的核心成果。
在VAR之前,视觉生成领域有两条主流路线:
- 自回归路线(VQ-VAE、VQGAN):将2D图像强行展平为1D序列逐个预测,破坏了像素间的空间联系,注意力计算量巨大
- 扩散模型路线(Midjourney、Sora):先画全局轮廓再修饰细节,画面质量出色但生成速度慢、算力消耗高,且与LLM架构不兼容
VAR的突破在于重新回到自回归路线,提出"下一尺度预测":保留图像二维结构,通过多尺度残差VQ-VAE将图像拆成由粗到细的分辨率层级(1×1→2×2→4×4→8×8……),模型像人类画画一样逐层并行预测。这一思路让生成速度提升了20倍,并用纯GPT架构实现了高质量视觉生成。
更关键的是,VAR首次在视觉生成中跑通了Scaling Law——当参数从3亿扩展到23亿时,模型不仅性能提升,还涌现出零样本图像修复、画面外扩和指令编辑等能力。
投毒事件:大厂算力争夺的极端缩影
VAR论文获奖的同时,田柯宇的争议事件全面爆发。
2024年6月至7月,田柯宇在字节商业化技术部门实习时,因不满团队算力分配,利用Hugging Face加载模型存档时的安全漏洞,在权重文件中植入恶意代码。其他同事加载该文件后,优化器会被动态改写,模型朝错误方向优化;同时随机插入的延时指令拖慢了训练速度。结果是团队30多位研究者白干了一个季度。
字节最初考虑到其博士生身份未公开处理,但2024年10月,"涉及8000多张卡、损失上千万美元"的聊天截图在微信群中病毒式扩散。字节随后公开声明澄清,受影响的是内部研究项目而非商用大模型。
法院最终判决田柯宇违反实习合同,赔偿字节50万元并返还全部实习工资。
在2026年彭博社专访中,田柯宇承认"当时我的做法无异于以暴制暴",表示如果能重来一定会采取更明智的做法。
世界模型赛道:资本为何押注效率路线
2026年世界模型赛道融资密集:李飞飞的World Labs累计融资超10亿美元、估值54亿美元,近期被AMD以82亿美元收购;杨立昆的AMI Labs种子轮获10.3亿美元;前阿里通义负责人林俊旸的语用科技首轮获2.2亿美元。
赛道已分化出多个流派:像素渲染派(Sora、PixVerse)、几何物理模拟派(DeepMind Genie3)、空间重构派(World Labs)、具身规划派(宇树、Momenta)。田柯宇的"AI自创语言"路线,本质上押注的是效率与底层架构创新——用更低的成本实现更稳定的世界模拟。
资本在技术爆发力和历史污点之间重新权衡,这一融资本身也在释放一个信号:在世界模型这个人才极度稀缺的赛道上,顶级工程能力正在获得更高的溢价。