最近,字节跳动成立了一个新部门,叫“AI数据与安全部门”。这个部门和Seed、Flow、抖音等一级部门地位相同。它的主要任务是为公司的大模型提供跨模态的数据服务。过去,字节的AI数据体系由傅越负责,但他最近要离职了。新部门的负责人是王赢磊,他之前长期负责TikTok业务,管理过直播和平台责任。
字节跳动在过去几年里,已经围绕模型训练建立了庞大的数据采购、生产和评测体系。现在,这些分散的团队被整合成一个独立的一级部门。这次调整发生在字节重新强调大模型自研路线之后。今年7月,在Seed部门的全员会上,张一鸣明确表示,字节不会把蒸馏作为提升模型能力的捷径,即使这意味着牺牲一部分短期收益。
Cloudflare的最新数据显示,机器人产生的网络请求已经超过人类。因此,数据从一种可以被收集的资源,变成了一种需要主动生产的产品。字节在数据方面投入了很多人力。仅Seedance的数据评测团队就有上千人。DeepSeek的创始人梁文锋透露,公司有一半的核心研究员在参与数据标注。
新部门负责人王赢磊来自业务一线,长期负责TikTok业务。字节连续两次把AI数据交给了擅长业务运营、组织管理和平台治理的人,而不是模型研究员。这留下了最大的悬念:当“生产什么数据”本身越来越成为研究的一部分时,字节还能不能让数据生产保持高度专业化和规模化,同时又不让它离模型研究的最前沿太远?
