- 过去几十年, 大企业已经发展出一套相当成熟的组织方式: 按专业划分部门, 按职责确定边界, 通过接口协调合作, 再用各自的指标衡量产出. 计算团队负责计算, 网络团队负责网络, 存储团队负责存储. 上层的算法团队提出需求, 数据团队提供数据, Infra 团队交付基础设施. 当技术路径相对稳定, 问题可以提前拆解时, 这种结构能够支持极大的业务规模.
- 但前沿 AI 研发有一个麻烦之处: 大量关键问题在解决之前, 根本无法被准确地拆分.
- 知识边界往往比部门边界更加顽固. 也是我最近几年一直要 全栈 “人工” 智能 的原因, 很多的优化其实都在知识的边界处…
- 部门边界至少是可见的, 可以通过调整汇报关系, 设立联合项目来改变. 知识边界则经常隐藏在日常沟通里. 算法研究者提出 “需要更大的 batch”, Infra 工程师接到的是扩容需求, 却未必知道背后是在验证什么训练假设. 工程师反馈 “这个方案通信开销太高”, 研究者收到的是一个限制, 却未必知道换一种数据布局或专家放置方式, 就可能让方案重新可行
- 如果一个想法必须同时协调数据管线, 训练框架和网络实现, 才能完成最初的验证, 而另一个想法只需要修改本部门的一小段代码, 在相同的绩效周期里, 后者自然更有吸引力. 久而久之, 人们会主动选择容易获得资源, 容易交付, 容易归属成果的研究方向. 那些潜在价值很高, 却需要跨越多个边界的想法, 可能连第一次实验都没有获得