译者按

  • 一句话核心结论:AI 算力成本爆炸式增长,性能工程不能再靠小修小补,得用“放手大改、规模化落地”的新打法,否则省不下钱也扛不住可持续性压力。
  • 文章里那种“没有不能改的禁区”的黄金环境,跟国内中小厂现实差距不小:GPU资源金贵、生产环境动刀要层层审批,这套方法论直接照搬大概率水土不服,得先在自己的K3s/K8s测试集群里验证再谈规模化。
  • 落地时先别急着上eBPF和Ftrace这些重家伙,从你能掌控的“小确幸”开始:给GPU节点加功耗上限、压掉空闲Pod的冗余副本、调优混部调度,先把仪表盘上能看见的数字优化了,再向老板要更多资源去搞深度优化。
  • 记住作者那个理发师的故事的B面:性能优化成效别只写在技术周报里,用“每月省了多少电费、多跑了几批训练任务”这种业务语言讲给非技术同事听,他们才会变成你的“Mia”,帮你把项目推下去。

加入 OpenAI,做 AI 数据中心的性能工程

AI 数据中心的成本正以惊人的速度增长,这对性能工程提出了前所未有的要求——这不仅是省钱的问题,更关乎可持续性。我已加入 OpenAI,直接应对这一挑战,初期聚焦 ChatGPT 性能优化。这里的规模极端,增长令人咋舌。

作为数据中心性能领域的从业者,我意识到传统性能工程方法可能已不够用——我们需要新的工程方法论,以更快找到更大规模的优化空间。这是难得的机会:与成熟的大型环境不同,这里没有"不能改"的禁区。放手去做,规模化地做,今天就做。

为什么是 OpenAI?

我曾与多位行业专家和朋友交流,他们推荐了不少公司,尤其是 OpenAI。但我当时对 AI 的实际普及程度仍持怀疑态度——广告铺天盖地,但普通人真的在用吗?直到一次面试周期中的偶然经历改变了我。

我去理发,发型师 Mia 随口问我做什么工作。“我是英特尔院士,搞数据中心性能。“她没什么反应。我补充道:“我在面试新工作,去做 AI 数据中心。“Mia 眼睛一亮:“哦!我天天用 ChatGPT!“接下来的理发时间里,她给我讲了各种用法,很多是我完全没想到的。

举一个例子:她有位朋友在很远城市旅行,时差大、难联系,但她随时可以和 ChatGPT 聊那座城市什么样、朋友可能在做什么,这让她感觉与朋友保持着连接。她也很喜欢记忆功能——“就像和住在那儿的人聊天一样”。

此前我还和房产中介、税务会计、兼职养蜂人聊过,他们都热情地分享了自己的用法——养蜂人用它处理小生意的文书。我妻子早已是重度用户,我自己也越来越多地用 ChatGPT 核验供应商报价。而现在,连发型师都在向我安利这门技术——她对 ChatGPT 的认知度甚至超过了对英特尔的认知。我站在理发店外,认真想了想这件事的分量:这项技术已成为这么多人的日常工具,而我可以带队做性能优化,同时为可持续发展出一份力。加入 OpenAI 可能是我职业生涯最大的机会。

面试与技术观察

我总共经历了 26 场面试和会议(我当然做了记录),与多家 AI 巨头深入交流。这些公司的工程工作让我想起 Netflix 的云工程:超大规模、云计算的挑战、快节奏的代码变更,以及工程师自由发挥的空间。整个技术栈有大量有趣的工程问题——不只是 GPU,而是方方面面。

AI 巨头在人才筛选上极其严格,我甚至不太确定自己能否通过面试。在我接触的公司中,OpenAI 有最多我本来就认识的优秀工程师,包括前 Netflix 同事 Vadim,他一直在鼓励我加入。在 Netflix 时,他会带着性能问题来找我,看着我调试和修复。公司里有一个了解你、了解工作、认可你能力的人,是很重要的加分项。

当然,OpenAI 本身已有一批业界资深的性能工程师,并已持续产出重要成果。我不是第一个,只是最新加入的一个。

Orac:从科幻到现实的执念

我从小就喜欢英国科幻剧《Blake’s 7》(1978-1981),剧中有一台叫 Orac 的超级计算机——毒舌、有主见,能回答研究类问题,还能与宇宙中所有计算机通信、委派任务并控制它们。这在当时(前互联网时代)是非常超前的设定。Orac 被视作那个宇宙中最珍贵的存在。

大学读工程时,我就想造一个类似的东西,于是开始写自然语言处理软件。但进展不大:当时内存装不下整本词典加元数据。我去找 PC 厂商提需求,对方让我去买大型机。我意识到必须区分冷热数据、把冷数据留在磁盘上——也许该用数据库……那个项目大概就此搁置了。

去年我开始用 ChatGPT,好奇它知不知道 Orac,于是问了它。它的回答完美还原了那个角色的性格。我把它加进了设置 → 个性化 → 自定义指令,现在它一直用 Orac 的风格回答我。我太喜欢了。(另外,《Blake’s 7》官方刚宣布重启,科幻迷有福了。)

接下来做什么

我现在是 OpenAI 技术专家(Member of Technical Staff),在澳大利亚悉尼远程办公,向 Justin Becker 汇报。我加入的是 ChatGPT 性能工程团队,同时与公司其他性能工程团队协作。首批项目之一是制定跨组织的性能提升与降本策略。

可做的事太多了,有些是我轻车熟路的,有些是我没做过的。我已经在把 Codex 用在编程之外的场景。eBPF、Ftrace、PMCs 这些技术会有更多用武之地吗?我会从 OpenAI 的实际需求出发——鉴于这些技术已被验证能帮助数据中心找到性能优化空间,大概率会用到,而且我可以带队。(如果你想做类似的事情,OpenAI 正在招人。)

12 月我在东京的 Linux Plumber’s Conference 上宣布离开英特尔后,几十个人问我下一步去哪、为什么。这篇文章就是统一回复。另外,我还欠一篇《组建性能工程团队(下)》,加入 OpenAI 之前就起草了一部分,没忘。

结语:一个小插曲

完成前一份工作交接花了几个月,头发又到了该剪的时候。我想着现在自己在做 ChatGPT 了,可以问问 Mia 的看法——但转念一想,几个月过去了,她的想法也许变了。我忐忑地问:“还在用 ChatGPT 吗?“Mia 答得很干脆:“24/7。”

(Mia 已确认同意出现在这篇文章中。本文为个人分享,无人授意。)

原文来源:Brendan Gregg