148. 对游凯超3小时访谈:开源Infra、和模型Co-design 、“如果vLLM失败,我们会后悔一辈子”张小珺Jùn|商业访谈录

148. 对游凯超3小时访谈:开源Infra、和模型Co-design 、“如果vLLM失败,我们会后悔一辈子”

180分钟 ·
播放数39416
·
评论数101

今天我们的嘉宾是游凯超,他是创业公司Inferact联合创始人兼首席科学家——这个公司很特殊,是从伯克利一个校园开源项目vLLM演化而来。这个社区的维护者用了将近3年时间,把它从一篇算法论文变成了一个开源社区,又变成了一个公司的正常运营。

这些维护者们放弃了大量的个人诱惑,坚持着他们所相信的开源精神。

今年初,Inferact获得了1.5亿美元种子轮融资。我们讨论了当一个寄托着社区情怀的开源项目,变成一个商业化的组织运营之后,它所面临的抉择、转变与思考。

另外一方面,我们也非常希望在AI Infra技术前沿上,给大家带来一些新的思路。所以我也和游凯超聊了聊,在AI Infra、模型结构,甚至Harness Engineering都要联合设计的时代背景下,多方的联合设计应该怎么做?

接下来,就是我对游凯超的访谈。

OUTLINE:

00:02:18 从算法到机器学习系统

00:37:56 开源项目vLLM的诞生

01:07:25 “如果vLLM失败了,我们会后悔一辈子”

01:20:11 “仁慈的独裁者”

01:37:16 从社区到创业

01:52:56 模型与Infra的Co-design

02:15:10 Token VS 电力

02:35:41 技术预测

LINKS:

我们的播客在小宇宙Apple Podcast、Spotify等全音频平台播出;

我们的视频播客在Bilibili小红书、视频号、抖音等全视频平台播出;

如果你想服用文字版,请搜索我们工作室的公众号:语言即世界language is world。

DISCLAIMER: 本内容不作为投资建议。

CONTACT: xiaojunzhang@lisw.ai

Jump into the new world-and explore with us!😉

展开Show Notes
游凯超
游凯超
2026.7.28
感谢小珺邀请,录播客的时候Kimi K3还没发布,我也没有预料到Kimi K3会这么强,但是我依然坚定地说出了“开源模型一定会赢”的bet💪🏻
本期播客刚好紧接着Kimi K3发布,也是非常应景了😃播客里面提到了很多首次公开分享的内容,希望大家喜欢这些vLLM与Inferact成长的故事✌🏻模型与Infra co-design的观点,也是一家之言,欢迎大家一起来探讨😃
想说却还没说的,还很多,下次有机会再来分享。但现在最想说的,就是我们还在持续招人!
Delivering AGI to everyone token by token is no easier than producing AGI itself. vllm is a promising ecosystem to solve the problem, and inferact is doing it well.
推理优化、推理引擎、推理系统,与大模型推理有关的Infra人才,我们都需要!来 https://jobs.ashbyhq.com/inferact 投简历,或者联系 jobs@inferact.ai ,或者找我们私聊,都可以!前沿硬件、前沿模型、前沿推理挑战,加入我们,和优秀的同学们一起弄潮🏄🏻‍♂️🏄🏻‍♂️🏄🏻‍♂️
KIDNAPENIAC:去年做推理优化的时候,大佬过年还在加班,回复GitHub issue。
airxx:逻辑清楚,表达清晰
8条回复
天凯
天凯
2026.7.28
他好谦逊啊,表达好温和。 当然能力已经打满了!
RayHu
RayHu
2026.7.30
对 CoDesign 部分比较感兴趣,做了一些摘要:

关于 infra 和模型 Co-Design 的 核心信息点整理
1. Co-design 的通俗比喻:发电系统 游凯超将模型与 Infra 的关系比作“发电系统”:硬件是自然资源(如水力、风力),模型是发电机(水轮机或大风车),而推理引擎(Infra)则是电网/电力系统。Co-design 的程度直接决定了面对不同的自然条件(硬件特性)时,发电机(模型)的发电效率。

2. “硬件彩票”理论(Hardware Lottery) 在摩尔定律失效的今天,算力的增长不再是通用的,而是走向专用的“黄氏定律”。如果算法设计没有踩准这些专用算力的特性,就等同于没有“抽中硬件彩票”,将被时代抛弃。Transformer 之所以能爆发,本质上是因为它包含了大量适合高度并行的矩阵乘法,完美抽中了 GPU 的彩票。

3. 为什么 RoPE(旋转位置编码)能一统江湖? RoPE 的成功不仅是算法上的胜利,更是 Co-design 的经典案例。它作为一种绝对位置编码,能在 Attention kernel(注意力内核)之外独立运算。这使得它与训练大模型必备的 FlashAttention 完美契合(无需修改复杂的内部算子),从而干掉了其他需要修改 Attention 实现的位置编码方案。

4. 为什么各干各的团队没有前途? 过去算力冗余时,大家对算力效率追求不极致;但现在模型推理需求爆发,算力面临严峻的“供不应求”及“高度特化”。如果模型团队一拍脑门设计出在硬件上极难实现或效率极低的结构(例如把 head size 开到 1024),Infra 团队将无能为力。

5. DeepSeek 的极佳示范:算法与 Infra 的双向奔赴 游凯超评价 DeepSeek 拥有全球顶级的 Infra 团队。他们成功的秘诀在于:算法同学懂 Infra,能写出高效的 MoE 早期实现;Infra 团队底子深厚(源于幻方时期的极致算力压榨),能给予算法极大的探索空间(如实现 DeepSpark 投机解码)。最好的状态是两拨人坐在一起办公,通过日常讨论“耳濡目染”,实现真正的双向熏陶。
SunnyGong:哇这个总结可以诶…是ai总结的么?(感觉我有点需要…
高楼大厦_gmqJ:可以和小郡和华为廖恒一块听
3条回复
bingo20
bingo20
2026.7.28
每天都在等广密的季报
晨煊-:广密一直坚定一个常识,开源是赶不上闭源的。闭源的好没有公开,开源的就不知去哪里抄。靠蒸馏是超不过被蒸馏的本体,只能去接近
Yourdoraemon:广密是啥
5条回复
阿x楠
阿x楠
2026.7.29
听这期播客好舒服啊,嘉宾的表达逻辑,能力,思路特别的清晰,给出的观点也不是模棱两可的中性回复。
HD683156v
HD683156v
2026.7.31
本期嘉宾太顶了…听着听着就觉得怎么这人把复杂技术讲的好像我也能听懂的样子?语言精练而不晦涩,表达语气也很谦和,最后两段对于翁的宿命论和语言即世界的看法,听的一阵头皮发麻…
Q:我们工作室叫做语言即世界工作室,当你第一次听到这个名字的时候,你在想什么?
A:语言即世界就是维特根斯坦的那句话,对吧?就是我的语言的极限,就是我的世界的极限。我第一次听到这个的时候的脑子里冒出来的一个想法就是,五四级以上的方程的求根公式没有办法用有限的四则运算和开根号来表达。就是说语言即世界可能就表明我们其实只是一个低维生物,然后其实在我们之外还有更高维的存在。
高楼大厦_gmqJ:求主持人的阴影
RookieStar
RookieStar
2026.7.31
2:06:39 说的应该是马一龙吧👀
主持人专业性还是太弱了,这一期听起来是最难受的,感觉就是一直想挖一些娱乐八卦型的内容,还不断重复,根本没问到点子上,感觉嘉宾好几次都要受不了了
sanbai_
sanbai_
2026.7.28
最想听的 co-design,只在最后十几分钟才开始,有点少。
不过前面 vllm 发展的历程也很精彩。就像那位长者说过的,一个项目的命运当然要靠个人奋斗,也要考虑历史进程。
一直在想,当ai coding变强,我们是否还需要一个通用推理引擎,还是只要一堆优化skill+特定硬件+特定架构的专门引擎就够了。每个模型每套硬件单独一个定制引擎。
东一门饭桶:当然,最顶尖的infra,绝对会持续存在
HD460130g
HD460130g
2026.8.05
2:58:34 这个“语言即世界”的解释震撼到我了,喜欢这样的节目
hercules_jia
hercules_jia
2026.7.28
小珺更新节奏节奏调整回来啦👍🏻👍🏻👍🏻
数据英雄
数据英雄
2026.7.28
1:17:30 meta?
1:22:41 困了哈哈哈
HD384009l
HD384009l
4天前
近期听感最舒服的一期,有很多值得的地方👍!
这个为什么要开公司有必要问这么多遍吗😅
DaDaDaniel
DaDaDaniel
2026.8.01
1:34:12 感觉知识密度有点低,标题里面关于co design的比较硬核、知识密度高的地方到现在也没怎么听到,反而聊了很多比较虚的内容,怎么开启项目,项目发展的介绍也没有很多实质性内容,聊了很多怎么决定开公司,什么时候开公司,但是也没说开公司比较关键的商业话题比如融资,商业模式,规划什么的;聊一些关键人物但也没聊出比较有意思的形象,像流水账
这期质量感觉不太行,也许跟vllm是太硬核的项目有关,xiaojun也没法聊的太深入
点子_v6ww
点子_v6ww
2026.7.31
1:10:21 这里笑死了 小珺老师大震惊这帮天才学生竟然对搞公司这么发怵
Roland_Tsgf
Roland_Tsgf
2026.7.31
太喜欢这个游凯超了!