🤖
🤖
核心导读
法国初创公司Kog押注传统GPU仍有巨大推理潜力,通过深度软件优化在现有数据中心GPU上实现极速解码。其技术预览在小模型上达到每秒3000 token,吸引了大量商业兴趣。Kog目前聚焦大模型加速,计划9月实现首个主要模型10倍速,并瞄准软件工程等应用场景。公司团队精干,凭借CEO在物理与黑客领域的独特背景,深入底层优化,欲在AI推理竞赛中突围。
更快 AI 推理的竞赛正在进行中。今年 5 月,Cerebras 及其专用芯片在 IPO 首秀中受到市场热烈欢迎。但法国初创公司 Kog 却押注,传统 GPU 仍有许多潜力可挖。
这家初创公司在 5 月凭借一项技术预览登上了 Hacker News 首页,旨在证明“在企业现有的标准数据中心 GPU(如用于演示的 AMD MI300X 和 NVIDIA H200)上,实现极快的单请求解码是可能的。”
有些人听说这并不适用于笔记本电脑中的 GPU 时感到失望,但另一些人则看到了潜力。随着推理速度和成本成为关键瓶颈,Kog 承诺通过软件优化在现有硬件上解锁新能力,这吸引了远不止旁观者。“我们收到了 200 条切实的商业线索,”CEO Gaël Delalleau 告诉 TechCrunch。
根据早期反馈,这位独立创始人预计软件工程将成为首个用例。资深 Claude Code 用户深知,他们有时需要等待数小时才能获得结果。Anthropic 自己也明白速度是有价值的,因此对 Claude 的快速模式收取数倍费用。
Kog 希望瞄准那些因这些延迟而望而却步的客户,他们通常依赖 AI 工作流处理专业任务。Delalleau 表示,这家初创公司还拥有设计合作伙伴,允许用户通过提示生成游戏和应用,对他们来说,Kog 推理引擎(KIE)带来的更快结果意味着更多收入。
该公司意识到这个市场还不成熟。在观察需求时,Kog 发现其潜在客户不准备微调小模型。“因此,自发布以来,我们一直全力加速开发更大的模型,以满足我们看到的这种需求。”
这使得 Kog 要实现“30 倍更快的 LLM 推理”承诺还有很长的路要走。其演示显示了令人印象深刻的每秒 3000 个请求 token(TPS)——但使用的是专用小模型,仅有约 20 亿参数,即现已开源的 Laneformer 2B。
与怀疑者相反,Delalleau 相信同样的方法也适用于 LLM,尽管其规模对推理芯片来说是一个挑战。“GPU 前景光明,”他说。对 Kog 的 CEO 而言,认为 GPU 不适合解码的观点已成为一种误解;新一代 GPU 拥有越来越高的内存带宽,只待被解锁。
并非只有 Kog 认为软件优化能帮助 GPU 发挥超越其规格的性能。同样来自法国的 ZML 发布了与硬件无关的软件,绕过 Nvidia 的 CUDA 以支持跨竞争芯片的快速推理。但 Delalleau 表示,Kog 更类似于斯坦福大学的 Hazy Research 实验室,更深入地专注于 GPU 加速。
Delalleau 本人并非研究员,他的第一家初创公司、2009 年 TechCrunch50 校友 Stribe 与他的新公司毫无关系——除了他的前联合创始人、现风险投资人 Kamel Zeroual,他的公司 Varsity VC 共同领投了 Kog 的种子轮。但这家初创公司对深度技术的专注源于他独特的背景。
他在法国巴黎综合理工学院学习固态物理学,之后从事进攻性网络安全——也被称为白帽黑客。Delalleau 表示,这塑造了他现在鼓励团队采纳的思维方式。在科学方面,“有一种理解物理定律和 GPU 定律的心态,以便充分利用它们。”
至于黑客技术,这位 DEF CON CTF 竞赛的四次入围者表示,这教会了他“在极低层次上逆向工程——深入到汇编语言和二进制代码——以理解其工作原理,并尝试使用它来实现一个它未必设计用于的目标。”
这种方法的缺点是它非常费时费力且需要亲自动手。“对于每一块新 GPU,我们都会花上几周甚至几个月,深入细节,在该硬件上进行 GPU 工程研究。”团队只有 11 人,这使得 Kog 能够处理的芯片数量受到限制,至少在可预见的未来是这样。
从长远来看,Kog 希望将它的方法引入基于代理的流水线,以便支持更多芯片和模型。随着欧洲在这两个领域寻求建立自己的能力,这可能为这家初创公司带来主权顺风,而它已经得到 Scaleway 的支持,并获得了法国 Bpifrance 和 French Tech 2030 计划的资助。
不过,目前 Kog 需要向世界证明其方法适用于 LLM。这也是获得更多资金的关键。“一旦我们以 10 倍速度部署第一个主要模型(我认为将在 9 月份实现),我们就能够开始展示客户吸引力,并在此基础上进行 A 轮融资,”Delalleau 说。
分享这篇文章: