🤖
🤖
核心导读
AI语音初创公司Fish Audio完成5000万美元种子轮融资,由Coreline Ventures和Capital Today领投。该公司拥有超过15000种自然语言控制的语音库,用户超800万,年经常性收入达2100万美元。创始人廖世嘉(前NVIDIA研究员)基于开源项目Fish Speech(GitHub 31k星)开发。产品覆盖创作者和企业,面临ElevenLabs等竞争。公司计划今年发布音频理解模型和语音转语音模型,并已自动化语音移除流程以回应版权争议。
AI生成的语音模型市场规模巨大。创意应用场景要求AI语音模型更具表现力,而寻求自动化客户支持和销售运营的企业则需要它们更易于操控。
总部位于帕洛阿尔托的Fish Audio希望通过其超过15000种自然语言控制的库来满足所有这些用例。自去年推出以来,这家初创公司如今已有超过800万人使用其模型的开源或托管版本,并实现了2100万美元的年经常性收入。
为了延续这一势头,这家初创公司周二宣布,已在由Coreline Ventures和Capital Today领投的种子轮融资中筹集了5000万美元。本轮融资还吸引了359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0的参与。
Fish Audio最初是前NVIDIA研究员廖世嘉的一个小项目。他对市场上缺乏表现力的合成语音感到沮丧,于是在单个GPU上训练了一个语音生成模型并开源。GitHub上的Fish Speech仓库现已获得超过31000颗星,并被独立开发者、视频游戏设计师和创作者使用。
该公司去年发布了五款模型:四款语音生成模型和一款语音转文本模型。其中三款语音生成模型已开源,但其最新的S2.1 Pro模型仅通过付费API提供。
Fish Audio为创作者和团队提供按月付费计划,解锁一定数量的生成分钟数和语音克隆功能。该公司还提供企业版API和平台,并表示HeyGen、Sanas和Plaud等组织已在应用。
“每个企业都有不同的用例和偏好。例如,像HeyGen这样使用我们语音为AI化身提供动力的公司,需要逼真的语音;游戏工作室希望为其角色提供富有表现力的语音;而像LiveKit这样的语音代理公司则需要更自然、低延迟且足够有表现力的语音用于通话,”Cao说道。
这家初创公司构建语音库的方式之一是让用户提交自己的语音来训练模型,如果语音被使用则给予补偿。然而,几个月前这引发了一些麻烦,因为某些创作者声称他们的语音在未经同意的情况下被上传到Fish Audio。该初创公司有DMCA内容移除流程来处理此类问题,但移除本身需要很长时间。
Fish Audio的首席执行官兼联合创始人Cao Rissa告诉TechCrunch,公司现在已经自动化了移除流程。她说,创作者可以轻松提交一段简短的语音样本或合同来证明上传的语音属于自己,然后他们的语音将在大约3分钟内从该初创公司的平台上移除。
尽管如此,这并不能阻止任何人在不知情的情况下上传艺术家的语音。在艺术家发现之前,他们的语音将继续在该平台上使用,直到他们申请移除。
Coreline Ventures的合伙人Oskue Honda表示,社区驱动的模式只有在创作者信任平台时才能生效。“以社区为中心的方法只有在创作者信任平台时才能成为持久的优势。这意味着同意、透明度和归属必须内置于产品中,而不是事后的想法。我认为行业需要走向验证语音所有权、明确的许可条款、简便的举报和移除流程,并最终实现收益共享模式,让创作者在语音被许可或商业使用时获得经济回报,”他说道。
Cao表示,当该初创公司仅提供开源项目并面向创作者时,运营高效且不需要资金。但随着投资者兴趣增长,他们希望开发更先进的模型,并希望容纳企业客户,因此寻求资本。
展望未来,Fish Audio计划今年发布一款音频理解模型。他们还在构建一款语音转语音模型。
语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前Podcastle)和Krisp等公司都在争夺创作者和企业的预算。
据359 Capital合伙人Rico Mallozzi称,为开发者提供精细控制以及成本高效的模型训练,将帮助Fish Audio更好地与大型AI实验室竞争。“我认为他们凭借现有团队所构建的先进模型,与一些其他资金充足的AI实验室或公司相比,是令人难以置信的。这展示了他们在缩小人工声音与人类声音之间差距方面的技术能力,”Mallozzi在电话中告诉TechCrunch。
分享这篇文章: