
Fish Audio获5000万美元种子轮,为创作者和企业构建AI语音模型

总部位于美国帕洛阿尔托的语音AI初创公司Fish Audio完成5000万美元种子轮融资,由Coreline Ventures和Capital Today联合领投,参投方包括359 Capital、Parable等。该公司由前NVIDIA研究员Shijia Liao创立,最初因不满市场上合成语音的表现力不足,用单张GPU训练了一个语音生成模型并开源,其Fish Speech仓库在GitHub上已获得超过31,000颗星。
Fish Audio目前提供超过15,000个自然语言控制的语音库,支持开源和托管两种使用方式。过去一年发布了5个模型(4个语音生成和1个语音转文本),其中3个语音生成模型开源,最新S2.1 Pro模型仅通过付费API提供。公司已有超过800万人使用其模型,年经常性收入达到2100万美元。付费方案分为面向创作者和团队的月度套餐(解锁一定生成时长和声音克隆功能),以及面向企业的API和平台版本,客户包括HeyGen、Sanas、Plaud等。
CEO兼联合创始人Rissa Cao表示,不同企业需求各异:HeyGen需要逼真语音驱动AI化身,游戏工作室需要富有表现力的角色声音,语音代理公司如LiveKit则需要更自然、低延迟且足够有表现力的声音。Fish Audio通过让用户提交自己的声音用于训练模型,若被采用则给予补偿,以此构建语音库。但这一做法曾引发争议——部分创作者声称他们的声音未经同意被上传。公司已自动化了DMCA下架流程,创作者提交简短声音样本或合同证明后,语音可在不到3分钟内被移除。不过,该机制无法阻止他人在不知情的情况下上传艺术家声音,只有在艺术家发现并申请下架前,声音会持续被使用。
投资方Coreline Ventures的合伙人Oskue Honda指出,社区驱动模式只有在创作者信任平台时才能成为持久优势,认为行业需要走向验证的声音所有权、清晰的授权条款、简易的举报和下架流程,以及最终让创作者在声音被商业使用时获得收益的分成模式。Fish Audio计划今年发布音频理解模型,并正在构建语音到语音模型。在竞争激烈的语音生成市场(对手包括ElevenLabs、WellSaid、Cartesia等),359 Capital合伙人Rico Mallozzi认为,Fish Audio对开发者的细粒度控制以及成本高效的模型训练将帮助其与大型AI实验室竞争。


