Pika 发布 Speech 模型:3B 参数实现秒级生成,成本较主流竞品降低 9 倍
Pika 正式推出 Pika Speech,一款基于 3B 参数流匹配(Flow Matching)架构的文本转语音模型。该模型能在极少的去噪步骤中生成 48kHz 录音室级音质语音,支持从 5 秒参考音频克隆音色。实测中,3 分钟语音生成仅需 0.02 秒推理因子,成本效率比 ElevenLabs v3 高出 9 倍,并创新性地通过 EOS Latent 机制实现了对语速和时长的精确控制。
Pika Labs推出的AI视频生成和编辑工具
Pika是近期热门的人工智能初创公司Pika Labs推出的AI视频生成和编辑工具,该工具可以将任何创意转化为视频,用户只需输入文字或图像,即可快速生成3D动画、动漫、卡通、电影等风格的视频。该AI视频生成工具最早于2023年4月下旬推出测试版,累计已经超过50万名早期用户使用,每周都在生成数百万个视频。不过,目前Pika还在进一步完善中,实际使用来看离大规模投入到真正的生产环境中还有一定的距离。
访问Pika的官网(pika.art),点击使用谷歌或Discord账号登录官网,加入等待列表
你也可以直接点击Discord邀请链接(https://discord.com/invite/pika)加入其Discord社区抢先体验
加入Pika的Discord社区后,选择任意一个生成频道如#generate-1,然后在输入框中输入/create+提示指令
最后等待Pika将视频生成即可
Pika 正式推出 Pika Speech,一款基于 3B 参数流匹配(Flow Matching)架构的文本转语音模型。该模型能在极少的去噪步骤中生成 48kHz 录音室级音质语音,支持从 5 秒参考音频克隆音色。实测中,3 分钟语音生成仅需 0.02 秒推理因子,成本效率比 ElevenLabs v3 高出 9 倍,并创新性地通过 EOS Latent 机制实现了对语速和时长的精确控制。
Pika 正式推出 Pika SFX,一款能将自然语言描述转化为生产级音效的实时生成模型。该模型采用文本条件扩散 Transformer 架构,结合流匹配训练与教师 - 学生蒸馏技术,在保持高保真音频质量的同时,将端到端生成延迟优化至平均 0.847 秒,显著优于行业竞品。
Pika 于 2026 年 8 月推出 Pika Music,一款支持文本、歌词、声音参考及音乐参考的多模态音乐生成模型。该模型实现了从创意方向到完整歌曲的单一工作流,支持在保持歌词固定的情况下实时调整编曲风格,并将 90 秒歌曲的生成速度提升至平均 6.21 秒,实现了创作闭环的高效迭代。
Pika 正式推出 Pika Soundtrack,一款能将视频转化为同步、全场景声音景观的生成式 AI 模型。该模型通过理解视频中的动作、材质与环境,自动生成包含音效、人声、音乐及环境音的完整音频轨道。相比竞品,Pika Soundtrack 在本地评估中成本效率提升 2 倍,实现了从“零提示”到“完整场景音频”的跨越,为视频创作者提供了前所未有的沉浸式体验。
Pika 于 2026 年 8 月正式发布 Pika Audio 系列,涵盖 Pika Soundtrack、Pika Music、Pika SFX 及 Pika Speech 四大前沿音频模型。该系列通过高效的训练与推理技术,将生成成本降低至市场同类产品的 1/20 至 1/9,显著提升了创作者的迭代效率。Pika Soundtrack 实现了视频与音频的强语义对齐,Pika Music 支持多模态输入生成完整乐曲,Pika SFX 专注于精准音效生成,Pika Speech 提供高表现力语音克隆。目前仅通过 Pika API Club 独家开放。
Pika目前处于免费公测中,用户可以加入Discord频道中体验,后续可能推出付费版本。
Pika目前默认生成的视频长度只有3秒钟,后续更新可能支持生成更长时间。
目前可以将Pika生成的视频免费商用,不过后期若Pika结束测试或推出付费版,该政策可能有变化。