CosyVoice
3 秒零样本语音克隆
版本: v1.1.0
大小:17.25M
语言:简体中文
类型:系统工具
授权:免费
更新:2026-07-03 09:33
厂商:通义云启(杭州)信息技术有限公司
包名:com.tongyi.funaudio.cosyvoice
MD5:9a7d0a655ee8b31e1b30adc3f8c1ce2c
系统要求:需要支持安卓系统5.2以上
CosyVoice是阿里巴巴通义实验室推出的开源多语言语音生成大模型,只需要一段 3 秒干净无杂音的人声音频,不用额外训练微调,就能高度还原原声音色,用中文样本也能生成英文、日语语音。还能自由控制情绪、语速,开心、低沉、带笑意的语气一键切换,生成语音几乎没有机械感。
CosyVoice怎么用
1、打开CosyVoice app,完成注册登录。
2、根据app内指引,完成系统输入法切换设置。
3、点击任意输入框,即可唤起CosyVoice键盘。
4、键盘界面中央设有独立的语音录制按钮。点击一次开始口述,再次点击结束录音并启动转写,或者长按识别,将文字实时填入输入框。
5、键盘还自带撤销、换行等便捷编辑功能。
CosyVoice使用指南
1、自动过滤「嗯、啊、那个」
实时高质量语音转文本,CosyVoice 在转写过程中自动识别并去除口语化的填充词与重复词,让你的每一句话都干净利落。
2、散乱的口述,自动排成清单
说出一堆事情,CosyVoice 自动识别其中的项目结构,整理成编号列表、表格或大纲,条理清晰,可直接发送。
3、说错了?「不对,改成…」就行
CosyVoice 能识别口语中的自我修正——「不对不对」「改成」「我意思是」——并自动应用到最终稿件,不留改口痕迹。
4、说一句指令,得到一封完整邮件
写邮件、写会议邀请、写 vlog 脚本——告诉 CosyVoice 你想要什么格式,它直接给你完成稿,称谓、问候、签名一应俱全。
5、数字、公式、单位,都帮你写对
口播中的「三点五八亿」「百分之十二点六」自动还原为「3.58 亿」「12.6%」,还能识别公式表达并补齐符号,金融、科研、媒体场景都能直接用。
6、上海话、粤语、川话,都能听懂
无缝识别上海话、粤语、四川话等多种方言,并能将其转写为标准普通话,跨地区团队、田野调研、客户访谈都不再被口音卡住。
常见问题
1、声音克隆素材要求:
想获得更好的克隆效果,建议提供时长足够、音质清晰、背景噪音少的音频样本。样本越干净,生成结果通常越自然。
2、参考音频限制:
部分功能会限制参考音频时长,音频内容也要尽量和待合成文本匹配。素材差异过大时,可能会影响最终合成质量。
3、支持的情感类型:
软件支持中立、快乐、悲伤、愤怒、恐惧、惊讶、厌恶等多种情感,可通过指令或参数进行调用和控制。
4、音频断句不自然:
如果生成语音停顿不够自然,可以在输入文本中增加句号、逗号等标点,明确断句位置后,语音节奏会更顺一些。
更新日志
v1.1.0版本
1、支持多语言-(日韩英繁体中文)
2、历史记录支持编辑修改
3、支持二维码加入内测群
4、支持标点符号过滤设置
-
权限要求:
查看
-
隐私政策:
查看
-
包名:
com.tongyi.funaudio.cosyvoice
-
MD5:
9a7d0a655ee8b31e1b30adc3f8c1ce2c
