VOICE / TUNE虚拟歌姬语调制作
2025—2026 ACG 音乐会制作经验

虚拟歌姬
语调制作简易教程

作者洛叶
方法ACE / SoVITS
配套工程与模型
01 / PREFACE

前言

大家好,我是洛叶,平时会摸鱼调些歌。欢迎关注我的 Bilibili 主页

在正式开始之前,先简单介绍一下什么是“语调”。顾名思义,语调就是让这些原本负责唱歌的家伙能够开口说话。2025、2026 两届 ACG 音乐会的主持音频,均采用语调的方式制作。

本文会简单介绍音乐会中采用的语调制作方法及相关工具。文中可能存在介绍不够详细或内容有误的地方,欢迎大家指出。

02 / PREPARATION

准备工作

开始制作语调之前,需要根据采用的方法准备相应的软件和素材。

01

传统工具

Tytalk 大多用于传统拼接声库,也就是 V 声库。由于我没有实际使用过,因此本文不作详细介绍。

观看 Tytalk 相关教程
03

GPT-SoVITS

AI 音色克隆工具,既可以使用公开模型,也可以自行训练模型。

查看入门教程

VOCALOID4 编辑器

另一种方法是在 VOCALOID4 编辑器中直接调校。@寒天集萤 老师曾在去年的“依言依语”语调活动中编写过相关教程。不过活动群已经解散,我也没有保存当时的 PPT,因此暂时无法附上资料。

如果有朋友仍然保存着相关 PPT,欢迎联系我。经原作者许可后,我会将资料补充到这里。

03 / WORKFLOW

具体方法

本文主要介绍两种制作方式:使用 ACE Studio 抽取参数后人工修改,或使用 GPT-SoVITS 模型直接生成音频。

AACE Studio 抽参控制空间更大 · 需要人工修整
BGPT-SoVITS 生成操作更简单 · 结果存在随机性
AACE STUDIO

ACE Studio 抽参法

2025 年 ACG 音乐会采用的是现有的洛天依模型,以及通过 ACE Studio 抽参制作的乐正绫语调。

3.1.1准备参考音频

假设你已经有一段需要制作成语调的文本,首先需要准备一段念出这段文本的参考音频。

如果你希望使用女声声库制作语调,参考音频最好也采用女声。男声音频对歌姬来说往往偏低,抽参后可能出现工程音高线乱飞的情况,从而明显增加后续修改的工作量。

  • 人声清晰,环境杂音较少
  • 吐字清楚
  • 语速和情绪符合预期
  • 音高不明显超出目标声库的舒适音域

3.1.2什么是抽参

“抽参”可以简单理解为:将音频中的人声转换成 MIDI 音符块,并提取其中的音高变化。

目前我主要推荐 ACE Studio。其他编辑器,例如 Synthesizer V,也有类似功能,但就我个人的使用体验而言,效果并不如 ACE Studio 理想。

除了较好地还原音高,ACE Studio 的抽参功能也能保留一部分说话时的动态。这里可以将“动态”简单理解为声音的抑扬顿挫——说话如果完全没有起伏,听起来通常会不太自然。

3.1.3在 ACE Studio 中进行抽参

  1. 01
    导入音频

    将准备好的参考音频直接拖入工程。

  2. 02
    打开 AI 工具

    右键单击音频片段,在菜单中选择“AI 工具”。

  3. 03
    人声转 MIDI

    选择“人声转 MIDI”,等待软件完成处理并检查音符块。

右键单击导入的音频片段,依次选择“AI 工具”与“人声转 MIDI”。

3.1.4判断工程是否可用

接下来的操作需要一些基础调校知识,例如音高线绘制、辅音长度调节等。本文不会详细介绍这些基础操作;需要了解时,可以在 ACE Studio 官方账号中查找相应教程。

得到初步工程后,首先需要通过自己的耳朵判断它是否可用。如果连最基础的“勉强能听”都达不到,就应当考虑重新抽参或更换参考音频。杂音较多、吐字不清晰,或者音域相差太大,都可能导致效果不理想。

确定工程基本可用后,再进行细节修改。这些修改通常没有完全量化的标准,很多时候需要依靠听感判断问题所在。

3.1.5修改音高

语调的音高不需要细致到唱歌调校的程度,但整体走向至少不能出错。

  • 第二声通常会出现比较明显的音高上行;
  • 第四声通常会出现比较明显的音高下行;
  • 字与字之间的衔接也需要特别注意;
  • 重音、疑问语气和情绪变化应有相应的音高起伏。

修改没有统一数值标准,最重要的判断依据仍然是你的耳朵。当某一段听起来奇怪时,可以尝试调整音高线:上移效果不好,就试试下移;变化太大,就将曲线画得平缓一些,直到听感更加自然。

3.1.6修改动态和响度

ACE Studio 偶尔会出现抽参结果不稳定的情况,因此可能产生音量不统一的问题。可以使用响度参数,将音量突然变大或变小的部分调整到与前后内容接近的水平。

不必追求波形完全一致,重点是避免明显突兀,并保留正常说话应有的强弱变化。

3.1.7调整辅音和元音长度

辅音和元音长度同样以听感为主。如果某个字听起来含糊、拖沓或衔接不自然,可以检查:

  • 辅音是否太短,导致吐字不清;
  • 辅音是否太长,导致发音生硬;
  • 元音是否拖得太久;
  • 相邻音符之间是否存在不自然的空隙或重叠。

调整后建议反复试听,并结合前后句判断,而不是只听单个字。

3.1.8导出成品

完成修改后,就可以从 ACE Studio 中导出音频,得到需要的语调成品。

ACE PROJECT

2025 年 ACG 音乐会语调工程

仅供学习和交流使用,严禁未经许可进行二次发表。

下载 .acep 工程
AUDIO COLLECTION

2025 年 ACG 音乐会串词语调音频汇总

由洛叶与 @桜舞Phymusics 共同完成。夸克网盘提取码:Gdjn

前往夸克网盘
BGPT-SOVITS

GPT-SoVITS 生成法

GPT-SoVITS 是一种更加简便的方法。通常只需要准备好相关模型,通过简单操作就能得到质量不错的音频,比 ACE Studio 抽参方便不少。

不过众所周知我们中术是冷门圈子,目前流传较广的公开模型主要是洛天依,其他歌姬的公开模型很少。

VOICE MODEL · V2 PRO

洛天依 GPT-SoVITS 模型|13 周年生日会语音生成模型

由 Bilibili 用户“只想干饭的麦克斯韦妖”制作。夸克网盘提取码:pUfE

前往夸克网盘

在 2026 年 ACG 音乐会开始前,在 @wingtings 的协助下,我们将上一年纯手工制作的乐正绫主持音频训练成了模型。虽然仍有一些瑕疵,但它已经能够相对稳定地达到这两届音乐会主持音频的效果,我认为在大部分使用场景中已经足够。

使用时请尽量注明模型来源,虽然不标注的话,我大概也发现不了(x)。

VOICE MODEL · V2 PRO

乐正绫 GPT-SoVITS 模型

夸克网盘提取码:Vmit。如果觉得网盘下载麻烦,也可以联系我直接发送。

前往夸克网盘

3.2.1基本使用流程

本文不会详细介绍 GPT-SoVITS 的安装和具体操作,只简单说明语调制作流程。无论是使用公开模型,还是自己训练模型,都可以在 Bilibili 找到相应教程。

观看 GPT-SoVITS 入门教程视频

最常见的操作就是反复生成音频。你可以把这个过程理解成“抽卡”:不断重新生成,直到得到比较满意的结果。也可以修改部分参数后重新生成。整体而言,这是一个操作简单但可能比较耗时的过程。

3.2.2长句效果不好时

如果反复生成仍然无法得到满意的音频,可以先尝试缩短句子。长句或结构复杂的句子,生成效果往往不如短句稳定。

可以将长句拆成几段分别生成,然后在宿主软件或音频编辑器中重新合并。合并时,需要重点注意句子之间的停顿时长,避免停顿过长或过短。

3.2.3外语单词念错时

生成英文等外语内容时,可能会出现单词读错或发音不清的情况。例如,ACG 音乐会的语调中就遇到过 ACGVOCALOID 等单词的发音问题。

这时可以采用“拆开生成,最后合并”的方法。以 VOCALOID 为例,可以尝试分别生成 vocalloid。虽然后者不是常规英文单词,但只要最终读音符合需要,就可以作为合成素材使用。

生成完成后,删去 vocal 尾部多余的声音,再将两段音频拼接起来。仔细听可能仍有瑕疵,但通常会比直接生成整个单词有明显改善。

类似的误读在中文中也可能出现。因此,你需要充分发挥想象力,通过换字、拆字、调整断句或重新拼接等方式,凑出一段令自己满意的音频。

04 / POST-PROCESSING

后期处理

大多数情况下,语调的后期处理要求并不高,因为通常只有人声,没有伴奏。主要需要注意以下两点。

01

平衡整体音量

尽量让整段音频的音量保持稳定,消除突兀变化,同时保留正常说话时的轻重和情绪起伏。

02

调整句子间隔

间隔太长会让语气断裂,太短则显得拥挤。建议结合语义、标点和情绪进行调整,并完整播放检查。

05 / SUMMARY

总结

以上就是我个人总结的一些语调制作经验。

简单来说,ACE Studio 抽参法需要更多人工修改,但控制空间更大;GPT-SoVITS 生成法操作更加简单,但生成结果存在一定随机性,有时需要多次尝试和后期拼接。

如果你对语调制作感兴趣,欢迎亲自尝试。实际操作过程中遇到问题,也可以随时联系我交流。

06 / RESOURCES

相关资源