解耦时间深度的内存高效音频合成方法

AppleSiri Expressive Voices 中部署了一套内存高效的音频合成架构,核心是一个将语义音频 token 转换为高保真音频的 detokenizer,运行在 Apple Matrix Coprocessor(AMX)上,算力来自 AFM 3 Core Advanced——Apple 最强的端侧基础模型,激活参数量约 10 亿。

传统方法中,Transformer 或 GAN 的注意力复杂度随序列长度线性或二次增长,内存占用高,无法在嵌入式协处理器上长时间流式合成。这篇工作提出解耦时间深度(Decoupled Temporal Depth)的扩散变换器:架构由三个组件构成——streaming encoder、temporal decoder 和 depth decoder。核心创新在于用一个带 DiT 风格 stage conditioning 的可复用 depth decoder 逐步自回归生成所有 RVQ 层级,替代了传统多解码器架构中每个层级各配一个独立解码器的做法;同时采用因果滑动窗口注意力,配合固定窗口大小的 key-value 缓存,使得内存复杂度恒定,不随序列长度变化。

实际部署在 AMX 上,每步生成耗时约 10ms,大约是实时速度的 16 倍;峰值运行内存仅约 21MB,设备端模型资产共 329MB,可以在端侧基础模型之外连续流式合成 20 到 320 秒的音频。消融实验验证了 DiT 条件机制、时间 lookahead 处理、统一深度解码策略等关键组件的有效性。在语音质量评测上,相比前代端侧文本转语音系统,整体 Mean Opinion Score(MOS)提升 +0.28(4.15 vs 3.87),对话语音提升 +0.42(4.24 vs 3.82)。

该架构已作为 Siri Expressive Voices 的一部分投产,配合 Apple 设备中的 Pace 和 Expressivity 定制滑块,支持自定义助手语音,是 Apple 语音交互系统的一次底层更新。

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

查看原文