AIRI 语音输入输出配置实战:TTS 语音合成与 ASR/STT 语音识别完整指南
AIRI 语音输入输出配置实战TTS 语音合成与 ASR/STT 语音识别完整指南【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airiAIRI 的语音能力分为语音合成TTS将 AI 回复朗读出来与语音识别ASR/STT将麦克风音频转成文本两条独立链路二者可以分别配置、互不影响。本文以官方配置手册 audio.md 为主线结合仓库中 Settings 页面speech.vue、hearing.vue的源码实现完整讲解从 Provider 填凭据、Playground 试听到 Module 启用声音/听力的全部流程并给出常见故障的排查路径读完即可在 Web / 桌面端把 AIRI 的语音对话跑通。语音配置的两层架构Provider 与 ModuleAIRI 的语音配置遵循先配 Provider、再启 Module的两段式设计这与整个设置体系见 Common Configuration Instructions保持一致Provider 层Settings → Providers → Speech / Transcription负责录入服务商的 API Key、Base URL、Region 等凭据并支持自动校验与 Playground 试听Module 层Settings → Modules → Speech / Hearing负责从已配置的 Provider 中挑选当前生效的模型与音色真正把能力挂到 AIRI 的回复管线Speech或麦克风输入管线Hearing上。这样设计的好处是一个 Provider 凭据可以被反复测试、随时切换而不用改动底层配置同时 TTS 与 ASR/STT 互不耦合你可以用云端 TTS 配本地 Web Speech API 识别也可以反过来组合。配置语音合成TTS按照 audio.md 的流程启用语音合成分三步打开Settings → Providers → Speech选择一个 Provider 并填入其凭据API Key 等在 Provider 页面自带的playground如果可用中输入一句短测试句试听合成效果打开Settings → Modules → Speech选择刚配置好的 Provider、模型与音色。第 2 步的 Playground 试听只验证 Provider 是否连通并不会自动把该 Provider 用于正常回复——必须在第 3 步的 Module 页显式选中这与 ElevenLabs 指南中的明确说明一致The playground test alone does not enable the provider for normal replies。Speech Provider 一览仓库docs/content/en/docs/manual/config/providers/speech/目录下收录了以下 TTS Provider 指南Provider特点OpenAI Compatible API (TTS)接入任何实现 OpenAI speech API 的服务ElevenLabs使用 ElevenLabs 账号内的音色Kokoro TTS (Local)AIRI 内置的原生本地 TTS无需云端 KeyAlibaba Cloud Model Studio / Azure Speech / Deepgram / Google Gemini / Mimo / Minimax / OpenRouter / Player2 / Volcengine 等各家云 TTSBrowser local TTS、Desktop local TTS⚠️ 当前不可用设置页仅有 Work in Progress 占位注意后两项browser-local与desktop-local两个 Provider 页面明确标注 Unavailable官方建议在生产配置中跳过改用 KokoroAIRI 已实现的本地合成或任意云 TTS。关键字段API Key、Base URL、Model、VoiceProvider 表单中最常见的四个字段详见 common.md 的字段表API Key服务商签发的访问令牌粘贴完整 Key不要多带引号、空格或换行Base URL服务商 API 根地址仅当服务商文档明确要求时才改动需包含完整的https://或http://前缀Model用于合成/识别的模型 ID优先从 AIRI 的模型列表中选择若列表加载失败且字段支持自定义输入可精确填入服务商文档中的 IDVoice合成所用的音色 ID先选 Model 再选 Voice因为音色必须由该模型支持。以 ElevenLabs 为例还有一个特殊点其默认 Base URL 是 AIRI/UnSpeech 网关https://unspeech.hyp3r.link/v1/而不是 ElevenLabs 直连地址——你的 Key、合成文本与音频都会经过该网关仅在你能接受这一信任边界时使用否则应填入自托管网关地址或改选直连的 Provider。使用 OpenAI 兼容接口接入 TTS如果你的语音服务实现了 OpenAI speech API优先参考 OpenAI Compatible API (TTS)打开Settings → Providers → Speech → OpenAI Compatible填入 API Key 与要使用的 TTS 模型 ID按需调整语速注意OpenAI Compatible 没有默认 Base URL必须完整填写兼容服务文档给出的 API 根地址官方 OpenAI 则应选择独立的OpenAIProvider。⚠️ 兼容性判断/v1结尾的地址或sk-开头的 Key本身不保证OpenAI speech API 兼容务必以服务商文档为准。配置完成后回到Settings → Modules → Speech选中 Provider、模型、音色输入测试文本点击Test Voice能听到音频即配置成功。源码印证Speech 模块页的实现Modules 层的 Speech 页面实现位于 packages/stage-pages/src/pages/settings/modules/speech.vue从源码可以看到几个与手册对应的实际细节页面内置了试听逻辑默认测试文本为Hello, my name is AI AssistanttestTextref并调用generateSpeech来自xsai/generate-speech生成音频后用audio播放除 Provider / Model / Voice 三项选择外还提供pitch音高调节、SSML开关ssmlEnabled/useSSML、VoiceCardManySelect音色卡片选择、模型搜索modelSearchQuery等字段页面区分已配置的语音来源与全部 Provider 元数据moduleSpeechProvidersMetadata/allAudioSpeechProvidersMetadata只有被正确配置的 Provider 才会出现在 Module 可选列表里——这正是Provider 配好后 Module 才能选到的底层原因。配置语音识别ASR/STT语音识别按照 audio.md 分为四步打开Settings → Providers → Transcription选择 Provider 并录入凭据打开Settings → Modules → Hearing选择已配置的 Provider 与模型选择正确的麦克风点击Start Monitoring开始监听说一句简短的话在识别结果区域确认文本是否正确显示。Transcription Provider 一览docs/content/en/docs/manual/config/providers/transcription/目录收录了以下 ASR/STT ProviderProvider特点Web Speech API使用浏览器内置识别能力无需 API Key仅限 Web 版OpenAI Compatible API (ASR/STT)接入 OpenAI 兼容转录接口Aliyun / Mimo / Comet API / Official云转录服务Browser local / Desktop local本地转录选项其中 Web Speech API 是快速体验语音输入的最简方案它调用浏览器内置的语音识别不需要任何 Key。配置时在Settings → Providers → Transcription → Web Speech API选择Recognition Language识别语言并可开启Continuous Recognition连续识别与Show Interim Results显示中间结果。注意该 Provider仅存在于 Web 版Electron 桌面版不提供且识别质量会随浏览器、网络环境与语言不同而变化。使用 OpenAI 兼容接口接入 ASR/STT与 TTS 同理若转录服务实现 OpenAI transcription API按 OpenAI Compatible API (ASR/STT) 配置打开Settings → Providers → Transcription → OpenAI Compatible填入 API Key 与 ASR/STT 模型 ID该 Provider 同样没有默认 Base URL需完整填写兼容服务的 API 根地址官方 OpenAI 请选择独立的OpenAIProvider。验证时回到Settings → Modules → Hearing选中 Provider 与模型、选择音频输入设备点击Start Monitoring后对着麦克风说话或播放一段音频转录区出现文本即成功若识别不准可调整灵敏度后重试。源码印证Hearing 模块页的实现Hearing 页面实现在 packages/stage-pages/src/pages/settings/modules/hearing.vue其源码细节与手册高度吻合页面通过useSettingsAudioDevice的askPermission/startStream/stopStream管理麦克风权限与媒体流并配合useAudioAnalyzer显示实时音量电平volumeLevel——无文本时先查麦克风权限正是由此而来Start Monitoring 背后是完整的语音活动检测VAD管线页面暴露了useVADThreshold默认 0.6范围 0.1–0.9、useVolumeThreshold默认 10范围 1–80、useVADMinSilenceDurationMs默认 800ms并可在 VAD 模型与基于音量检测两种模式间切换识别结果以segment片段形式逐段呈现每段有recording / transcribing / complete / empty / error等状态空片段与失败片段分别显示无语音与转录失败提示对应 hearing-playground-segment.vue 中的实现支持流式输入supportsStreamInput、置信度阈值confidenceThreshold可禁用、识别文本自动发送autoSendEnabled/autoSendDelay等进阶选项。常见故障排查FAQTTS 没有声音确认Settings → Modules → Speech中已选中 Speech Provider、模型和音色Playground 试听成功不代表 Module 已启用检查系统输出设备与音量若 Playground 报错检查 API Key、账号余额/额度与模型能力部分模型不支持目标音色或语言。ASR 识别不出文本确认 AIRI 拥有麦克风权限且 Hearing 页选择了正确的输入设备源码中对应askPermission与selectedAudioInput实时识别服务场景下网络中断或浏览器/系统撤销麦克风权限同样会导致结果为空若使用 Web Speech API还需确认浏览器支持该 API 且识别语言设置正确。语言或音色不正确选择 Provider 对目标语言支持的模型与音色先选模型、再选音色转录的语言、区域Region与模型设置必须与 Provider 账号开通的能力一致——Region 需与云服务商控制台中的项目/资源区域对应见 common.md。通用校验逻辑与下一步Provider 配置是否成功可依以下顺序验证来自 common.md 的 Verification results 小节Chat/语音类 Provider 表单会自动校验必填字段暴露Ping API的 Provider 可发送实时请求可能消耗少量额度Speech Provider 用 Playground 试听合成Transcription 则在 Hearing 页用所选麦克风实测。验证失败时按顺序排查确认账号有服务权限与额度 → 重新复制 API Key避免头尾空格/换行→ 恢复默认 Base URL 或与服务商文档逐字比对 → 确认网络/代理/防火墙可达 → 改用 Provider 明确支持的模型不要把显示名当模型 ID。进一步深入学习字段与校验细节见 Common Configuration InstructionsProvider 专属指南在Providers → Speech与Providers → Transcription目录下按需查阅。【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考