配音阵容

配音阵容

VoiceCast 是一座桥梁,将语音命令与 Hytale RootInteractions 连接起来,使模组制作者能够构建语音激活的施法和交互流程。

图书馆

VoiceCast

VoiceCast 是一个连接语音指令与 Hytale RootInteractions 的桥梁,让模组制作者能够构建基于语音激活的施法和交互流程。

你可以在资源文件中定义“法术”(可施法项),每个法术指向一个 RootInteraction 以及一个或多个语音别名(关键词)。当玩家说出某个关键词时,VoiceCast 便会触发对应的交互。


什么是 VoiceCast?

VoiceCast 是一个轻量级系统,它能监听玩家的语音,并在识别到的关键词与你配置的法术别名匹配时,触发 RootInteractions

具体操作: 你创建一个 VoiceCastCastable 资源,其中包含:

  • rootInteractionId(要执行的内容)
  • languageIds / 别名(能够激活它的词语或短语)
  • 可选的要求(所需物品 / 消耗物品)

运行模式

VoiceCast 目前支持两种后端:

1) 原生模式(实验性)

原生模式 直接连接到游戏内的语音聊天流(近距离语音聊天数据包),并使用 Vosk 进行离线语音转文字。

  • 状态: 实验性
  • 可用性: (目前)仅限包含内置语音聊天的当前预发布版本
  • 优点: 无需浏览器链接,无 Web Speech API 的怪癖,支持离线工作,服务器端行为一致
  • 要求: 需要 Vosk 模型(支持自动下载)

2) 网页模式(旧版 / 可选)

网页模式会暴露一个小型网页界面,玩家在浏览器中打开一个私有链接。浏览器负责捕获麦克风音频并进行语音识别(Web Speech API)。

  • 状态: 可用,但不再是重点默认模式(鉴于预发布版本中已存在原生语音聊天)
  • 优点: 无需下载模型,概念简单
  • 缺点: 需要打开浏览器,且高度依赖浏览器支持 / 权限

语言支持

VoiceCast 根据所选择的后端支持多种语言:

  • 原生模式(Vosk): 取决于你安装(或自动下载)的 Vosk 模型。默认情况下为英语
  • 网页模式(Web Speech API): 取决于浏览器的语音引擎和区域设置。

如果你想将某种语言添加到默认的自动下载映射中,请告诉我你希望作为“推荐小型模型”的具体语言及其对应的 Vosk 模型。


工作原理(高级概述)

原生模式(实验性)

  1. VoiceCast 读取传入的语音聊天音频数据包(预发布版语音聊天)。
  2. 音频在服务器端解码并发送至 Vosk。
  3. 转录文本与你的法术别名进行比对。
  4. VoiceCast 为该玩家触发映射的 RootInteraction。

网页模式(可选)

  1. 服务器暴露一个小型网页界面(内嵌网页服务器)。
  2. 玩家运行 /voicecast 命令生成一个私有可点击链接。
  3. 玩家在浏览器中打开该链接并开始监听。
  4. VoiceCast 匹配转录文本并触发映射的 RootInteraction。

配置与服务器设置

为了保持本 README 的简洁与准确,完整的配置指南位于 Wiki 中,包括:

  • 原生模式设置(Vosk 模型自动下载、语言映射、故障排除)
  • 网页模式设置(局域网/专用服务器/域名/HTTPS)
  • 常见问题与推荐设置

路线图

  • 提升原生模式的准确性与用户体验(更好的短语处理、更好的别名匹配、按语言调优)
  • 扩展默认模型的自动下载映射(更多语言)
  • 在原生语音聊天不可用的情况下,将网页模式作为备选方案保留

错误报告

请在报告错误和异常行为时,包含以下信息:

  • 你的服务器版本(特别是是否为包含语音聊天的预发布版本)
  • 你的 VoiceCast 配置
  • 控制台日志(如果需要,请启用调试日志)
  • 一个示例法术配置(请隐去私有信息)