Skip to content
跳到项目内容
全部项目
AI 产品/阶段发布

语音模型 Playground

逐句比较模型结果的体验工作台

WebSocketASRProvider Adapter音频
模型对比与热词体验工作台01 / 01
01

核心业务

Playground 面向语音模型体验与接入调试,包含实时识别、会议角色和目标说话人页面。增加对比 Provider 时,输入音频、切分和角色条件需要保持可解释,否则界面并排显示的文字不能说明差异来自哪里。

页面将第三方识别放在主链路最终句段下方,复用对应音频范围。用户可关闭对比,主识别模式与协议保持既有行为;同一模式的角色结果、时间和对比文本在界面中关联。

模式与音频
普通实时、角色和目标说话人有不同音频范围,比较前先确定句段来源。
模型接入
主模型与对比 Provider 分开处理,第三方输出不会改写主识别结果。
结果阅读
逐句呈现主文本、说话人和可选对比文本,降低切换页面核对的成本。
02

技术栈

界面
JavaScript · HTML / CSS · 音频输入
实时协议
WebSocket · 逐句结果呈现
模型接入
Amphion ASR · 豆包 Seed-ASR 2.0
业务适配
Provider Adapter · 角色 / 目标说话人句段
03

系统架构与部署

主识别确定最终句段及角色,音频片段被复用到对比 Provider。两条输出在界面关联,主链路不依赖对比启用。

浏览器页面

JavaScript / 音频采集 / WebSocket

选择模式、展示逐句结果并持久化对比开关。

主识别

ASR / 角色与目标说话人接口

确定业务句段、音频范围和主结果。

对比 Provider

豆包 Seed-ASR 2.0 / Adapter

对同句段调用真实识别接口,将结果追加到主文本下方。

04

核心业务链路

目标说话人模式的比较输入

目标链路 → 最终句段音频 → 对比模型 → 句段下方结果

使用目标说话人链路实际产出的音频,不重新录制整场或把非目标音频送给对比模型。角色模式和目标模式分别回归,避免模式切换后保留错误结果归属。

对比失败不改变主识别

主结果独立返回;可选对比 → 独立状态与追加文本

对比默认关闭,启用后作为逐句附加内容。主识别的角色、终态和文本保持既有协议,第三方输出以独立来源呈现。

05

关键机制与取舍

界面比较建立在音频区间上

不同模型自行断句时,结果的数量和范围并不相同;拿两段看起来相似的文字比较会掩盖输入差异。

主链路先确定最终句段,再复用该段音频调用对比 Provider。页面按句段关联结果,角色和目标模式分别限定音频来源。

用户可以沿同一段语音查看差异,界面比较仍不替代有标注数据的准确率评测。

增量扩展保留原模式行为

增加第三方模型容易把新的失败和延迟引入既有识别路径。

对比是可选附加能力,关闭时保留原协议和主页面行为;开关在实时页和会议页共享,刷新后仍可恢复选择。

新 Provider 的接入成本集中在适配与结果展示,不要求用户换一套识别工作台。

06

实践成果与验证

同一音频段

比较输入

使用最终句段范围,而不是对齐两份独立断句文字。

角色 / 目标

模式覆盖

两种模式分别检查对比结果归属与界面呈现。

可选 Provider

扩展方式

对比开关与主识别状态分开。

  • 模型接入与交互设计共同解决比较输入、结果归属和重复操作问题。
  • 实时与会议页面以增量方式加入对比能力,保留主链路业务语义。

继续浏览

语音模型 Playground · 模型对比与热词体验工作台
100%
语音模型 Playground放大预览

模型对比与热词体验工作台

别急,先让缓存热一下。