feat: preserve stereo channels and require reviewed speaker roles
This commit is contained in:
@@ -8,6 +8,18 @@
|
||||
|
||||
**真实模型门禁仍未通过**:9月29日本地 Dify 探针返回 `CONFIG_MISSING`;10月7日已按用户指定兼容接口发起合成音频检查,返回 `AUDIO_NOT_PROCESSED`,详见文末。不能把 HTTP 200、上传成功或文本能力当成音频识别成功。媒体测试中的完整一小时WAV→MP3、HTTP回环模型和浏览器合成数据不是实际Dify识别验收;混合口音需代表性脱敏样例。
|
||||
|
||||
## 2026-10-08 双声道修订(优先于下方早先混音验收)
|
||||
|
||||
- `asr_then_llm` 对双声道默认按15秒原始时间窗分别转写左右声道,不再使用混音。`ASR_STEREO_CHUNK_SECONDS=15`(1..30)独立于mono的120秒设置;两声道总段数仍上限1000,>2声道明确拒绝。
|
||||
- 新checkpoint v2和提供方指纹绑定声道数、`separate-fixed-windows-v1`策略、窗口长度与exact-zero策略。证据增加不可修改的`channel`、原始区间;mono/旧结果兼容读取,旧未知请求不能改绑/重放。
|
||||
- 只有转换后的PCM16k/s16le逐字节全零,才以`local_silence`本地完成并保留区间,无上游请求ID。任何非零低音量仍送ASR;这不是VAD或按音量丢段。
|
||||
- 页面增加左右声道片段、原音/左/右回听和人工角色映射:`unconfirmed`、`left_service`、`right_service`。患者侧标签是“患者/家属端”,不能只按声道推定本人。角色标注不自动重提炼;保存/切换角色取消全部选中,须重新逐项核对。新stereo未保存角色禁止apply,角色及审核人进入加密审计。
|
||||
- 4份获准录音在私有一次性MySQL均通过完整Upload→queued→独立Worker→左右ASR→Qwen→review;338个声道时间窗全部覆盖,314次真实ASR、24个本地数字静音、4次提炼。原始文件不变,全部11个候选初始未选中且须复核。
|
||||
- 按转写上下文核对,仍有约数变精确值、含混姓名/电话号码、未提及病史补阴性等错误,某样本还重复生成大量待核实文字。**分声道实现通过,不等于内容准确度通过;4份语义门槛仍FAIL**,也未取得逐字人工回听金标准。
|
||||
- 隔离诊单实际测试13项通过:未确认角色不能写入、确认角色清选择、旧版本拒绝、伪造channel拒绝、切换角色重审、明确采纳1个有依据字段、审计带角色、重复新增0行;没有真实患者业务写入。
|
||||
- 本轮后端26个脚本、前端64项、质量41项及独立复核通过;全量类型检查仍60项基线诊断,无本功能新增。完整前端构建通过,无发布脚本。原生浏览器WebAudio/实机听感验收仍缺,严格mock和源码审核不能替代实际试听。
|
||||
- 所有生产开关继续关闭。本轮没有部署应用或改变模型服务/GPU;不会因为用户猜测一边客服一边患者,就预填已确认角色。下方早先混音、缓存导入与失败记录保留为历史证据。
|
||||
|
||||
## 2026-10-08 最新结论:两阶段链路可用,语义准确度门禁未通过
|
||||
|
||||
已增加 `asr_then_llm`:真实音频分片 → ASR 转写 → 可配置文本模型提炼 → 人工审阅。原件、转写、提炼响应分别留存,不把纯文本输入冒充模型听过音频;前端显示转写进度与失败后保留的原文。该结论优先于本文下方历史记录,**不等于功能已获准上线**。
|
||||
|
||||
Reference in New Issue
Block a user