即時互動與非同步分析的雙軌流程
目前的線上流程,同時驗證用於辨識回答起訖的通用 ASR 流程,以及採用自有 ASR 與 RAG 的非同步分析流程。
我們開發更能理解孩子聲音的技術,並讓每項結果所依據的資訊都能清楚說明。
與訓練資料不重疊的獨立測試:1 位說話者、50 句兒童語音的字元錯誤率
Kaffol AI
不只將語音轉成文字。我們結合孩子的月齡、作答題目與評估規則,讓報告文字的依據可以被確認。
透過攝影機、麥克風與觸控取得孩子親自展現的反應
以 Qwen3-ASR 1.7B 為基礎,搭配約 25 MB 的自有 LoRA 配接器
各年齡題目、同齡比較資料,以及經專家檢視的評估規則
根據實際回答,整理目前表現與下一步對話建議
內部驗證結果
我們在相同內部樣本上,比較套用自有 LoRA 的 ASR 字元錯誤率(CER)。數值越低,表示結果越接近原文。
這是用於確認 LoRA 對兒童語音改善效果的小規模內部基準測試,不代表在一般情境下具有全面的效能優勢。
| 模型 | 字元錯誤率 |
|---|---|
| Kaffol AI ASR | 7.05% |
| Qwen3-ASR 1.7B 基礎模型 | 8.89% |
| OpenAI gpt-transcribe | 9.56% |
說明技術的原則
目前的線上流程,同時驗證用於辨識回答起訖的通用 ASR 流程,以及採用自有 ASR 與 RAG 的非同步分析流程。
我們透過約 25 MB 的 LoRA 配接器,固定語音編碼器並訓練文字解碼器,研究適應兒童語音的可能性。
配合場域驗證與製造準備的進度,我們正評估在更靠近裝置的位置處理兒童資料的本地端與裝置端方案。
我們以題目研究為基礎,準備常模化統計分析與學術論文,不會將尚未完成的研究描述為已完成。
我們已提出 2 件本地端 AI 相關專利申請,目前明確標示為申請中,而非已獲授權。
一起研究