為孩子的聲音 打造語音 AI

我們開發更能理解孩子聲音的技術,並讓每項結果所依據的資訊都能清楚說明。

內部驗證7.05%

與訓練資料不重疊的獨立測試:1 位說話者、50 句兒童語音的字元錯誤率

Kaffol AI

從孩子的回答到報告

不只將語音轉成文字。我們結合孩子的月齡、作答題目與評估規則,讓報告文字的依據可以被確認。

  1. 01孩子的回答

    兒童語音與行為輸入

    透過攝影機、麥克風與觸控取得孩子親自展現的反應

  2. 02語音辨識

    Kaffol ASR+LoRA

    以 Qwen3-ASR 1.7B 為基礎,搭配約 25 MB 的自有 LoRA 配接器

  3. 03確認依據

    連結依據的解讀

    各年齡題目、同齡比較資料,以及經專家檢視的評估規則

  4. 04結果說明

    容易理解的報告

    根據實際回答,整理目前表現與下一步對話建議

內部驗證結果

以相同兒童語音進行比較

我們在相同內部樣本上,比較套用自有 LoRA 的 ASR 字元錯誤率(CER)。數值越低,表示結果越接近原文。

測試條件1 位獨立測試說話者、50 句,與訓練資料不重疊

這是用於確認 LoRA 對兒童語音改善效果的小規模內部基準測試,不代表在一般情境下具有全面的效能優勢。

字元錯誤率越低越準確
各模型在相同內部兒童語音樣本上的字元錯誤率比較
模型字元錯誤率
Kaffol AI ASR7.05%
Qwen3-ASR 1.7B 基礎模型8.89%
OpenAI gpt-transcribe9.56%

說明技術的原則

區分目前使用的技術與研究中的技術。

目前

即時互動與非同步分析的雙軌流程

目前的線上流程,同時驗證用於辨識回答起訖的通用 ASR 流程,以及採用自有 ASR 與 RAG 的非同步分析流程。

研究

適應兒童語音的小型配接器

我們透過約 25 MB 的 LoRA 配接器,固定語音編碼器並訓練文字解碼器,研究適應兒童語音的可能性。

發展規劃

以本地端 AI 探索隱私保護

配合場域驗證與製造準備的進度,我們正評估在更靠近裝置的位置處理兒童資料的本地端與裝置端方案。

籌備中01

常模化統計分析與學術論文

我們以題目研究為基礎,準備常模化統計分析與學術論文,不會將尚未完成的研究描述為已完成。

R&D02

已提出 2 件本地端 AI 相關專利申請

我們已提出 2 件本地端 AI 相關專利申請,目前明確標示為申請中,而非已獲授權。

一起研究

尋找共同進行兒童語音研究與場域驗證的夥伴。

洽詢技術與研究合作