> For the complete documentation index, see [llms.txt](https://ai4commsci.gitbook.io/formosanbank/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://ai4commsci.gitbook.io/formosanbank/zh/yu-liao-ku-jia-gou/yu-liao-ku/guo-li-tai-wan-da-xue-pai-wan-yu-zi-dong-yu-yin-bian-shi.md).

# 國立臺灣大學排灣語自動語音辨識

### **概述**

國立臺灣大學排灣語自動語音辨識語料庫包含宋麗梅教授於兩個田野年度蒐集的排灣語朗讀及自發性語音。

此語料庫主要收集排灣語的朗讀語音（含與其對齊的文本）以及少量的自發性語音錄音。其旨為促進語言保存與語言學研究，並特別致力於開發專門針對排灣語的自動語音辨識（ASR）工具。

#### 內容摘要

* 涵蓋語言：排灣語
* 語料庫內容：
  * 具有句級文本及音檔對齊的朗讀語音
  * 含已轉寫片段及未轉寫剩餘部分XML檔案的自發性語音
* 語料貢獻者：兩個田野年度共16位錄音人員，公開資料全程使用化名

目前公開語料庫包含260個XML檔案，涵蓋北排灣、中排灣、東排灣及南排灣。

***

### **語料庫處理**

朗讀語音的XML由ELAN來源建立。第二個田野年度及自發性語音則由`CodeAndDocs/build_y2_and_spontaneous.py`建立，之後執行標準清理、拼寫法、音韻及驗證流程。公開程式會套用化名，且不含錄音人員的真實姓名。

音檔存放於Hugging Face，而非提交至Git。執行語料庫中的`download_audio_data.sh`會下載完整錄音，再由`CodeAndDocs/extract_audio_clips.py`重建XML所引用的句級音檔。若要完整重建語料庫，仍需要未公開的原始錄音及錄音人員對照表。

***

### **應用**

臺大排灣語自動語音辨識語料庫是推動數個關鍵領域研究和技術發展的重要資源：

* **自動語音辨識（ASR）：**&#x5C0D;齊的文本和音訊檔案使這個語料庫在開發專為排灣語設計的語音辨識系統中具有特殊價值，預期將支援排灣語的自動轉寫軟體及語音介面等工具的開發。
* **語言復振：**&#x652F;援排灣語使用者和學習者創建教材和語言學習資源。
* **語音技術發展：**&#x4FC3;進文字轉語音系統和發音建模等工具的開發。
* **語言學分析：**&#x652F;援語法、聲韻、言談架構和其他語言現象的研究。
* **比較研究：**&#x652F;援臺灣南島語之間共同特徵和差異的研究。

***

### **存取資訊**

* XML、處理文件及音檔下載程式可於[FormosanBank](https://github.com/FormosanBank/FormosanBank/tree/main/Corpora/NTU_Paiwan_ASR)取得。

***

### **版權**

目前公開XML將此語料庫標示為CC BY。FormosanBank的使用條款及AI使用附錄亦適用。

***

### 致謝

本語料庫是由國立臺灣大學語言學研究所宋麗梅博士指導的合作團隊所開發。此專案是FormosanBank計劃下的一部分，特別感謝所有參與錄音的排灣族人以及研究助理，感謝他們在這一項重要保存工作中的支持與合作。

***

### **引用說明**

根據我們的[使用條款](/formosanbank/zh/qi-ta-zi-yuan/shi-yong-tiao-kuan.md)，若您在任何出版物中使用此語料庫或任何從此語料庫衍生的產品，您必須同時引用FormosanBank以及以下資料：

* Le Ferrand, É., Prud'hommeaux, E., Hartshorne, J. K., & Sung, L.-M. (2024). NTU Paiwan ASR Corpus. Electronic Resource.
