
如何用 Qwen3-ASR 生成詞級時間戳Qwen3-ForcedAligner 字幕對齊完整教程【免費下載鏈接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.項目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR 想給語音自動生成逐詞時間戳、一鍵產(chǎn)出字幕本文帶你用最簡單的步驟通過 Qwen3-ASR 及其Qwen3-ForcedAligner強制對齊模型把「音頻 文本」對齊成毫秒級的詞級時間戳輕松解決字幕制作、歌詞同步、語音分析三大難題。一、3 分鐘搞懂 Qwen3-ASR 時間戳方案Qwen3-ASR 是阿里云 Qwen 團隊開源的語音識別模型家族包含三個核心模型模型角色一句話說明Qwen3-ASR-1.7B / 0.6B語音識別支持 30 種語言 22 種中文方言識別出文本與語種Qwen3-ForcedAligner-0.6B強制對齊非自回歸模型把「文本 音頻」對齊出字/詞級時間戳 核心理解ASR 負責(zé)「聽懂說了什么」ForcedAligner 負責(zé)「精確定位每個字/詞什么時候說的」。兩者組合就是完整的語音轉(zhuǎn)字幕流水線。關(guān)鍵能力速覽? 對齊11 種語言中、英、粵、法、德、意、日、韓、葡、俄、西語? 單段音頻最長5 分鐘超過會自動切片對齊再拼接? 時間精度極高官方基準平均絕對誤差A(yù)AS僅33~43 毫秒遠優(yōu)于 WhisperX 等工具? 支持本地路徑 / URL / base64 / 內(nèi)存波形 4 種音頻輸入? 支持批量推理二、最快配置方法一鍵安裝 qwen-asr 包在干凈的 Python 3.12 環(huán)境中安裝避免依賴沖突conda create -n qwen3-asr python3.12 -y conda activate qwen3-asr pip install -U qwen-asr? 建議GPU 顯存充足時再裝 FlashAttention 2 可顯著降低顯存占用并加速對齊模型pip install -U flash-attn --no-build-isolation模型權(quán)重在首次加載時會自動下載如需手動下載如離線環(huán)境可用 ModelScope 或 Hugging Face 的 CLI 提前拉到本地目錄。三、路徑 A單獨使用 Qwen3ForcedAligner 對齊已有文本當(dāng)你已經(jīng)有轉(zhuǎn)錄文本或想用其他工具/人工校對過的文本只需 3 步就能拿到時間戳。完整示例見 examples/example_qwen3_forced_aligner.pyimport torch from qwen_asr import Qwen3ForcedAligner # 第 1 步加載對齊模型 model Qwen3ForcedAligner.from_pretrained( Qwen/Qwen3-ForcedAligner-0.6B, dtypetorch.bfloat16, device_mapcuda:0, ) # 第 2 步傳入音頻 文本 語種執(zhí)行強制對齊 results model.align( audiospeech.wav, # 也支持 URL、base64、(np.ndarray, sr) text甚至出現(xiàn)交易幾乎停滯的情況。, languageChinese, ) # 第 3 步讀取每個詞的時間戳 print(results[0][0].text, results[0][0].start_time, results[0][0].end_time) 批量對齊audio、text、language都支持傳入列表一次對齊多條音頻且列表內(nèi)輸入類型可混用URL base64 內(nèi)存波形混合都沒問題。四、路徑 BASR 時間戳一步到位推薦 ?更省事的做法初始化 Qwen3-ASR 時直接掛載對齊模型轉(zhuǎn)寫時開啟時間戳開關(guān)一條命令搞定「識別 對齊」import torch from qwen_asr import Qwen3ASRModel model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, forced_alignerQwen/Qwen3-ForcedAligner-0.6B, # 關(guān)鍵掛載對齊器 forced_aligner_kwargsdict(dtypetorch.bfloat16, device_mapcuda:0), ) results model.transcribe( audio[speech_zh.wav, speech_en.wav], languageNone, # None 自動檢測語種 return_time_stampsTrue, # 關(guān)鍵開啟時間戳輸出 ) for r in results: print(r.language, r.text, r.time_stamps[0])? 這個「一體化」模式還內(nèi)置了三大貼心機制源碼位于 qwen_asr/inference/qwen3_asr.py長音頻自動切片超 5 分鐘的音頻會按能量低谷智能切分逐段對齊后再按偏移量拼回全程無縫時間自動偏移校正每片的時間戳?xí)詣蛹踊卦家纛l中的偏移保證全局時間軸正確語種自動傳遞識別出的語種會自動作為參數(shù)傳給對齊模型無需手動標(biāo)注。五、讀懂輸出結(jié)構(gòu)詞級時間戳長什么樣對齊結(jié)果是一個可迭代對象每個詞/字對應(yīng)一項定義見 ForcedAlignItem字段含義示例text對齊單元中文按字、英文按詞、日語按詞nagisa 分詞、韓語按詞專用詞典start_time開始時間秒0.234end_time結(jié)束時間秒0.512 中文文本會逐字對齊拉丁語系按空格分詞對齊。韓語分詞使用的內(nèi)置詞典在 korean_dict_jieba.dict。轉(zhuǎn)成字幕只需兩行思路遍歷time_stamps把start_time/end_time格式化為HH:MM:SS,mmm寫入 SRT/ASS 文件即可——詞級時間戳是逐字/逐詞高亮字幕和歌詞彈詞的基石。六、上手體驗命令行 Web Demo 可視化時間戳不想寫代碼官方提供了 Gradio 網(wǎng)頁 Demo加上--aligner-checkpoint參數(shù)即可在界面上直接看到時間戳可視化腳本位于 qwen_asr/cli/demo.pyqwen-asr-demo \ --asr-checkpoint Qwen/Qwen3-ASR-1.7B \ --aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B \ --backend transformers \ --cuda-visible-devices 0 \ --ip 0.0.0.0 --port 8000瀏覽器打開http://你的IP:8000上傳音頻即可體驗「識別 時間戳」全流程。注意不傳--aligner-checkpoint時時間戳界面會自動隱藏。七、常見問題與最佳實踐 FAQ? 時間戳精度如何官方強制對齊基準AAS 越低越好顯示中文 33.1ms、英文 37.5ms、韓文 37.2ms300 秒長音頻拼接場景下也僅約 53ms全面領(lǐng)先 NFA、WhisperX 等傳統(tǒng)方案。? 音頻超過 5 分鐘怎么辦無需手動切割一體化模式路徑 B會自動切片、對齊、偏移校正、再合并直接喂完整音頻即可。? 流式識別有時間戳嗎沒有。流式推理vLLM 后端不支持批量和時間戳需要詞級時間戳?xí)r請使用離線模式。? 顯存不夠 / 追求極致速度換 0.6B ASR 模型精度-效率平衡或改用 vLLM 后端Qwen3ASRModel.LLM(modelQwen/Qwen3-ASR-1.7B, ...)記得將代碼包在if __name__ __main__:下以避免多進程錯誤。? 支持哪些語言對齊模型支持Chinese、English、Cantonese、French、German、Italian、Japanese、Korean、Portuguese、Russian、Spanish 共 11 種。語種名寫法不敏感如chinese、CHINESE均可但必須是對齊模型支持的語種之一。八、總結(jié)選對路徑5 分鐘產(chǎn)出詞級時間戳你的場景推薦路徑已有文本只需對齊路徑 AQwen3ForcedAligner.align()音頻 → 文本 → 時間戳全流程路徑 BQwen3ASRModelreturn_time_stampsTrue快速可視化體驗qwen-asr-demo--aligner-checkpoint至此你已經(jīng)掌握了用 Qwen3-ASR 生成詞級時間戳的全部核心用法——無論是字幕工坊、播客后期還是歌詞同步這套「ASR 強制對齊」組合都能給你毫秒級的精準定位?!久赓M下載鏈接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.項目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考