觀點網訊:9月23日,科大訊飛發佈最新一代語音識別大模型Spark-ASR-2.0。

該模型採用非自迴歸與LLM增強自迴歸協同、中英文混合文本與聲學聯合增強、動態上下文注入等關鍵技術創新,實現整體語音識別效果的大幅提升。

在通用識別方面,該模型對中英文混合、方言及專業術語的識別能力顯著增強。

在複雜聲學場景下,該模型針對高噪、小音量、快語速及兒童語音的識別表現明顯改善。

此外,該模型在上下文識別和文本流暢規範性方面也取得了優化。