觀點網訊:9月23日,科大訊飛發佈最新一代語音識別大模型Spark-ASR-2.0。
該模型採用非自迴歸與LLM增強自迴歸協同、中英文混合文本與聲學聯合增強、動態上下文注入等關鍵技術創新,實現整體語音識別效果的大幅提升。
在通用識別方面,該模型對中英文混合、方言及專業術語的識別能力顯著增強。
在複雜聲學場景下,該模型針對高噪、小音量、快語速及兒童語音的識別表現明顯改善。
此外,該模型在上下文識別和文本流暢規範性方面也取得了優化。
9月23日,科大訊飛發佈新一代語音識別大模型Spark-ASR-2.0,採用非自迴歸與LLM增強自迴歸協同等技術創新,提升中英文混合、方言及專業術語識別能力。
觀點網訊:9月23日,科大訊飛發佈最新一代語音識別大模型Spark-ASR-2.0。
該模型採用非自迴歸與LLM增強自迴歸協同、中英文混合文本與聲學聯合增強、動態上下文注入等關鍵技術創新,實現整體語音識別效果的大幅提升。
在通用識別方面,該模型對中英文混合、方言及專業術語的識別能力顯著增強。
在複雜聲學場景下,該模型針對高噪、小音量、快語速及兒童語音的識別表現明顯改善。
此外,該模型在上下文識別和文本流暢規範性方面也取得了優化。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。