在今年3月发布的Hugging Face报告中,过去一年中中国的模型下载量占比达到41%,而美国则为36.5%。在Artificial Analysis的开源权重模型排行榜上,前六名均为中国实验室的成果;OpenRouter按token量排名时,前五个模型中有四个来自中国。在AI的大潮中,中国的大模型公司正在积极推动开源文化,与以封闭生态为主的美国形成鲜明对比。近期的研究发现,Hugging Face语音与翻译领域的两个趋势榜首,分别是Confucius4-R2T2在自动语音识别中和Confucius4-T3PO在翻译中。
Hugging Face现有超过300万个模型,其中自动语音识别模型有3.6万个,翻译模型也有1.7万个,趋势榜所列的是最近最受欢迎的模型。R2T2以其实时语音识别功能迅速攀升至榜首,而T3PO则在翻译类别中保持领先。关注开源模型时,我大多集中于通用大模型的能力与调用频率,没想到这次语音识别与翻译领域中国模型的表现异常突出。在翻译趋势榜前十中,有一半是中国公司发布的模型,显示出中国的开源模型正在向更为细分的领域拓展。
网易有道的开源进展给我留下了深刻印象,以前我仅对其有道词典及相关产品有所了解。在Hugging Face上查询后,发现其模型发布已有两年多时间。最初是检索用的embedding和rerank模型,接着推出了推理与数学模型,今年则涉足多模态与语音合成,如今发布的R2T2与T3PO均以"Confucius"命名,与其2023年推出的教育大模型“子曰”相关。这两个模型分别负责实时转写和同声翻译,展现出强大的应用潜力。
R2T2代表“Real Real-Time Transcription”,是真正的流式模型,每当接收到音频信号(时长可调),模型便立即输出文字,且已确定的字不会被修改。这种方法有效避免了传统实时字幕中出现的文字不断更改的尴尬。模型通过精心设计的训练数据来判断该何时确认输出的字,保证了识别的准确性。实验结果表明,在特定条件下,R2T2的中文与英文错误率显著低于传统模型,基本接近离线识别的效果,且平均延迟控制在可接受范围内。
T3PO则是一个拥有140亿参数的文本模型,接入R2T2实现流式的实时翻译。其工作原理是根据已翻译的历史记录和当前未翻译的内容进行判断,确定何时输出翻译文本,并不会修改已输出内容。我尝试将苹果发布会的字幕逐词输入,模型在确认地点信息后才开始翻译,展现了一定的智能判断能力。通过这两个模型,一个集中于实时转写,一个处理实时翻译,中国的语音与翻译技术正在不断突破。
发表评论