Scaling Few-Shot Spoken Word via Generative Meta-CL — arXiv:2605.13075
摘要¶
少样本口语词分类主要在考虑少量类别的应用场景中开发,更大规模少样本口语词分类的潜力尚未被挖掘。本文研究了口语词分类器在每类仅有 5 个样本的情况下,顺序学习区分 1000 个类别的潜力。通过使用生成式元持续学习(GeMCL)算法训练模型,并与重复训练或微调的基线进行比较,证明了这种扩展能力的存在。研究发现 GeMCL 产生异常稳定的性能,尽管它并不总是优于重复完全微调的 HuBERT 模型或带有重复训练分类器头的冻结 HuBERT 模型。
核心贡献¶
- 生成式元持续学习(GeMCL)算法:提出用于大规模少样本持续学习的全新方法
- 扩展性验证:首次证明少样本口语词分类可以扩展到 1000 类别
- 稳定性分析:GeMCL 在持续学习场景中产生异常稳定的性能
- 与完全微调的对比分析:提供了 GeMCL 与完全微调方法的系统比较
为什么重要¶
少样本持续学习是端侧 Agent 的关键技术——边缘设备无法存储大量标注数据,也无法进行完整模型重训练。GeMCL 算法为这一场景提供了新的解决思路,展示了如何在极少样本条件下持续扩展模型容量。
与移动端/端侧的相关性¶
移动端和可穿戴设备上的语音助手需要持续学习新词汇和说话人特征,但无法频繁进行云端同步。GeMCL 的稳定性和样本效率使其成为端侧持续语音学习的理想候选方法。