AIBID BLOG

AI 与科技

最新的 AI 产品、模型、Agents、Robotics、AI 芯片、融资与开源动态。

研究 · 12 天前

渐进式细化:面向中英混码语音识别的迭代伪标签方法

发生了什么

该研究首次将迭代伪标签训练方法应用于中英混码语音识别,以应对混码语料稀缺带来的挑战。

方法包含三个阶段:伪标签生成、两阶段双语模型训练以及迭代优化,首先利用大规模未标注语料生成伪标签,构建半监督数据集。

为什么重要

中英混码语音识别因训练数据有限而长期面临性能瓶颈,利用未标注数据有望缓解数据不足的问题。

迭代伪标签方法若有效,可为其他低资源语音识别场景提供可借鉴的通用训练策略。

关键事实

混码指在同一句话中交替使用不同语言,给自动语音识别带来显著挑战。

该方法包含伪标签生成、两阶段双语模型训练和迭代改进三个阶段。

研究从大规模未标注语料生成伪标签,构建半监督数据集以推进训练。

接下来看什么

未来可关注该方法在更大规模数据或更多语言混码场景下的表现。

迭代优化策略如何进一步减少伪标签噪声、提升识别精度值得留意。

来源

阅读 → 继续下滑看下一篇
AI 模型 · 12 天前

斯坦普利用ChatGPT Work将发布工时削减68%

发生了什么

面对固定截止日期,且设计资源已被其他项目占用,斯坦普利(Stampli)选择使用OpenAI的Codex和ChatGPT Work来推进发布生产任务。

通过这一组合,原本需要数周才能完成的发布准备工作被压缩到几天之内,整个发布流程的启动工时下降了68%。

为什么重要

这个案例反映出,当团队面临人手不足或资源冲突时,AI工具可以帮助填补关键环节的空缺,而不必推迟项目进度。

它也为其他企业提供了一个参照:在固定时间表的压力下,AI辅助流程或许能成为缩短交付周期的一种有效手段。

关键事实

斯坦普利采用Codex和ChatGPT Work支持发布工作。

发布生产周期从数周缩短至数天。

发布启动工时相比此前减少了68%。

接下来看什么

值得关注的是,AI辅助生产流程是否能从一次性项目走向可复用的标准化工作流。

另一个看点是,随着类似案例增多,企业在资源规划时是否会更多地把AI工具纳入默认选项。

来源

阅读 → 继续下滑看下一篇
研究 · 12 天前

词汇干预:数据约束下的多语言知识迁移新思路

发生了什么

构建高性能多语言语言模型时,跨语言知识迁移至关重要,尤其是对于训练数据不足的语言。当目标语言数据稀缺时,科学推理、常识推理和世界知识等下游任务所需的知识,主要依赖高资源语言来获取。

现有改进跨语言知识迁移的方法,通常需要大量平行数据、翻译系统、辅助模型或额外训练阶段。针对这一情况,苹果机器学习团队提出了基于词汇干预的手段,以在数据受限条件下推进多语言知识迁移。

为什么重要

如果词汇干预能减少对外部资源或额外训练步骤的依赖,它有望为低资源语言模型提供一条更轻量、更实用的构建路径。

科学推理、常识推理和世界知识等任务对模型实用性影响很大,而这类知识在低资源场景下主要靠跨语言迁移获得,因此这一方向值得密切关注。

关键事实

跨语言知识迁移是构建训练数据不足语言的高性能多语言模型的关键。

目标语言数据稀缺时,科学推理、常识推理和世界知识等任务所需知识主要依赖高资源语言。

现有方法依赖大量平行数据、翻译系统、辅助模型或额外训练阶段,而新方法采用词汇干预。

接下来看什么

关注词汇干预方法在真实低资源语言任务上的迁移效果,以及它能否达到或超越现有方法的性能。

未来研究可能会探索词汇干预与平行数据、翻译系统等现有手段的结合方式,以进一步提升迁移效率。

来源

阅读 → 继续下滑看下一篇
研究 · 12 天前

数据受限下的混合预训练缩放规律

发生了什么

随着语言模型规模扩大,所需数据量增加,但许多目标数据源(如低资源语言或专业领域)本身规模有限。

常见策略是将这类稀缺但有价值的目标数据与丰富的通用数据混合,这带来根本性权衡:目标数据过少会使模型暴露不足,过多则重复相同示例,导致收益递减并最终过拟合。

该研究基于超过2000次语言模型训练运行,系统考察了这一权衡现象。

为什么重要

这项研究为数据受限条件下的预训练策略提供了实证参考,有助于在利用稀缺目标数据与避免过度拟合之间找到更优平衡。

对低资源语言或专业领域模型的开发而言,理解混合比例的影响可能直接关系到模型在目标任务上的表现与泛化能力。

关键事实

研究涵盖超过2000次语言模型训练运行。

目标数据源包括低资源语言或专门领域,这些数据天然规模有限。

混合训练中存在目标数据过多导致重复示例、收益递减和最终过拟合的问题。

接下来看什么

后续研究可能进一步提出针对不同数据约束的定量缩放规律,指导实际训练中的混合比例选择。

该工作也可能推动更高效的数据复用方法,以缓解稀缺目标数据在预训练中的瓶颈。

来源

阅读 → 继续下滑看下一篇