跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 61–77 条 · 共 77 条
2月10日周五
  1. Hugging Face83

    Hugging Face 推出 PEFT 库,支持消费级硬件高效微调大模型

    Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。

    推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。

1月26日周四
12月9日周五
  1. Hugging Face76

    Hugging Face 图解人类反馈强化学习(RLHF)核心流程

    Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。

    推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。

11月3日周四
7月14日周四
  1. Hugging Face69

    Hugging Face 详解 176B 大语言模型 BLOOM 训练背后的工程与硬件技术

    Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。

    推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。

12月14日周二
12月8日周三
7月15日周四
  1. Hugging Face64

    基于互联网的深度学习:通过 DeDLOC 协作训练语言模型

    Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。

    推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。

4月16日周五
  1. Hugging Face74

    Hugging Face 推出 PyTorch 分布式训练库 Accelerate

    Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。

    推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。

9月4日周五
2月14日周五
12月5日周四
  1. OpenAI72

    OpenAI 研究发现深度神经网络中的“深度双重下降”现象

    OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。

    推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。

9月19日周四
  1. OpenAI74

    OpenAI 基于人类偏好微调 GPT-2 语言模型

    OpenAI 基于人类反馈对 774M 参数的 GPT-2 语言模型进行了微调,成功匹配了外部人类标注者的偏好。在摘要任务中,标注者倾向于选择直接从输入整句复制的句子,导致模型也学会了复制,该任务共使用了 60k 条人类标注,而简单风格续写任务仅需 5k 条。此项研究旨在让安全技术更贴近人机交流场景,以探索人类价值观的对齐方法。

    推荐理由:原文通过微调实验展示了人类反馈对模型行为的引导作用,同时指出了标注偏好偏差直接影响输出模式的现象。

6月11日周一
  1. OpenAI78

    OpenAI 通过无监督学习提升语言理解能力

    OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。

    推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。

5月16日周三
  1. OpenAI77

    OpenAI 分析最大 AI 训练算力趋势:2012 年以来每 3.4 个月翻倍

    OpenAI 发布分析显示,自 2012 年以来最大 AI 训练任务消耗的算力呈指数级增长,翻倍周期约为 3.4 个月。该指标在此期间已累计增长超过 300,000 倍,增速远超摩尔定律 2 年翻倍的幅度。算力提升是推动 AI 进步的关键动力,随着趋势延续需要提前准备应对远超当前能力的系统影响。

    推荐理由:给出 2012 年以来 AI 训练算力每 3.4 个月翻倍的具体测算,为理解模型能力演进提供了量化基准。

8月16日周三
  1. OpenAI70

    OpenAI 解析 Dota 2 项目与自博弈机制

    OpenAI 表示 Dota 2 的研发进展表明,在充足算力支持下,自博弈机制能推动机器学习系统从远低于人类水平迅速提升至超人类水平。该系统在单月内从勉强匹配高分玩家跨越到击败顶尖职业选手;与受限于既有数据的监督学习相比,自博弈系统的可用训练数据会随着智能体能力的提升而自动改善。

    推荐理由:OpenAI 对比了监督学习与自博弈机制的差异,说明了在算力充足时数据质量随模型迭代自进化的路径。

7月20日周四
  1. OpenAI74

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。

    推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。