跳到正文

#数据/训练

今日 0 条
4月26日周三
4月14日周五
4月12日周三
  1. Hugging Face41

    基于 Substra 构建隐私保护型 AI

    Hugging Face 联合开源联邦学习框架 Substra 推出演示 Space,展示如何在保护数据隐私的前提下跨多数据源协同训练 AI 模型。联邦学习通过仅在服务器间传输模型权重而非本地原始数据,打破医疗等敏感领域的数据孤岛,并曾成功应用于包含 10 家药企的 MELLODDY 项目及乳腺癌研究。

4月5日周三
  1. Hugging Face81

    StackLLaMA:使用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。

    推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。

3月27日周一
2月10日周五
  1. Hugging Face83

    Hugging Face 推出 PEFT 库,支持消费级硬件高效微调大模型

    Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。

    推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。

1月26日周四
1月24日周二
1月2日周一
12月15日周四
  1. Hugging Face58

    Hugging Face 音频数据集完整指南

    Hugging Face 发布音频数据集完整指南,详解如何利用 🤗 Datasets 库高效获取与预处理语音数据。教程演示了一行代码加载数据、动态重采样音频、通过 map 与 filter 进行特征映射和样本过滤,并重点介绍了无需预先下载即可逐样本处理 TB 级音频的流式模式(streaming mode)。

12月14日周三
12月9日周五
  1. Hugging Face76

    Hugging Face 图解人类反馈强化学习(RLHF)核心流程

    Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。

    推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。

9月28日周三
  1. Hugging Face48

    使用 Hugging Face AutoTrain 进行图像分类

    Hugging Face 的无代码训练工具 AutoTrain 正式支持计算机视觉领域的图像分类任务。用户无需编写代码,只需上传本地数据或选用 Hugging Face Hub 数据集,系统便会自动测试多种模型架构,且 5 个候选模型搭配少于 500 张图片的训练可免费使用。训练完成的模型会自动托管至 Hub,并支持直接通过内置推理小部件测试。

9月7日周三
7月28日周四
7月14日周四
  1. Hugging Face69

    Hugging Face 详解 176B 大语言模型 BLOOM 训练背后的工程与硬件技术

    Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。

    推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。

6月30日周四
  1. Hugging Face48

    Hugging Face 深度强化学习教程:用 PyTorch 实现策略梯度方法

    Hugging Face 深度强化学习课程推出策略梯度教程,指导读者使用 PyTorch 从零实现 Reinforce 算法,并在 CartPole-v1、PixelCopter 和 Pong 环境中完成验证。该方法通过梯度上升直接优化策略并输出动作概率分布,更适用于高维及连续动作空间,但同时存在易收敛至局部最优与训练方差较高的局限。

6月28日周二
4月26日周二
2月11日周五
11月29日周一
11月19日周五
10月26日周二
  1. Hugging Face42

    大语言模型:新的摩尔定律?

    面对微软与 NVIDIA 推出 530B 参数 Megatron-Turing NLG 带来的高能耗与近 $100M 成本,行业无需盲目追逐超大模型。DistilBERT 减小 40% 体积且提速 60% 仍保留 97% 理解力,BigScience 的 T0 缩小 16x 却在多任务上超越 GPT-3。实际应用应优先选择预训练小模型、微调技术与高效云设施,以低成本实现高质量解决方案。

10月25日周一
10月13日周三
  1. Hugging Face39

    使用遥感卫星图像与文本标注微调 CLIP

    开发者团队在 Hugging Face 社区活动中使用 RSICD 等遥感数据集微调了 OpenAI 的 CLIP 模型,实现了通过自然语言文本检索大型卫星图像库的功能。训练过程中结合了图像变换以及基于 Marian MT 的回译文本增强技术,显著减轻了过拟合问题。目前该微调模型与交互 Demo 已在 Hugging Face 开放下载和体验。

7月15日周四
  1. Hugging Face64

    基于互联网的深度学习:通过 DeDLOC 协作训练语言模型

    Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。

    推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。

6月10日周四
4月16日周五
  1. Hugging Face74

    Hugging Face 推出 PyTorch 分布式训练库 Accelerate

    Hugging Face 正式推出开源训练库 Accelerate,让开发者仅需在原生 PyTorch 训练脚本中增加数行代码,即可在 CPU、多 GPU、TPU 以及混合精度等不同硬件配置下无缝运行。该库通过统一的 API 自动接管设备放置、模型包装与 DataLoader 分发,同时提供简化的 CLI 工具以统一各环境的启动流程。

    推荐理由:原文展示了仅需改动数行代码即可适配多卡与混合精度的方案,读者可参考其封装方式降低原生训练循环的跨硬件维护成本。

4月8日周四
2月25日周四
  1. Hugging Face49

    Hugging Face:构建与调试复杂神经网络的实用考量

    Hugging Face 研究人员总结了构建与调试神经网络的实用方法,建议开发者在建模前先搁置算法,深入分析原始数据分布与标签质量。随后应从 word2vec、fastText 搭配逻辑回归等简单基准开始测试,建立合理的对照指标,而非直接盲目套用 BERT 等复杂架构。在实现模型后,可通过在 16 个样本的小 batch 上去除正则化并跑通 0-loss 过拟合,以此验证代码实现的正确性。

12月5日周四
  1. OpenAI72

    OpenAI 研究发现深度神经网络中的“深度双重下降”现象

    OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。

    推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。

3月21日周四
6月11日周一
  1. OpenAI78

    OpenAI 通过无监督学习提升语言理解能力

    OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。

    推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。

7月20日周四
  1. OpenAI74

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。

    推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。

12月5日周一