OpenAI 从硬性拒绝转向安全补全:迈向以输出为中心的安全训练
OpenAI 在 GPT-5 中引入了全新的 safe-completions 方法,通过以输出为中心的安全训练来处理双重用途提示词(dual-use prompts)。该方法摆脱了以往一刀切式的硬性拒绝(hard refusals),在提供更细致回复的同时,兼顾并提升了 AI 回答应答的安全性与实用性。
OpenAI 在 GPT-5 中引入了全新的 safe-completions 方法,通过以输出为中心的安全训练来处理双重用途提示词(dual-use prompts)。该方法摆脱了以往一刀切式的硬性拒绝(hard refusals),在提供更细致回复的同时,兼顾并提升了 AI 回答应答的安全性与实用性。
Hugging Face 推出开源免费的轻量机器学习实验追踪 Python 库 Trackio,提供本地 Gradio 可视化看板并支持同步至 Hugging Face Spaces。
推荐理由:它兼容 wandb 语法且能将指标同步至 Spaces,为需要轻量且免云端绑定的训练追踪提供了低迁移成本方案。
Arc Institute 推出虚拟细胞挑战赛(Virtual Cell Challenge),要求参赛者训练模型预测利用 CRISPR 沉默基因对细胞产生的影响。挑战赛提供约 300k 单细胞 RNA 测序数据,其中训练集含 220k 细胞及约 38k 对照细胞。Arc 还提供了基线方案 STATE,由基于 Llama 架构的状态转换模型与类 BERT 的状态嵌入模型组成。
Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。
推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。
Hugging Face 团队针对多模态模型训练中 GPU 空转及无效填充 token 占比过高的问题,分享了一套分阶段优化的多模态数据管道方案。该方案借鉴了 Eagle 2 的平衡背包算法,通过 PyTorch IterableDataset 与生产者-消费者多线程队列,同时对 token 长度与图像数量进行约束打包,在大幅减少填充开销的同时保证了各 GPU 间的工作负载均衡。
Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。
推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。
Hugging Face 发布使用 Sentence Transformers 训练和微调交叉编码器重排(Reranker)模型的实践指南,系统拆解了数据集准备、难负样本挖掘、损失函数选择与评估流程。
推荐理由:文章系统拆解了重排模型微调中的难负样本挖掘与损失函数配置,展示了特定领域微调超越大尺寸通用模型的路径。
印度科学理工学院(IISc)及 ARTPARK 与 Hugging Face 达成合作,向全球开发者开放多模态多语言开源数据集 Vaani。该数据集已覆盖 54 种语言,第一阶段涉及 80 个地区的数据已开源,包含 790 小时转录音频子集。项目由 IISc 与 Google 等发起,最终目标采集全印 773 个地区的 15 万小时语音,目前正向另外 100 个地区扩展。
Hugging Face 推出了一套用于视频生成模型微调的数据集构建工具与开源脚本,包含获取、过滤与打标的三阶段流水线。该流程通过 yt-dlp 和场景切分脚本提取片段,结合专用模型进行水印检测、美学评分、NSFW 过滤与运动评估,并支持使用 Florence-2 或 Qwen2VL 生成多粒度描述。
推荐理由:给出了视频数据清洗的三阶段流水线与具体过滤阈值,读者可直接参考该方案构建视频生成模型的微调数据集。
Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。
推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。
开源数据标注工具 Argilla 发布 2.4 版本,新增无需编写代码即可在 UI 中直接从 Hugging Face Hub 导入公开数据集的功能。该功能支持用户自定义标注问题与字段,便于构建模型微调与评测数据集并收集人类反馈。工具推荐部署在 Hugging Face Spaces 并默认启用 HF OAuth 进行协作标注,同时保留了 Python SDK 导入方式。
Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。
推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。
Hugging Face 介绍了结合 Dask 在云端多 GPU 集群上扩展 AI 数据处理的实践方案,演示了将文本分类任务从单机 100 行扩增至 2.11 亿行的完整流程。
Hugging Face 详细公开了开源视频数据集 FineVideo 的构建流程,涵盖从 1.9M 原始视频筛选至 43k 视频(约 3.4k 小时)的多阶段技术细节。
推荐理由:原文完整拆解了从海量视频筛选、多模型标注到结构化解析的管线,对构建多模态视频训练集有直接工程参考价值。
Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。
推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。
Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。
推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。
XLSCOUT 联合 Hugging Face 专家支持项目推出面向专利与知识产权的专有嵌入模型 ParaEmbed 2.0,相较于 2023 年 10 月发布的 ParaEmbed 1.0 准确率提升 23%。该模型基于专家整理的多领域专利数据微调,并通过 Hugging Face 的 TEI 部署将生产推理吞吐量提升至约每秒 2700 个嵌入向量,全面支持查新、专利无效检索及自动化撰写等工具。
Hugging Face 发布伦理与社会简报指出,构建更优 AI 系统必须优先保障数据质量,强调优质数据不仅取决于规模与准确度,更在于契合具体任务需求。评估数据质量的核心维度涵盖相关性、全面性、时效性以及偏见消除,可有效防止模型过拟合并降低计算资源消耗。实现高质量数据需贯穿去重、内容过滤、领域专家与人工反馈,并建立清晰的数据治理框架。
Hugging Face 与 Argilla 联合发起的 Data Is Better Together(DIBT)倡议发布阶段性回顾,旨在通过开源社区协作构建高价值数据集。
一致性模型(Consistency Models)是一类新兴的生成模型。该模型无需进行对抗训练,即可在单步之内采样生成高质量数据。
Hugging Face 在 TRL 库中上线 RLOO 训练器,作为 PPO 的在线 RLHF 替代方案,可节省 50% 至 70% 显存并带来 2 至 3 倍训练加速。
Hugging Face 发布了使用 Sentence Transformers 训练与微调嵌入模型的实用指南,系统解析了基于 SentenceTransformerTrainer 的训练架构。文章涵盖数据集列顺序与损失函数匹配、评估器设置以及多数据集混合训练策略,支持对不同业务场景定制语义相似度计算。新版本底层重构后原生支持分布式训练和监控回调,并完全兼容旧版 fit 方法。
推荐理由:教程系统梳理了新版嵌入模型的训练与评估流程,读者可以掌握多数据集混训和损失函数匹配的具体实现规范。
OpenAI 宣布改进微调 API 并扩展定制模型计划。新功能旨在帮助开发者对模型微调获得更多控制权,并提供了与 OpenAI 合作构建定制模型的新途径。
Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。
推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。
Hugging Face 介绍了内存高效训练方案 GaLore 的技术原理及其在 Transformers 库中的集成实践。GaLore 利用梯度的内在低秩特性,在优化器处理前将梯度投影到低维子空间,可减少超过 82.5% 的优化器状态显存占用,配合 8-bit 优化器和按层更新机制后,支持在 NVIDIA RTX 4090 等消费级 GPU 上训练 7B 参数模型。
推荐理由:文章给出了 GaLore 结合 8-bit 优化器在消费级显卡上训练大模型的机制与 Transformers 代码实现。
Hugging Face 与 Argilla 联合推出“Data is Better Together”计划,通过在 Hugging Face Spaces 上集成支持账号直接登录的 Argilla 实例,降低社区协同标注数据集的门槛。
Hugging Face 官方发布了使用 Transformers 和 PEFT 库对 Google Gemma 模型进行高效微调的操作指南。教程演示了如何结合 bitsandbytes 的 QLoRA 4-bit 量化加载 gemma-2b,并使用 TRL 的 SFTTrainer 训练名言格式生成。
推荐理由:原文提供了可直接复用的代码与配置,读者可以据此在消费级 GPU 或 TPU 上以低显存成本微调 Gemma 模型。
Hugging Face 发布实践方案,演示如何使用开源大模型 Mixtral-8x7B 生成合成标注数据,并通过 AutoTrain 蒸馏微调出约 0.13B 参数的专用 RoBERTa 模型。
推荐理由:文章给出了用开源大模型生成合成数据并训练专用小模型的完整方案,展示了高并发文本任务大幅压降推理成本的可行路径。
Hugging Face 发布实战指南,详解如何使用 Transformers 库通过 CTC 算法微调 Meta 的 580M 参数模型 Wav2Vec2-BERT,用于低资源语言的自动语音识别。
Hugging Face 对 DPO、IPO 和 KTO 三种免强化学习的大语言模型偏好对齐方法进行了超参数扫描与实测对比。实验在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 上展开并通过 MT-Bench 评估,修正 TRL 实现后 IPO 与 DPO 表现相当且优于成对设定的 KTO。
Hugging Face 介绍了轻量级微调库 Unsloth 及其与 TRL 工具集的无缝集成,在保证精度零损失的前提下可将大语言模型微调提速最高 2.7 倍并减少最多 74% 显存占用。
推荐理由:文中展示了通过重写反向传播与 Triton 内核加速微调的具体实现,为在有限显存下微调开源模型提供了现成的集成方案。
Hugging Face 在 diffusers 库中推出了针对 SDXL 的 Dreambooth LoRA 进阶训练脚本,将 Pivotal Tuning 技术与自适应优化器 Prodigy 进行了结合。
推荐理由:结合枢轴微调与自适应优化器系统梳理了参数配置,为图像生成模型的高质量小样本定制提供了可迁移的工程经验。
Explosion 推出 Prodigy-HF 插件,为数据标注工具 Prodigy 提供直接集成 Hugging Face 生态的代码配方。用户可通过单条命令直接微调 Hugging Face Hub 上的 Transformer 模型,支持 NER 与文本分类任务,并能利用模型预测辅助后续标注。此外,该插件还支持将标注好的数据集直接上传发布至 Hugging Face Hub。
Hugging Face 发布面向非技术用户的无代码教程,演示如何通过 Spaces、AutoTrain 和 ChatUI 训练并部署开源对话机器人。流程先在 Spaces 中启动 AutoTrain 应用,上传 CSV 指令数据集微调 LLaMA 2 7B 基座模型,再通过 ChatUI Docker 模板挂载生成的模型并完成 Web 界面部署。
Hugging Face 在 TRL 库中集成了 Direct Preference Optimization(DPO)训练器,并提供了微调 Llama 2 7B 模型的完整教程与代码。
推荐理由:给出了省去独立奖励模型的 DPO 对齐实操方案,读者可直接参考代码降低大语言模型的对齐成本。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 866M 参数的视觉语言模型 BridgeTower 时,相比 Nvidia A100 提速 x2.5,相比 H100 提速 x1.4。
Hugging Face 面向美术馆、图书馆、档案馆和博物馆(GLAM)提供 Hub 资源应用与贡献方案。平台已托管超 190,000 个机器学习模型、33,000 个数据集及 100,000 个演示应用。机构可通过任务与语言筛选现成模型、利用 Spaces 托管 Gradio 或 Streamlit 应用,并支持在浏览器免代码上传 CSV 数据集。
Hugging Face Hub 宣布集成 DuckDB,支持用户直接使用 SQL 查询 Hub 上存储的超过 5 万个公开数据集。Dataset Viewer 会自动将公开数据集转换为 Parquet 格式并切分为 500MB 分片,开发者通过 /parquet 接口获取文件 URL 后,利用 DuckDB 的 httpfs 扩展即可直接对远程文件执行复杂分析查询。
推荐理由:HF Hub 将公开数据集自动转为 Parquet 分片,开发者可直接借助 DuckDB 远程运行 SQL 分析而无需完整下载数据。
Hugging Face 发布了结合 TensorFlow 与 TPU 从零端到端训练语言模型的实践指南。教程利用 XLA 和 TPUStrategy 解决了以往的兼容痛点,涵盖训练分词器、分片序列化 TFRecord 上传至 GCS 以及通过数据并行完成模型拟合的全流程。该方案展示了在 GPU 算力短缺背景下,将现有训练管线迁移至 TPU Pod 的低改造成本路径。
Databricks 宣布向 Hugging Face Datasets 代码库提交原生 Spark 支持,推出 Dataset.from_spark 接口,将大模型训练与微调的数据处理耗时最高缩短 40%。