跳到正文

#数据/训练

今日 0 条
7月16日周四
  1. Hugging Face35

    面对更新的模型,DharmaOCR 依然保持优势

    专精巴西葡萄牙语的 OCR 模型 DharmaOCR 凭借监督微调与 DPO 训练,在葡萄牙语基准评测中超越了较新的多语言模型。测试显示,DharmaOCR 取得 0.925 分,显著领先于 Mistral OCR4(0.798 分)与 Unlimited-OCR(0.7587 分)。该模型将全部参数专用于目标语言,并通过 DPO 抑制退化输出,有效提升了实际推理的稳定性。

4月29日周三
  1. Hugging Face65

    IBM 开源 Granite 4.1 系列大模型

    IBM 宣布以 Apache 2.0 协议开源 Granite 4.1 系列稠密大语言模型,包含 3B、8B 和 30B 三种尺寸,支持最高 512K 上下文。

    推荐理由:技术报告详述了五阶段退火预训练与四阶段强化学习流程,为端侧与企业级小参数稠密模型的构建提供了完整工程参考。

12月11日周四
  1. OpenAI60

    OpenAI 更新 GPT-5.2 系统卡片

    OpenAI 发布 GPT-5.2 的系统卡片更新,说明该系列模型的综合安全缓解方案与 GPT-5 及 GPT-5.1 基本一致。GPT-5.2 同样基于多样化数据集训练,数据来源包括公开互联网信息、第三方合作数据以及用户和研究人员提供或生成的内容。

    推荐理由:读者可以从中了解 GPT-5.2 沿用了前代模型的安全缓解方案,并查看其训练数据来源构成。

7月16日周三
  1. Hugging Face65

    Hugging Face 发布 Ettin 模型套件,提供同数据训练的成对 Encoder 与 Decoder

    Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。

    推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。

7月8日周二
  1. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。

6月25日周二
  1. Hugging Face30

    XLSCOUT 在 Hugging Face 专家支持下推出专利领域嵌入模型 ParaEmbed 2.0

    XLSCOUT 联合 Hugging Face 专家支持项目推出面向专利与知识产权的专有嵌入模型 ParaEmbed 2.0,相较于 2023 年 10 月发布的 ParaEmbed 1.0 准确率提升 23%。该模型基于专家整理的多领域专利数据微调,并通过 Hugging Face 的 TEI 部署将生产推理吞吐量提升至约每秒 2700 个嵌入向量,全面支持查新、专利无效检索及自动化撰写等工具。