PP-OCRv6 上线 Hugging Face:参数量 1.5M 至 34.5M,支持 50 种语言 OCR
PaddleOCR 推出新一代通用 OCR 模型家族 PP-OCRv6 并上线 Hugging Face,提供 tiny、small 和 medium 三种规格,参数量涵盖 1.5M 至 34.5M。
推荐理由:新模型将参数量控制在1.5M至34.5M并统一覆盖50种语言,为端侧设备到服务端管道的低成本OCR落地提供了灵活选型参考。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
PaddleOCR 推出新一代通用 OCR 模型家族 PP-OCRv6 并上线 Hugging Face,提供 tiny、small 和 medium 三种规格,参数量涵盖 1.5M 至 34.5M。
推荐理由:新模型将参数量控制在1.5M至34.5M并统一覆盖50种语言,为端侧设备到服务端管道的低成本OCR落地提供了灵活选型参考。
Hugging Face 工程师展示了如何利用本地开源模型自动分流 OpenClaw 仓库的 Issue 和 PR,在单台本地硬件上实现低成本的实时通知。
推荐理由:原文给出了用受限只读命令行配合本地模型做智能体分类的方案,为高吞吐信息分流提供了可落地的工程参考。
Hugging Face 在统一基准下对比了 PEFT 库中的多种参数高效微调方法,结果显示 LoRA 并非所有场景下的最优选择。在 Llama-3.2-3B 数学推理任务中,带稳定秩初始化的 LoRA 准确率达到 53.2%,而 Lily 达到 54.9%,LoRA-FA 则更加节省显存;在图像生成测试中,OFT 在相似度得分与显存占用上均优于 LoRA。
推荐理由:实测在统一硬件和基准下对比了多种高效微调技术,揭示了 LoRA 之外的帕累托最优解,为微调权衡提供了可迁移参考。
AWS 工程师在 Hugging Face 博客介绍了开源 SDK Strands Robots 与 LeRobot 的集成方案,实现了从仿真演示记录、策略推理到物理硬件部署的单一智能体工作流。
推荐理由:原文展示了统一数据集格式和智能体接口下的端到端流程,开发者只需切换一行配置即可将仿真策略无缝部署到实体机器人。
智谱推出新一代旗舰开源模型 GLM-5.2,采用 MIT 协议完全开源,原生支持 1M token 上下文,主打面向长流程(long-horizon)的软件工程与智能体任务。
推荐理由:GLM-5.2 将实用工程评测与 1M 上下文推理架构结合,为需要长时间自主运行的编码智能体提供了兼顾开源与高吞吐的落地参考。
Hugging Face 与 Microsoft、Google 等合作推出开放草案规范 Agentic Resource Discovery(ARD),并上线参考实现 Discover Tool,让 AI 智能体能在运行时动态搜索并调用外部工具与技能。
推荐理由:针对现有智能体依赖手动预装工具的痛点,该规范给出了运行时的统一发现层,便于在联邦注册表中动态检索扩展能力。
Hugging Face 宣布 OpenEnv 成立多方联合治理委员会,并将其明确为智能体强化学习环境的标准化互操作协议层。OpenEnv 基于客户端与服务端架构提供类 Gymnasium API,通过 HTTP、WebSocket 和 Docker 部署并原生兼容 MCP,不绑定具体的奖励计算逻辑。
推荐理由:原文阐述了 OpenEnv 作为环境互操作协议层的设计与多机构治理路线,为开源智能体训练提供了标准化的环境交互与部署方案。
NVIDIA 正式发布多模态安全模型 Nemotron 3.5 Content Safety 及开源训练数据集,将多模态输入联合评估、自定义策略与审计推理整合至单次推理。
推荐理由:该方案把多模态审查、自定义规则与紧凑推理集成在 4B 模型中,为企业构建低成本且可审计的内容风控提供了实践参考。
JetBrains 正式发布开源混合专家模型 Mellum2,总参数量为 12B 且每个 token 仅激活 2.5B 参数,专注于文本与代码任务。该模型基于 Apache 2.0 许可证开源,官方测试称其比同尺寸模型推理速度提升 2 倍以上,适用于路由编排、RAG 流水线、子智能体及私有化部署等高吞吐工作负载。
推荐理由:该模型通过低激活参数量和高推理速度降低部署成本,为复杂系统中高频调用的路由与子智能体任务提供了轻量解法。
Hugging Face 在 TRL 中推出了基于 Hub Bucket 的增量权重同步功能,解决了异步强化学习训练中每步向推理引擎同步全量模型的带宽与暂停开销。
推荐理由:利用低学习率下大量权重数值不变的特性,通过对象存储同步增量权重,为跨集群异步强化学习训练提供了低成本落地方案。
Hugging Face 推出完全本地化运行的 Reachy Mini 机器人语音交互方案,音频无需上传云端服务器即可完成实时对话。该方案依托 speech-to-speech 级联流水线,默认组合 Silero VAD、Parakeet-TDT 0.6B v3 语音识别、Qwen3-TTS 语音合成,并支持通过 llama.cpp、vLLM 或 MLX 本地驱动 LLM。
推荐理由:提供了基于开源级联流水线搭建低延迟端到端语音交互的完整方案,读者可以据此将本地语音闭环迁移至各类机器人与端侧设备。
Hugging Face 发布开源重排序模型家族 Ettin Reranker,覆盖从 17M 到 1B 共 6 种参数规模,并同步开源约 1.43 亿条训练数据与完整训练代码。
推荐理由:该系列展示了点式 MSE 蒸馏与无填充注意力结合的工程收益,为检索排序系统的低延迟选型提供了详实参考。
IBM 发布采用 Apache 2.0 协议的 Granite Embedding Multilingual R2 多语言嵌入模型,包含 97M 与 311M 两个版本并基于 ModernBERT 架构重构。
推荐理由:模型将上下文扩展至32K并支持代码检索,为多语言长文档检索与低成本向量检索提供了轻量级开源替代方案。
IBM 宣布以 Apache 2.0 协议开源 Granite 4.1 系列稠密大语言模型,包含 3B、8B 和 30B 三种尺寸,支持最高 512K 上下文。
推荐理由:技术报告详述了五阶段退火预训练与四阶段强化学习流程,为端侧与企业级小参数稠密模型的构建提供了完整工程参考。
NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。
推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。
DeepSeek 正式发布 DeepSeek-V4,推出 Pro(1.6T 参数/49B 激活)与 Flash(284B 参数/13B 激活)两款 MoE 模型,均支持 1M token 上下文窗口。
推荐理由:原文详解了混合注意力机制与跨轮次思考保留设计,读者可借此评估长上下文模型在多轮智能体任务中的部署与工程取舍。
OpenAI 推出开源权重模型 OpenAI Privacy Filter,专门用于检测并脱敏文本中的个人身份信息(PII)。官方表示该模型具备 SOTA 级别的准确率。
Hugging Face 推出基于 Claude Code 的 transformers-to-mlx 技能与独立测试套件,辅助开发者将 transformers 架构模型规范地移植到 Apple MLX 框架的 mlx-lm 库。
推荐理由:它展示了如何将项目规范与独立验证流程封装为技能,在保证提交质量的同时降低开源模型跨框架迁移门槛。
Sentence Transformers 发布 v5.4 版本,正式支持通过统一 API 编码与比对文本、图像、音频和视频等多模态数据。新版本同时涵盖多模态嵌入(SentenceTransformer)与重排序(CrossEncoder)能力,原生适配 Qwen3-VL、Nemotron 等开源模型并支持混合输入。
推荐理由:该更新统一了文本、图像与音视频的检索与重排序接口,便于开发者直接构建跨模态 RAG 管线。
Overworld 正式发布实时视频世界模型 Waypoint-1.5,模型权重已在 Hugging Face 开源上线,主打消费级硬件本地实时交互。在 RTX 3090 至 5090 显卡上可实时生成最高 720p 60 FPS 环境,并提供适配游戏本及 Apple Silicon 的 360p 规格。
推荐理由:原文给出了消费级硬件本地运行世界模型的具体分级与训练细节,读者可以了解端侧实时交互环境生成的落地可能。