OpenAI API 上线 Prompt Caching 功能
OpenAI 在 API 中推出 Prompt Caching 功能。该功能将对模型最近见过的输入内容自动提供折扣,降低包含重复上下文的调用成本。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
OpenAI 在 API 中推出 Prompt Caching 功能。该功能将对模型最近见过的输入内容自动提供折扣,降低包含重复上下文的调用成本。
Hugging Face 宣布在其 Inference Endpoints 和 Spaces 中正式上线 Google Cloud TPU v5e 算力支持。服务提供 1 核 16 GB(每小时 $1.375)、4 核 64 GB(每小时 $5.50)以及 8 核 128 GB(每小时 $11.00)三种配置。
推荐理由:该支持降低了在托管环境调用 TPU 的操作门槛,为需要平衡延迟与成本的开源模型部署提供了具体的硬件配置参考。
Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。
推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。
Hugging Face 宣布 Diffusers 正式集成 Stability AI 的 Stable Diffusion 3 Medium(2B 参数)模型,并上线 Hugging Face Hub。
推荐理由:原文提供了显存卸载、8-bit 量化以及编译加速方案,读者可以据此在不同显存规格的硬件上部署和微调 SD3。
Hugging Face 正式发布 Transformers Agents 2.0,引入支持基于观察结果持续迭代的 ReactCodeAgent 和 ReactJsonAgent,并在 v4.41.0 版本中上线。
推荐理由:框架通过模块化解耦底层模型与工具调用逻辑,读者可以借鉴其代码智能体设计在开源模型上构建多模态工作流。
Hugging Face 引入了 Artificial Analysis 的大语言模型性能排行榜,全面评估超过 100 个无服务器 LLM API 端点的价格、推理速度与质量指标。
推荐理由:提供了覆盖主流模型与端点的质量、延迟与成本指标,便于开发者在应用选型时权衡吞吐量与预算。
Hugging Face 宣布在 Hub 上推出 Deploy on Cloudflare Workers AI 集成,让开发者能以无服务器 API 形式调用部署在 Cloudflare 边缘数据中心 GPU 上的开源模型。
推荐理由:该功能将边缘无服务器 GPU 与开源模型库结合并按调用量计费,为开发者降低了运行开源大模型的运维门槛与闲置成本。
Hugging Face 宣布推出 TTS Arena,通过社区盲测与类 Elo 评分机制对文本转语音模型进行对比排行。用户输入文本后盲测试听两款模型的生成效果并投票,系统在提交后揭示模型名称并更新榜单。首批入选模型包括商业模型 ElevenLabs 以及 MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS 等开源方案。
推荐理由:平台借鉴盲测竞技场机制解决语音合成主观评估难的问题,为开发者比较开源与闭源语音模型提供了统一参考。
Hugging Face 宣布在 PEFT 库中支持多种针对 LoRA 适配器的融合新方法,允许开发者在运行时动态合并来自同一基模的多个微调权重。新方法涵盖矩阵拼接(cat)、线性加权(linear)、SVD 分解、TIES、DARE 以及幅度剪枝等机制,可通过 add_weighted_adapter() 直接调用。
推荐理由:文章梳理了六种 LoRA 适配器融合机制与参数调优实践,为多任务微调权重的低成本组合提供了标准参考。
Hugging Face 在 Text Generation Inference(TGI 1.4.0 起)及 Inference Endpoints 中推出 Messages API,实现对 OpenAI Chat Completion API 的兼容。
推荐理由:原文展示了如何通过兼容协议将代码平滑切至开源模型,为工程团队降低了模型迁移与自建部署的适配成本。
OpenAI 宣布推出 GPT Store。当前材料仅包含标题信息,具体功能与发布细节可参见原文链接。
Hugging Face 介绍了轻量级微调库 Unsloth 及其与 TRL 工具集的无缝集成,在保证精度零损失的前提下可将大语言模型微调提速最高 2.7 倍并减少最多 74% 显存占用。
推荐理由:文中展示了通过重写反向传播与 Triton 内核加速微调的具体实现,为在有限显存下微调开源模型提供了现成的集成方案。
Intel Labs 与 Hugging Face 联合推出 SetFitABSA 框架,专门用于少样本场景下的基于方面的情感分析(ABSA)。该方案通过 spaCy 提取候选词并利用两阶段 SetFit 模型依次完成方面识别与情感极性分类,完全摆脱了提示词工程与复杂的标注工具。
推荐理由:该框架无需人工编写提示词且依赖极少标注样本,为低成本构建垂直领域细粒度情感分析提供了实用方案。
Hugging Face 推出大语言模型推理加速库 Optimum-NVIDIA,结合 NVIDIA TensorRT-LLM 与 Ada Lovelace、Hopper 架构的 FP8 格式,开发者仅需修改单行代码即可完成部署。
推荐理由:该库通过接入 TensorRT-LLM 与 FP8 支持,为需要兼顾首字延迟与批处理吞吐的模型部署团队提供了直接迁移方案。
Hugging Face 宣布与 AMD 合作实现大语言模型在 AMD Instinct GPU 上的开箱即用加速,用户无需修改代码即可直接运行 Transformers 模型。
推荐理由:Transformers 和 TGI 实现了无需修改代码适配 AMD 硬件,开发者可以直接参考其针对大显存与 ROCm 算子的部署方案。
OpenAI 宣布 DALL·E 3 正式向 ChatGPT Plus 和 Enterprise 用户开放。团队构建了多层安全缓解措施以支持更广泛的上线,并同步公开了在内容来源溯源研究方面的最新进展。
推荐理由:OpenAI 将图像生成模型接入付费版 ChatGPT,同时展示了支持规模化上线的安全防护与来源追溯方案。
Hugging Face 推出 JavaScript 库 Gradio-Lite(`@gradio/lite`),利用 WebAssembly 运行时 Pyodide 让 Gradio 应用直接在浏览器内免服务器运行。
推荐理由:文章展示了通过 WebAssembly 将应用搬进浏览器的具体实现,开发者无需后端服务器即可低成本部署与分发交互原型。
Hugging Face 为 Transformers 中的 tokenizer 引入 chat_template 属性,通过 Jinja 模板将对话历史转换为与模型训练完全一致的输入字符串。
推荐理由:原文解释了格式不匹配导致模型性能严重受损的机制,并给出通过 Jinja 模板标准化对话输入的统一方案。
OpenAI 宣布 ChatGPT 推出视觉与语音能力,模型现已能够看、听和说话。
Hugging Face 宣布在 Transformers 库中原生集成 AutoGPTQ,支持使用 GPTQ 算法将大语言模型量化至 8、4、3 甚至 2-bit 精度。
推荐理由:原文给出了量化原理与完整集成调用方式,读者可以据此判断如何在消费级 GPU 上部署和微调大模型。