最新精选 第 101–110 条 · 共 110 条 08:00 Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。
推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。
08:00 Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。
推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。
08:00 Hugging Face 官方发文汇总其生态在计算机视觉领域的全套支持能力,目前已覆盖 8 项核心视觉任务、3000 多个模型和 100 多个数据集。平台在 Transformers、Diffusers 与 timm 中提供了统一的推理 Pipelines、Trainer 微调接口及零样本视觉模型,同时兼容卷积与 Transformer 架构。
推荐理由:文章系统梳理了从模型微调到部署的计算机视觉工具链,读者可据此全面了解开源生态对主流视觉任务的接入方式。
08:00 Hugging Face Transformers 正式集成 Mask2Former 与 OneFormer 两个通用图像分割模型,统一支持实例分割、语义分割和全景分割任务。
推荐理由:原文梳理了从逐像素分类到掩码分类的统一图像分割架构演进,并给出了使用 Transformers 快速调用的代码示例。
08:00 Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。
推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。
08:00 Hugging Face 梳理了文档智能领域的开源技术方案,涵盖 OCR、图像分类、版面分析、文档解析、表格识别和视觉问答六大核心场景。文章系统对比了 LayoutLM 系列流水线方案与 Donut、PaliGemma 等端到端视觉语言模型的性能表现与商用许可差异。团队建议企业从微调开源预训练模型入手,并根据输入分辨率、标注边界框与具体任务指标设计评估流程。
推荐理由:文章系统梳理了文档智能的六大任务分类与代表性开源模型,为企业选择端到端多模态方案或传统流水线提供了实践参考。
08:00 rinna 正式发布日语文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本文化与表达习惯的图像。该模型在约 1 亿带有日文说明的图文数据上微调,通过引入日语分词器并分阶段联合训练文本编码器与潜在扩散模型,模型与代码已在 Hugging Face 和 GitHub 开源。
推荐理由:文章详细拆解了如何用两阶段微调将英文扩散模型迁移至小样本小语种,为本土化文生图适配提供了清晰方法。
08:00 Hugging Face 在 Transformers 库中正式集成了 Perceiver IO 模型,能够统一处理文本、图像、音频、视频和光流等多种模态。该架构通过在固定维度的潜在变量上进行自注意力计算,将计算和显存开销与输入尺寸解耦,消除了传统 Transformer 计算复杂度随输入二次方增长的限制。官方同时上线了相关任务的代码实现类、在线演示与教程 Notebook。
推荐理由:Perceiver IO 借助固定潜在变量打破了传统注意力机制的输入维度瓶颈,读者可参考其在多模态统一处理上的工程实现。
16:00 OpenAI 在多模态模型 CLIP 中发现了多模态神经元,这类神经元无论面对字面、象征还是抽象概念形式,都会对同一概念产生响应。该发现解释了 CLIP 分类非常规视觉表现形式的能力,也为理解多模态模型所学关联与偏见提供了关键切入点。
推荐理由:研究揭示了模型内部存在跨形态响应的神经元,为解析多模态表征机制和模型偏见提供了可解释性视角。
16:00 OpenAI 训练了名为 DALL·E 的神经网络,能够根据自然语言可表达的广泛概念直接从文本标题生成图像。
上一页 1 … 4 5 6