跳到正文
热点事件持续更新

单卡5070ti本地部署qwen3.8 27b实测

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月3日,LINUX DO刊出实测帖:在单卡RTX 5070 Ti(16G版)上,通过gsq-rco+ninfer推理引擎于WSL2+Ubuntu 24.04环境本地部署qwen3.8 27b模型,开启MTP3后,在160K上下文下prefill速度达1000 token/s、decode达100 token/s;当上下文扩至172K时,开启MTP已接近显存极限,不开MTP时decode约55 token/s。测试环境同时承担显卡视频输出,实际可用显存约14.8G。评论区有用户指出,该部署虽速度快,但模型智力水平偏低,鹈鹕测试表现不佳。目前该帖为最新报道,尚无后续数据更新,也未见与上述数字相矛盾的早先报道。

AI 根据报道生成 · 44 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. LINUX DO 最新
    单卡5070ti本地部署 qwen3.8 27b:160K上下文 prefill 1000t/s

    实测在单卡5070ti(16G版)上用gsq-rco+ninfer推理引擎本地部署qwen3.8 27b,WSL2+Ubuntu2404环境下开启MTP3,160K上下文prefill达1000t/s、decode达100t/s;172K后开MTP接近显存极限,不开MTP decode约55。显卡同时承担视频输出,实际可用显存约14.8G。有评论称该部署速度快但智力水平偏低,鹈鹕测试表现不佳。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。