在 Arena 测试让 AI 画丑鹈鹕:Mimo-V2.6-Pro 效果意外不错
用户在 Arena 测试让 AI 绘制“丑鹈鹕”,发现多数模型生成的画面较为抽象,而 Mimo-V2.6-Pro 的效果意外不错。该测试中一同对比的其他模型还包括 6.1-Sol 与 Grok-4.6。
用户在 Arena 测试让 AI 绘制“丑鹈鹕”,发现多数模型生成的画面较为抽象,而 Mimo-V2.6-Pro 的效果意外不错。该测试中一同对比的其他模型还包括 6.1-Sol 与 Grok-4.6。
评测网站 BridgeBench 推出 Nerf Bench 榜单,用于监测各大 AI 模型相较刚发布时保留的性能水平以判断其是否降智。数据显示,opus 5.5 当前性能相较刚发布时下降了 5%。目前该基准仅测试并收录了 4 个模型。
Qoder 在长程复杂任务处理与执行安全性上表现最稳,但网络检索较弱且积分消耗快。豆包工作的网络资讯检索与办公交互体验最佳,代码任务完成度居第二梯队;codebuddy 复杂任务完成率较低且安全审批偏弱,zcode 则更适合自行接入模型。实际工作流推荐先由 6.1 sol 完成核心架构,再分配任务给国产 Agent 协作执行。
社区用户在 qoder 测试 Qwen3.8-Flash 时,因其在经典庭院提示词下的生成表现超出预期,发帖质疑请求是否被路由到了 Qwen4。其他用户回复证实该输出确实来自 Qwen3.8-Flash 本身,并表示该模型达到此水平属于正常表现。
社区用户针对 Gemini 3.8 绘制“鹈鹕骑自行车”的图像生成表现展开讨论。相关话题还涵盖了 Gemini 3.8 Flash、Gemini 3.7 flash high 以及 GLM5.3 等模型在同类绘图提示词下的生成测试。