原帖内容

本地实测 Qwen3.8-27B-VL 📖 结论:16GB 显卡可流畅交互,但默认思考偏长 视觉任务建议 max_tokens≥512 配置:RTX 5080 16GB|llama.cpp|Q3_K_S| 8K 上下文|单并发|视觉开启 热启动 9.0s,文本生成平均 54 tok/s 1960-token 预填 1575 tok/s,缓存后耗时 1.81→0.70s 中文 OCR、表格提取/计算、空间关系全部答对 显存约 15.7/16.3GB。 感觉可以给 dsh 免费插眼了👀 #Qwen #LocalAI #LLM #deepseek #dsh