DC娱乐网

腾讯发布了一款约8.5GB(BF16)的本地可运行模型,能视觉搜索私有 PDF、图表、表格、扫描件等,完全离线。 它不是聊天模型,而是基于Qwen3.5-4B微调的视觉文档检索模型。直接对页面图像进行理解(布局、图表、表格、图像、文字),而不是先 OCR 再切文本块。 基准表现: -ViDoRe V3 第一:65.36( ​

腾讯发布了一款约8.5GB(BF16)的本地可运行模型,能视觉搜索私有 PDF、图表、表格、扫描件等,完全离线。

它不是聊天模型,而是基于Qwen3.5-4B微调的视觉文档检索模型。直接对页面图像进行理解(布局、图表、表格、图像、文字),而不是先 OCR 再切文本块。

基准表现: -ViDoRe V3 第一:65.36(略超 webAI ColVec 8.4B 的 65.32,明显领先 NVIDIA Nemotron 8B 的 63.54 和 Jina Embeddings v4 的 57.54)

规格: -参数量:4.54B-体积:约 8.5GB BF16-原生128 维视觉 token 嵌入(非常紧凑)-多语言支持-Apache 2.0 开源-可本地运行

适用场景:给本地 AI 投喂大量 PDF、图表、扫描表格、论文、财报、技术手册等,实现真正的视觉页面级检索,而非纯文本 RAG。

这是 Local RAG 领域从“能搜文字”向“能看懂文档”迈进的实质性一步。结合后续的阅读型 VLM(把检索到的页面再交给大模型回答),可以构建更强大的私有知识库系统,尤其对非结构化、视觉丰富的文档库效果会明显提升。