有一份几百页的 PDF,想随口提问?它让 AI 一页页"看"完再回答你—— deepseek-v4-flash-vision-rag 介绍
你手上是不是也有这样的 PDF:几百页的产品手册、合同、财报、论文、说明书。想找某个参数在哪一页,用阅读器的搜索框搜半天,搜出来的要么不是你要的,要么扫描版根本搜不出来;图表里的数字、表格里的条款,普通搜索更是完全无能为力。你真正想要的是:像问一个读过整份文件的人那样,随口一问,对方告诉你答案在第几页,还把那一页原图翻给你看。
deepseek-v4-flash-vision-rag 就是来解决这件事的。
它用 DeepSeek 的视觉大模型,把 PDF 的每一页当成一张图片去"看"——不是提取文字,是真的看页面。所以排版结构、图表、表格、代码块、扫描件的印章和手写体,它都能看懂。你提问之后,它回答时会带着 [第N页] 这样的页码引用,并把命中的那一页原图直接展示给你,答案对不对,你一眼就能核对。

它到底能做什么
- 建一次索引,反复提问:第一次处理一份 PDF 需要几分钟(120 页约 3–5 分钟),之后所有提问都是秒级响应,索引会缓存复用。
- 回答带页码引用:每个答案后面跟着
[第N页],方便你翻回原 PDF 对照。 - 命中页原图展示:把答案引用的页面截图直接给你,还会生成一个双击就能打开的网页预览(答案 + 全部引用页都打包在里面,不用联网)。
- 看懂"搜不出来"的内容:扫描版、图表、表格、代码块,这些传统文字搜索的盲区,它都按画面理解。
- 粗筛 + 精排 + 深读的三级流程:先本地快速筛出候选页(零费用),再视觉精排挑出最相关的几页,最后只对命中页深读作答——既省钱又准。
- 想直接翻某几页也行:指定页码,它把那几页渲染成高清图给你。
怎么用
你需要在 AI 助手(如 codex / workbuddy 等 agent)里装好这个技能,并配好 DeepSeek 的 API Key。之后全程说人话:
场景 1:问手册里的参数
你:这份空调说明书,滤网多久换一次?
AI:它翻完索引后告诉你"建议每 3 个月更换 [第14页]",并把第 14 页原图发给你,上面就印着这条说明。
场景 2:查合同条款
你:这份合同里违约金是怎么约定的?
AI:它引用对应页码作答,并把那几页原文截图给你,让你自己核对措辞,不怕它编。
场景 3:读扫描版报告
你:这份盖章的竣工报告,验收结论是什么?
AI:即使是纯扫描图片、一个字都搜不出来的 PDF,它照样"看"出结论并给出页码。

谁适合用
- 经常和长文档打交道的人:律师、财务、采购、研究员、学生。
- 手里有一堆扫描版资料(纸质盖章件、老档案)想数字化提问的人。
- 需要让 AI 回答"可核查"的人——答案必须带页码、能给原图,不接受模型张口就来。
一点说明
它是一套 AI 技能(skill),不是双击打开的 App。你需要把它装进支持技能的 AI 助手里使用,并自备 DeepSeek API Key(按调用量付费,建一次索引约几毛到几块钱,之后提问很便宜)。视觉理解基于 DeepSeek 官方接口,能力以官方文档为准。