有一份几百页的 PDF,想随口提问?它让 AI 一页页"看"完再回答你—— deepseek-v4-flash-vision-rag 介绍

你手上是不是也有这样的 PDF:几百页的产品手册、合同、财报、论文、说明书。想找某个参数在哪一页,用阅读器的搜索框搜半天,搜出来的要么不是你要的,要么扫描版根本搜不出来;图表里的数字、表格里的条款,普通搜索更是完全无能为力。你真正想要的是:像问一个读过整份文件的人那样,随口一问,对方告诉你答案在第几页,还把那一页原图翻给你看。

deepseek-v4-flash-vision-rag 就是来解决这件事的。

它用 DeepSeek 的视觉大模型,把 PDF 的每一页当成一张图片去"看"——不是提取文字,是真的看页面。所以排版结构、图表、表格、代码块、扫描件的印章和手写体,它都能看懂。你提问之后,它回答时会带着 [第N页] 这样的页码引用,并把命中的那一页原图直接展示给你,答案对不对,你一眼就能核对。


配图:AI一页页看完整本PDF

它到底能做什么

怎么用

你需要在 AI 助手(如 codex / workbuddy 等 agent)里装好这个技能,并配好 DeepSeek 的 API Key。之后全程说人话: 场景 1:问手册里的参数 你:这份空调说明书,滤网多久换一次? AI:它翻完索引后告诉你"建议每 3 个月更换 [第14页]",并把第 14 页原图发给你,上面就印着这条说明。 场景 2:查合同条款 你:这份合同里违约金是怎么约定的? AI:它引用对应页码作答,并把那几页原文截图给你,让你自己核对措辞,不怕它编。 场景 3:读扫描版报告 你:这份盖章的竣工报告,验收结论是什么? AI:即使是纯扫描图片、一个字都搜不出来的 PDF,它照样"看"出结论并给出页码。

配图:扫描件图表表格也看得懂

谁适合用

一点说明

它是一套 AI 技能(skill),不是双击打开的 App。你需要把它装进支持技能的 AI 助手里使用,并自备 DeepSeek API Key(按调用量付费,建一次索引约几毛到几块钱,之后提问很便宜)。视觉理解基于 DeepSeek 官方接口,能力以官方文档为准。

← 返回目录