让 AI 读完一本几百页的 PDF,还能告诉你答案在第几页?—— glm-5.3-flash-vision-rag 介绍

你手上有一份 120 页的技术手册或扫描版合同,想问它一个具体问题。整本塞给 AI?token 爆炸、慢得要命;用传统文字 RAG?碰到图表、表格、公式、扫描件就瞎了,页码还经常报错。你真正想要的是:问一句话,拿到答案,顺便看到那几页的原图自己核对。

glm-5.3-flash-vision-rag 就是来解决这件事的。

你给它一份 PDF 和一个问题,它还你带 [第N页] 标注的答案,外加引用页的原图和一份自包含 HTML 预览页。基于智谱视觉大模型 GLM-5.3-Flash。


配图:读一遍做笔记,之后按笔记翻书

它到底能做什么

怎么用

你不需要懂 RAG。在 codex / workbuddy 等 agent 装好 skill、配好 GLM key 后,直接对 AI 说话就行: 场景 1:先让 AI 把书读一遍 你:帮我读一下这份 120 页的手册。 AI:它逐页视觉阅读建立索引(约 3 分钟,只需一次),之后这本书就"被读过了",这一步永远不用再做。 场景 2:问具体问题 你:审批策略出厂默认是什么? AI:它本地粗筛出 12 页候选,视觉模型看图确认到 4 页,再深读作答——给出带 [第6页] 标注的答案,并把第 6 页原图和 HTML 预览页一起给你。 场景 3:只要某一页 你:给我看看第 72 页。 AI:它直接高清渲染那一页的图片,无需先建索引。

配图:答案带页码,原图直接摊开给你核对

谁适合用

一点说明

glm-5.3-flash-vision-rag 是一套 AI 技能,装进 codex / workbuddy 等 agent 后对话使用,需要自备 GLM API key(写在 ~/.glm_api_key 或环境变量)。索引按 PDF 内容哈希缓存,内容改了自动另建。它用的是三层漏斗——本地 TF-IDF 粗筛(免费)→ 视觉精排 → 深读作答,所以每次提问只花 2 次调用、十几秒出答案。局限是单次深读上下文约 12 页,涉及全书统计类问题精度会下降。姊妹版 deepseek-v4-flash-vision-rag 用 DeepSeek 引擎,架构同构,可两边对照。

← 返回目录