想问视频"这段动作到底怎么发生的"?让 AI 按秒给你答案—— glm-5.3-flash-vision-video-rag 介绍

你有一段比赛录像、监控片段或者教学视频,想问"第二次团战是怎么输的""爆炸是几点发生的"。可视觉模型根本没有"视频模态"——实测把视频文件直接丢进去,GIF 只解码首帧。你真正想要的是:问一句话,拿到带 [MM:SS] 时间戳的答案,还能把那几秒的片段切出来自己看。

glm-5.3-flash-vision-video-rag 就是来解决这件事的。

你给它一段视频和一个问题,它还你带时间码的答案、关键时刻的关键帧、可播放的 ±5 秒片段,外加一份内嵌播放器的 HTML 预览页。基于智谱视觉大模型 GLM-5.3-Flash。


配图:先读一遍做帧卡片,之后按时间码翻片段

它到底能做什么

怎么用

你不需要懂抽帧和检索。在 codex / workbuddy 等 agent 装好 skill、配好 GLM key 后,直接对 AI 说话就行: 场景 1:先让 AI 把视频看一遍 你:帮我看看这段录像。 AI:它按时间轴抽帧阅读建立索引(15 秒视频约 18 秒完成),同时用场景切换检测标出剪辑点。 场景 2:问一个具体事件 你:爆炸是几点发生的? AI:它本地粗筛候选段、视觉模型看图确认、再深读作答——给出带 [MM:SS] 的答案,并切出该时刻前后 5 秒的可播放片段。 场景 3:抠动作细节 你:玩家瞄准有什么问题? AI:它自动升级到 12fps 中心放大逐帧分析,输出逐帧动作分解,并把关键帧和 HTML 预览页(内嵌播放器)一起给你。

配图:答案带时间码,片段和关键帧直接摊给你看

谁适合用

一点说明

glm-5.3-flash-vision-video-rag 是一套 AI 技能,装进 codex / workbuddy 等 agent 后对话使用,需要自备 GLM API key(写在 ~/.glm_api_key 或环境变量),依赖 ffmpeg/ffprobe 在 PATH。模型没有音频模态——一切理解基于画面,音轨被忽略,"听到了什么"回答不了,枪声、台词只能靠画面痕迹推断(产出里会注明)。宏观 1fps 引用误差约 ±2 秒,动作类问题会自动升级 12fps 微观(约 0.08 秒粒度)。姊妹版 deepseek-v4-flash-vision-video-rag 用 DeepSeek 引擎,架构同构。

← 返回目录