让 AI 看视频这件事,一直是云端大模型的专利:你得把视频传到别人的服务器上,才换得回一句「看懂了」。2026 年 8 月 14 日,阿里把通义千问 Qwen3.8-27B 开源了——一个 17GB 的模型,普通电脑装得下,第一次能在自己电脑上看视频。官方跑分我一个字不信,自己出了六道有标准答案的考题。
▶ 视频直达:https://youtu.be/YhOLy4rex-0
怎么装:一行命令
用 Ollama(一个往电脑里装 AI 模型的免费工具):ollama pull qwen3.8:27b,下载 17GB 就完事。注意它要求 Ollama 0.33 以上,老版本会报 412。
它暂时不吃视频文件,用 ffmpeg 每秒截一张图再一起喂给它:
ffmpeg -i 你的视频.mp4 -vf "fps=1,scale=768:-1" f_%03d.jpg
六道考题(先定答案再提问,不许放水)
| 题 | 考什么 | 结果 |
|---|---|---|
| ① 描述 | 这段视频发生了什么 | ✓ 「两人在沙发上下国际象棋,黑衣服的深思之后落子」 |
| ② 认人 | 谁动了棋子、穿什么衣服 | ✓ |
| ③ 手写字 | 白板上写了哪些词 | ✗ 认出 5/7,另编出 5 个白板上没有的词 |
| ④ 屏幕字 | 网页大标题原文 | ✓ 一字不差 |
| ⑤ 顺序 | 四个场景谁先谁后 | ✓ |
| ⑥ 数数 | 画面里有几个人 | ✓ |
白板那题是全片的分界线:认不出,可以原谅;编出来,才吓人。它把认出的五个词和编出的五个词混在一起,语气一样笃定——这就是本地小模型现阶段的真实水平。
真活儿:看我自己上一条视频
把上一条《MiniMax H3 本地实测》的画面喂给它(只有画面,没有声音)。它读出了 MiniMax H3、196GB、本地 33 分钟、云端 7 分钟,全是片子里的数字,一个没错;还自己算了一句「云端快了将近五倍」(33 ÷ 6.93 ≈ 4.76)。
代价
运行时占 19GB 内存(ollama ps),最快一题 9.3 秒,最慢一题(74 帧)81.5 秒。
我的判决:三档
- 32GB 内存以上:直接上
- 16GB:别硬塞,它要吃 19GB
- 视频不能出家门的人(监控、会议录像、网课):就是为你准备的
它看得懂你的视频,但你的视频,不用出家门。你最想让它帮你看什么?评论区告诉我。
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。
文章末尾固定信息
我的微信
微信扫一扫


评论