给Codex加上视觉功能:DeepSeek-V4-Flash 外挂 qwen3-vl-flash 教程(2026 年 8 月)
想要给Codex加上视觉功能?当我们为 Codex 换上速度快、Agent 能力极强的 DeepSeek-V4-Flash 作为底层模型时,会面临一个痛点:DeepSeek-V4-Flash 是纯文本模型,默认无法看图。
在日常编程场景中,读图是刚需——无论是还原 UI 截图、分析复杂的报错弹窗,还是核对页面布局,光靠文字描述既低效又容易出错。
🎯 核心摘要:本文将教你如何用 5 分钟、通过 3 个简单步骤,快速给Codex加上视觉功能。我们将结合开源插件
vision-skill与便宜好用的通义千问qwen3-vl-flash模型,让你的 Codex 瞬间拥有“看图写代码”的能力!
# 📚 本文目录(点击跳转)
- 为什么需要给 Codex 加上视觉功能?
- 技术原理:vision-skill 搭配 qwen3-vl-flash
- 接入前准备工作
- 第 1 步:在阿里云百炼获取 API Key
- 第 2 步:让 Codex 自动安装与配置
- 第 3 步:发送图片验证识图功能
- 常见问题解答 (FAQ)
# 为什么需要给 Codex 加上视觉功能?
接上 DeepSeek-V4-Flash 之后,Codex 成了顶级的“代码大脑”,能读能写,但偏偏是个“盲人”。如果你只写纯后端逻辑,这没问题;但只要涉及前端开发,对着设计稿干活,它就卡壳了。
给Codex加上视觉功能的思路,就像是在工地上进行精细分工:
- DeepSeek-V4-Flash 像是一个聪明的工头,负责逻辑推理和编写代码;
- 外挂视觉模型 则是专职的“质检员”,负责把画面看懂,并翻译成详细的文字汇报给工头。
# 技术原理:vision-skill 搭配 qwen3-vl-flash
感谢开源社区,目前已经有非常成熟的现成方案。核心由两部分组成:
- vision-skill 插件:这是一个开源技能包(GitHub 仓库:asuojun/claude-vision-skill (opens new window))。它的作用是给没有原生识图能力的主模型外接一双「眼睛」——能够读取本地或网络图片,调用外部视觉 API,并将看到的画面转化为描述塞回给 Codex。
- 通义千问 qwen3-vl-flash:这是我们选用的“眼睛”本体。它专门针对图文多模态(VL)场景设计,日常读取 UI 和截图完全够用。最重要的是:它极其便宜,且新用户有免费额度。它按 Token 计费(输入仅 0.15 元 / 百万 tokens),远比按张收费的模型划算。
# 接入前准备工作
在开始之前,请确认你已经具备以下条件:
- [x] 已完成基础配置:建议先阅读 Codex 接入 DeepSeek-V4-Flash (opens new window)。
- [x] 阿里云百炼账号:如果还没有,请前往阿里云官网免费注册。
- [x] 创建 API Key:我们将在下一步进行操作。
# 第 1 步:在阿里云百炼获取 API Key
首先,我们需要获取一把调用视觉模型的“钥匙”。

- 登录 阿里云百炼控制台 (opens new window)。
- 在左侧导航栏找到并进入 API-KEY 管理。
- 点击创建新的密钥,并复制保存下来。
⚠️ 安全警告:API Key 相当于你的数字钱包密码!千万不要把它发在公开教程、微信群或提交到 GitHub 公开仓库中,以免被盗刷额度。
# 第 2 步:让 Codex 自动安装与配置
这是最爽的一步——你不需要自己敲代码安装,直接把活儿交给 Codex 本身!
打开 Codex,将下面这段提示词(Prompt)修改好你的 API Key 后,直接粘贴发给它:

帮我全局安装 asuojun/claude-vision-skill(https://github.com/asuojun/claude-vision-skill),
按照 README 的说明进行配置。
视觉模型请选择阿里云百炼的 qwen3-vl-flash,
API Key 是 sk-xxxxxxxxx(请在此处替换为你刚刚创建的真实 API Key)。
Codex 收到指令后,会自动去下载仓库、检查本地环境、并写入相关配置。全程自动化,你只需喝口水等待即可。
# 第 3 步:发送图片验证识图功能

配置完成后,怎么确认已经成功给 Codex 加上视觉功能了呢?
很简单:直接在对话框里发一张截图给它(比如一张网页 UI 或者报错截图),并问它:“图片里有什么?”
如果它能准确用文字描述出图片中的内容、颜色、按钮位置或是报错代码,恭喜你,你的 Codex 已经成功长出了“眼睛”!
(注:如果验证失败,请回头检查第 1 步的 API Key 是否复制完整,或者让 Codex 重新排查一遍 vision-skill 的配置。)
# 常见问题解答 (FAQ)
Q:DeepSeek-V4-Flash 自己真的不能看图吗? A:是的,它是纯文本模型。这正是我们需要通过外挂方案来给Codex加上视觉功能的原因。
Q:这个方案后续使用会很贵吗? A:非常便宜。视觉模型是按 token 计费的,以 qwen3-vl-flash 为例,输入只要 0.15 元 / 百万 tokens。日常写代码看看截图,成本几乎可以忽略不计,而且新用户还有免费额度。
Q:必须用 qwen3-vl-flash 吗?
A:不一定。vision-skill 采用了兼容 OpenAI 的标准格式,理论上任何支持视觉 API 的模型都能无缝接入。本文推荐 qwen3-vl-flash 主要是因为性价比极高,非常适合日常看 UI 稿。