DeepSeek V4 Flash 怎么接入 Codex 并实现识图?一篇看懂完整配置流程
这篇内容主要讲清楚两件事:怎么把 DeepSeek V4 Flash 接入 Codex,以及怎么让本身没有原生识图能力的模型,在 Codex 里获得读图能力。整套思路和此前用低成本方式在 Hermes 里接入 DeepSeek 的方法类似,核心还是通过配置工具来完成模型接入,再额外补一个可用的视觉能力。
为什么现在要做 DeepSeek V4 Flash 接入 Codex?
这期内容的起因,是因为 DeepSeek 发布了 V4 Flash 正式版。在原文里提到,之前是 Preview 版本,而这次正式版给出的一些指标,表现已经远超 V4 Pro Preview。
其中最让人关注的是 Terminal-Bench 达到 82.7。原文强调,光看这一项就已经很有意思了。因为这类能力可以直接理解成:模型在终端环境中的工具调用能力更强,放到 Codex 或 Hermes 这类 Agent 里,会更靠谱。说白了,不只是会聊天,而是更像一个真正能配合你做事的模型。
另一个关键点是,V4 Flash 正式版原生支持 Response API,并且是专门针对 Codex 做了适配。原文还提到,之前它们更多是适配 Claude Code;但随着使用习惯和产品变化,现在越来越多人转向使用 Codex,所以这个适配就变得很重要。
接入 DeepSeek V4 Flash 到 Codex 之前,要准备什么?
第一步:下载 Codex 客户端
原文说明,Codex 和 ChatGPT 客户端前不久已经合并,所以你搜 Codex 或者 ChatGPT 都可以找到。它有 Windows 版本,原文演示环境是 Mac,但逻辑是一样的。
这里有一个重点:先不用纠结登录和注册。原文的操作顺序很明确,先把客户端准备好,后面再处理配置和接入。
第二步:去 DeepSeek 开放平台创建 API Key
接下来进入 DeepSeek 开放平台,在 API Keys 这里新建一个 Key。原文建议你给它命名,比如直接命名成 Codex,这样后面配置时不容易混。
创建完成后,系统会给你一个 API Key。这里要注意一个细节:这个 Key 只能看一遍,所以一定要先复制出来,临时存到备忘录之类的地方,后面配置会用到。
第三步:下载并安装 CC Switch
CC Switch 是这套流程里的核心配置工具。原文对它的定位很直接:统一管理 AI 编程工具和工作流的配置工具。像 Codex、Claude Code、Gemini、Hermes 这些都能配。
为什么要用它?因为如果你想自己做这类 Provider 切换和模型接入,基本绕不开这类配置工具。原文提到,它在开源生态里已经有很高的使用度,说明这条路线是很多人在走的,而不只是少数人折腾的冷门玩法。
DeepSeek V4 Flash 怎么正式接到 Codex 里?
第一步:在 CC Switch 中添加 Codex 供应商
打开 CC Switch 之后,进入对应页面,点击右上角的加号,开始添加新的供应商。这里要添加的是 Codex Provider。
往下找到 DeepSeek,选中它。原文提到,这里的很多配置项其实已经预设好了,所以不需要你从零手填一堆复杂参数。
第二步:填入刚才创建的 DeepSeek API Key
找到 API Key 位置,把刚才从 DeepSeek 开放平台 复制出来的 Key 填进去,然后做保存和设置。
这一步的逻辑非常简单:选好 DeepSeek,填好 Key,保存并启用。原文里反复强调,核心就是这个,不需要把事情想复杂。
第三步:启用配置并重启 Codex
配置完成之后,要记得点一下启用。然后回到 Codex,这里原文特别提醒了一下:需要重启客户端,因为它要重新加载刚才的 Provider 配置。
重启之后再进入,你会看到已经走的是自定义 Provider。这时候你可以直接输入一句简单的话,比如:“你好,你是什么模型”。
原文指出,这时候它还是可能会回答自己是 Codex,但这并不代表没接通。原因是它有自己的内置提示词。所以判断是否接通,不要只看这句自我介绍,而要看配置是否真的生效、Provider 是否已经切换完成。
为什么接通了 DeepSeek,Codex 还是看不懂图片?
这正是很多人第一次接入后最容易误判的地方。
原文演示得很直接:即使已经把 DeepSeek V4 Flash 接入 Codex,你给它发一张截图,再问它“这是什么”,它大概率还是看不到真正的图片内容。
它可能会尝试去调一些类似 Vision Tool 的能力,或者转而做 OCR,试着提取文字,但这并不等于它真的具备了图片理解能力。原文的结论很明确:这说明它本身并没有真正的读图能力,至少在这里的这套接入方式下,是不能直接看图的。
没有 Vision 能力,怎么让 DeepSeek 在 Codex 里实现识图?
核心思路:加一个 Claude Vision Skill
原文推荐的方案是:额外安装一个 Skill,名字叫 Claude Vision Skill。虽然名字里带 Claude,但它并不是只能给 Claude 用。原文解释得很清楚:这是一个通用方案,可以让 DeepSeek 这类没有 Vision 能力的模型,也获得看图能力。
换句话说,这里不是给 DeepSeek 本体“升级”,而是给整个 Agent 工作流补了一只“眼睛”。所以名字不用太在意,关键是它能用。
为什么这里还要准备一个视觉模型?
因为这个 Skill 要真正完成识图,背后还是要调用一个能看图的模型。原文采用的是免费的云平台方案,并且这次继续使用了 阿里百炼 里的视觉模型。
这里的逻辑很务实:DeepSeek 负责主流程,视觉能力交给一个额外的图像模型。这样成本会相对低一些,同时也能把功能补齐。
Claude Vision Skill 的安装和配置步骤是什么?
第一步:先准备视觉模型和对应的 Key
原文里使用的是 千问视觉模型,并提到需要把该模型的 model code 复制出来。同时,还要在对应平台创建一个新的 API Key。
这里有两个必备信息:
1. 视觉模型的模型标识(model code)
后面配置 Skill 时要用到。
2. 视觉模型平台的 API Key
因为识图调用走的是另一个模型,所以不能只靠 DeepSeek 的 Key。
第二步:把 Skill 安装任务直接交给 AI
原文这里采用的是一种很省事的方式:直接让 AI 帮忙安装这个 Skill。做法是先复制 Claude Vision Skill 的安装内容,然后在新会话里输入类似:
“帮我安装一下这个 Skill。”
但原文提醒,先别急着回车。要先把视觉模型的信息准备好,也就是刚才说的 model code 和 API Key。
第三步:把视觉模型信息一并交给它配置
原文的做法非常直接:把视觉模型的平台信息、模型代码、API Key 都告诉它,让它帮你把环境配置好。
这一步其实是在告诉系统:以后当主模型看不懂图片时,自动把图片理解这件事转交给指定的视觉模型去处理。
第四步:等待安装完成,并注意新会话生效
原文里在一轮配置之后,Skill 已经成功安装,并且通过真实图片调用 API 验证成功,说明识图流程已经打通。
不过还有一个容易忽略的细节:Skill 会在下一轮会话中自动生效。也就是说,配置完别直接拿当前会话硬测,开一个新会话再测试,结果会更准确。
怎么验证 DeepSeek 在 Codex 里已经具备识图能力?
测试方法:直接发一张尽量少文字的图片
原文建议,为了节约这类多模态能力,测试时最好用一张没有文字,或者文字很少的图片。这样模型更容易专注于图像本身,而不是绕到 OCR 上去。
然后你直接发图,再问一句:
“这是什么?你看得到吗?”
成功的表现:系统会自动调用 Claude Vision Skill
原文演示时,系统出现了正在读取 Claude Vision Skill 的提示。接着,它识别出了图片内容,比如:
这是一张 OpenCode 应用图标的截图,背景是模糊的金色桌面。
这就说明两件事已经成立:
第一,DeepSeek 本体虽然没有直接看图能力,但通过 Skill 已经能完成图像理解。
第二,整个调用过程可以自动发生,不需要你每次都手动点名某个 Skill。
整套接入流程,最关键的几个点是什么?
1. DeepSeek V4 Flash 接入 Codex,靠的是 Provider 配置
核心工具是 CC Switch。你真正做的事情,本质上是:在 Codex 的工作流里,把底层模型供应商切到 DeepSeek。
2. 识图能力不是 DeepSeek 自动就有的
这是原文里最重要的判断之一。接通模型 和 具备多模态能力 不是一回事。前者只是能用,后者要看模型本身和额外配置。
3. 要让它识图,得补一个 Skill,再接一个视觉模型
也就是说,真正完整的方案不是一步,而是两步:
先接 DeepSeek V4 Flash 到 Codex;再用 Claude Vision Skill 接一个可用的视觉模型。
4. 配置完成后,要重启或新开会话再验证
原文里两次都强调了类似逻辑:Provider 切换后要重启客户端,Skill 安装后要开新会话。如果你跳过这一步,往往会以为自己没配成功。
这套方法适合什么人?
从原文的表达来看,这套方法特别适合两类人:
一类是想用 Codex,但又希望以较低成本接入强模型的人;
另一类是已经在折腾 AI 编程工具,希望把模型能力和工作流自由组合的人。
原文最后的落点也很明确:这样一套配下来,大家就可以以比较低的成本,用上当前主流的 Agent 能力,同时还补上了识图这个非常实用的功能。
结语:这套 DeepSeek 接入 Codex 的方法,值不值得折腾?
如果只看原文传达出来的意思,答案是很明确的:值得。因为它不是单纯换个模型名,而是把 DeepSeek V4 Flash 的终端能力、Codex 的 Agent 工作流,再加上额外的视觉能力拼到了一起。这样一来,实际可用性就不是停留在“能聊”,而是更接近“能帮你干活”。
另外,原文里有一句口误需要顺手纠正一下:前面提到“GPT”相关内容时,实际语境里说的是 Codex / ChatGPT 客户端,不是别的缩写,配置时不要自己记混了。真正要分清的,是 DeepSeek 的 Key、视觉模型的 Key、以及它们各自承担的能力。
我认为:眼下许多人用工具,总想一步到位,最好装上就全能,可真正能落地的办法,往往不是等一个完美模型从天而降,而是老老实实把每一块能力接起来。DeepSeek 负责推理和工具,Codex 负责承载工作流,Vision Skill 负责看图,这样拼出来的东西,反倒更像今天普通人真正用得上的生产力。
#Agent
© 版权声明
文章版权归作者所有,未经允许请勿转载。






