AI摘要

为GLM-5.2/DeepSeek等纯文本大模型拓展视觉能力,通过Claude Code技能调用阿里云百炼视觉模型实现识图,提升开发效率。

前文

用 GLM 有段时间了,编码能力可以,前端视觉DeepSeek Flash的正式版也出了,但是因为缺少视觉能力,有些简单任务就会变得复杂。
比如开发页面或游戏时,口述总是显得苍白,费工夫又描述不全面。此时如果拥有识图能力,体验将会大不同!

为此我开发了一个适用于 Claude Codeskill,用来解决纯文本大模型无法识图的问题。

关于市面上的免费识图模型,我找了很久,比较靠谱的还是阿里云百炼,本skill会在AI识别到有识图需求时调用外部识图模型协助识图。

正文

安装前提

安装方法

将以下内容原封不动复制给 Claude Code:

读https://github.com/xiaotiewinner/cc-vision-skill的README.md,帮我安装识图skill

注意事项

  • 调用视觉模型使用python语言,所以安装过程中也会安装python(不用担心,如果你没装的话AI会帮你安装)
  • 这个 skill 只读图,不生成图

实现原理

这个 skill 让文本模型"长出眼睛"。脚本读取图片(本地路径/URL/管道),base64 编码后发给一个视觉大模型,把模型返回的文字描述读回来。默认走阿里云百炼,会自动从最便宜的模型开始尝试,免费额度用完自动换下一个,全部用完会提示用户需要充值。经估算,每次视觉调用约消耗 100-200 tokens,阿里赠送的100万 token 够用 5000 ~ 10000次。

实战效果

2026-08-07T09:53:50.png
这是我使用 deepseek-v4-flash 安装本skill并截图给它的效果。

项目地址

https://github.com/xiaotiewinner/cc-vision-skill
如果这个项目对你有用,请帮我点个星星,感谢支持

最后修改:2026 年 08 月 07 日
如果觉得我的文章对你有用,请随意赞赏
本文作者:
文章标题:cc-vision-skill:为 GLM-5.2/DeepSeek 进化出眼睛,实现多模态效果
本文地址:https://www.xiaotiewinner.com/2026/543.html
版权说明:若无注明,本文皆为 小铁的博客 原创,转载请保留文章出处。