cc-vision-skill:为 GLM-5.2/DeepSeek 进化出眼睛,实现多模态效果

2026-08-07T09:40:00

前文

用 GLM 有段时间了,编码能力可以,前端视觉DeepSeek Flash的正式版也出了,但是因为缺少视觉能力,有些简单任务就会变得复杂。
比如开发页面或游戏时,口述总是显得苍白,费工夫又描述不全面。此时如果拥有识图能力,体验将会大不同!

为此我开发了一个适用于 Claude Codeskill,用来解决纯文本大模型无法识图的问题。

关于市面上的免费识图模型,我找了很久,比较靠谱的还是阿里云百炼,本skill会在AI识别到有识图需求时调用外部识图模型协助识图。

正文

安装前提

安装方法

将以下内容原封不动复制给 Claude Code:

读https://github.com/xiaotiewinner/cc-vision-skill的README.md,帮我安装识图skill

注意事项

  • 调用视觉模型使用python语言,所以安装过程中也会安装python(不用担心,如果你没装的话AI会帮你安装)
  • 这个 skill 只读图,不生成图

实现原理

这个 skill 让文本模型"长出眼睛"。脚本读取图片(本地路径/URL/管道),base64 编码后发给一个视觉大模型,把模型返回的文字描述读回来。默认走阿里云百炼,会自动从最便宜的模型开始尝试,免费额度用完自动换下一个,全部用完会提示用户需要充值。经估算,每次视觉调用约消耗 100-200 tokens,阿里赠送的100万 token 够用 5000 ~ 10000次。

实战效果


这是我使用 deepseek-v4-flash 安装本skill并截图给它的效果。

项目地址

https://github.com/xiaotiewinner/cc-vision-skill
如果这个项目对你有用,请帮我点个星星,感谢支持

当前页面是本站的「Baidu MIP」版。发表评论请点击:完整版 »