GPT-5.6 Sol 视觉能力暴涨三倍,OpenAI 最强视觉 AI 登顶 Roboflow 评测
视觉能力飞跃:从"交白卷"到"三倍提升"
近日,第三方视觉评测机构 Roboflow 发布了一份针对 OpenAI GPT-5.6 系列模型的视觉能力基准测试报告,结果令人震惊。GPT-5.6 Sol 在目标检测任务中得分从上一代 GPT-5.5 的 13.8 分飙升至 46.2 分,暴涨超过三倍,被 Roboflow 项目负责人 SkalskiP 称为"OpenAI 有史以来最强的视觉模型"。

一直以来,目标检测是 GPT 系列模型的"重灾区"。任务本身并不复杂——让模型在图像中准确框出每个物体,但 GPT-5.5 的表现却相当糟糕,基本上"知道图里有东西,但框哪儿全靠蒙"。而 GPT-5.6 Sol 的分数直接飙涨至 46.2,Terra 和 Luna 也分别取得了 44.7 和 43.3 的优异成绩。
值得一提的是,即使是 GPT-5.6 系列中最便宜的 Luna 版本,其检测分数也远远超过了上一代旗舰模型的水平。
全面评测:计数、文档识别、密集场景均获突破
在计数能力方面,Sol 的准确率从 GPT-5.5 的 64.9% 提升至 73%,Terra 和 Luna 分别达到 67.6% 和 66.2%。然而,最令人瞩目的进步在于文档版面识别领域——Sol 能够干净地识别并圈出标题、正文、表格、插图和签名等文档元素,这对于合同处理、发票识别和报表分析等实际应用场景具有重大意义。
在密集场景识别方面,GPT-5.6 同样表现出色。药片、鸡蛋等数十个同类物体密集排列的图像,向来是视觉语言模型的"翻车现场"。由于大模型需要逐个坐标输出检测框,物体越多,漏检、重复和坐标偏差的概率就越高。但 GPT-5.6 Sol 成功应对了这一挑战,甚至能够完成更为刁钻的任务——例如在一张靶纸上,只数出落在指定环数区域内的弹孔数量。
短板犹存:OCR 能力不升反降
然而,Sol 并非完美无缺。在最反常识的测试结果中,Sol 的文字识别(OCR)能力出现了退步。在整段转写方面,Sol 得分 90.7%,略低于 GPT-5.5 的 91.2%。但在"定向提取"任务中,Sol 仅拿下 82.5%,而 GPT-5.5 为 87.6%,差距达 5 个百分点。
Sol 并非不认字——它能准确转写手写笔记,能从冰球比赛直播画面中提取实时比分。但面对药板上那行字小、竖排、低对比度且带有反光的有效期时,却翻车了。
大尺寸图像稳定性问题
Roboflow 在测试中还发现,当图片尺寸达到 2000×2000 像素左右或更大时,Sol 返回的检测框会飘到画面中毫不相干的地方。OpenAI 对此回应称,推理档位越低,这一问题越严重。解决方法是调高推理档位(但会增加 Token 用量和延迟),或在发送给 API 之前先将图片缩小。
性价比之争
在成本方面,Sol 约 2.5 美分/张,处理时间约 10 秒;Terra 约 1 美分/张,约 6 秒;Luna 不到 0.5 美分/张,约 5 秒。相比之下,Google Gemini 3.5 Flash 每张仅 0.8 美分,在检测和计数任务上仍保持领先,堪称"性价比之王"。
GPT-5.6 Sol 这次真正令人意外的是,视觉能力正在从"看懂一张图"跨进"真正干视觉的活"。目标检测、画框、计数、空间关系理解和文档版面分析——这些过去属于专用视觉模型的地盘,如今正在被大语言模型一步步蚕食。
视觉大模型的下半场,已经从"能不能看懂"卷向了"干活准不准"。GPT-5.6 亮出了肌肉,但性价比的战争才刚刚开始。
本文内容基于公开网络资讯整理