SENQICE NET
bar
IP:216.73.216.221 Time:
加载中...
| 本站首页 | 在线新闻 | 技术文献 | 软件工具 | 国际版 |

-------- Welcome To Senqice Network !Thank You For Your Support !--------
·软件信息
·科技新闻
·阿里通义千问Qwen 2026全面进化:六大升级落地,从开源王者到全栈AI平台
·谷歌落子广州CBD,是“重返中国”还是“重新定位”?
·GPT-5.6曝光:OpenAI加速迭代,150万上下文+UltraFast模式即将登场
·Computex 2025:英伟达发布GB300超级芯片,定义AI基础设施新纪元
·2026 科技新坐标:从深空“芯片工厂”到地面“全自动驾驶”
·法国政府250万台电脑弃用Windows转向Linux:数字主权背后的博弈
·宇树科技73天闪电过会:A股人形机器人第一股呼之欲出,具身智能赛道全面爆发
·英伟达2026股东大会黄仁勋定调:AI基建周期长达数十年,"60年最大重置"才刚刚开始
·“韬”光养晦:华为定律改写芯片规则,英伟达向现实低头
·微软Copilot转向按量计费,DeepSeek等开源模型成商业必选项

GPT-5.6 Sol 视觉能力暴涨三倍,OpenAI 最强视觉 AI 登顶 Roboflow 评测

GPT-5.6 Sol 视觉能力暴涨三倍,OpenAI 最强视觉 AI 登顶 Roboflow 评测

视觉能力飞跃:从"交白卷"到"三倍提升"

近日,第三方视觉评测机构 Roboflow 发布了一份针对 OpenAI GPT-5.6 系列模型的视觉能力基准测试报告,结果令人震惊。GPT-5.6 Sol 在目标检测任务中得分从上一代 GPT-5.5 的 13.8 分飙升至 46.2 分,暴涨超过三倍,被 Roboflow 项目负责人 SkalskiP 称为"OpenAI 有史以来最强的视觉模型"。

GPT-5.6 Sol AI视觉识别能力展示

一直以来,目标检测是 GPT 系列模型的"重灾区"。任务本身并不复杂——让模型在图像中准确框出每个物体,但 GPT-5.5 的表现却相当糟糕,基本上"知道图里有东西,但框哪儿全靠蒙"。而 GPT-5.6 Sol 的分数直接飙涨至 46.2,Terra 和 Luna 也分别取得了 44.7 和 43.3 的优异成绩。

值得一提的是,即使是 GPT-5.6 系列中最便宜的 Luna 版本,其检测分数也远远超过了上一代旗舰模型的水平。

全面评测:计数、文档识别、密集场景均获突破

在计数能力方面,Sol 的准确率从 GPT-5.5 的 64.9% 提升至 73%,Terra 和 Luna 分别达到 67.6% 和 66.2%。然而,最令人瞩目的进步在于文档版面识别领域——Sol 能够干净地识别并圈出标题、正文、表格、插图和签名等文档元素,这对于合同处理、发票识别和报表分析等实际应用场景具有重大意义。

在密集场景识别方面,GPT-5.6 同样表现出色。药片、鸡蛋等数十个同类物体密集排列的图像,向来是视觉语言模型的"翻车现场"。由于大模型需要逐个坐标输出检测框,物体越多,漏检、重复和坐标偏差的概率就越高。但 GPT-5.6 Sol 成功应对了这一挑战,甚至能够完成更为刁钻的任务——例如在一张靶纸上,只数出落在指定环数区域内的弹孔数量。

短板犹存:OCR 能力不升反降

然而,Sol 并非完美无缺。在最反常识的测试结果中,Sol 的文字识别(OCR)能力出现了退步。在整段转写方面,Sol 得分 90.7%,略低于 GPT-5.5 的 91.2%。但在"定向提取"任务中,Sol 仅拿下 82.5%,而 GPT-5.5 为 87.6%,差距达 5 个百分点。

Sol 并非不认字——它能准确转写手写笔记,能从冰球比赛直播画面中提取实时比分。但面对药板上那行字小、竖排、低对比度且带有反光的有效期时,却翻车了。

大尺寸图像稳定性问题

Roboflow 在测试中还发现,当图片尺寸达到 2000×2000 像素左右或更大时,Sol 返回的检测框会飘到画面中毫不相干的地方。OpenAI 对此回应称,推理档位越低,这一问题越严重。解决方法是调高推理档位(但会增加 Token 用量和延迟),或在发送给 API 之前先将图片缩小。

性价比之争

在成本方面,Sol 约 2.5 美分/张,处理时间约 10 秒;Terra 约 1 美分/张,约 6 秒;Luna 不到 0.5 美分/张,约 5 秒。相比之下,Google Gemini 3.5 Flash 每张仅 0.8 美分,在检测和计数任务上仍保持领先,堪称"性价比之王"。

GPT-5.6 Sol 这次真正令人意外的是,视觉能力正在从"看懂一张图"跨进"真正干视觉的活"。目标检测、画框、计数、空间关系理解和文档版面分析——这些过去属于专用视觉模型的地盘,如今正在被大语言模型一步步蚕食。

视觉大模型的下半场,已经从"能不能看懂"卷向了"干活准不准"。GPT-5.6 亮出了肌肉,但性价比的战争才刚刚开始。


本文内容基于公开网络资讯整理

查看人数:39
上一篇: Windows 11 老古董界面终于翻新:打印管理工具改用 WinUI 3 重构,全面推送在即
下一篇: 我国在量子技术国际标准领域取得新进展:中国主导多项标准制定
评论
添加新评论

*

*

*