产品更新
GPT-5.6 Sol视觉能力暴涨3倍:目标检测从13.8飙至46.2,OpenAI最强视觉AI登顶
2026年8月19日,第三方视觉评测机构Roboflow把GPT-5.6全家桶拖进自家VLM基准跑了一圈,测试内容是最实在的活儿:找东西、数东西、认字、抽信息。目标检测这项上一代GPT-5.5只拿13.8分基本等于交白卷,GPT-5.6 Sol直接冲到46.2暴涨3倍多。Terra和Luna分别达44.7和43.3——最便宜的Luna照样把上代旗舰按在地上摩擦。Roboflow负责人SkalskiP直言"GPT-5.6 Sol是OpenAI有史以来最强的视觉模型"。
文档版面识别最亮眼——标题、正文、表格、插图、签名Sol都能干净圈出来,这对做合同发票报表处理的人不是小事。密集场景也扛住了——药片鸡蛋等几十个同款物体挤在一起的VLM传统翻车现场。甚至一张靶纸只让数指定环数区域里的弹孔Sol也做对了,它不仅知道数什么还知道规则管到哪儿为止。计数方面Sol准确率从GPT-5.5的64.9%升到73%。
但最反常识的是Sol认字能力退步。OCR整段转写90.7%比GPT-5.5的91.2%低半点,定向提取82.5%比87.6%掉5个点——药板上竖排低对比度反光的有效期读不出。OpenAI承认图片尺寸达2000x2000像素或更大时Sol检测框会飘到毫不相干的地方且排得异常整齐。解法是调高推理档位(Token用量延迟账单全涨)或发API前先缩小裁切。成本方面Sol约2.5美分/张10秒,Terra约1美分6秒,Luna不到0.5美分5秒,而Gemini 3.5 Flash每张0.8美分——高频大批量检测计数Gemini Flash仍是性价比之王。视觉大模型下半场已从"能不能看懂"卷向"干活准不准"。