GPT-5.6 Sol 视觉实测 检测从弱项变成能用
转述 Roboflow 内部 VLM 基准:Sol 检测 mAP 大涨、计数改善、OCR 持平;大图不稳与成本仍是代价。

Roboflow 在 GPT 5.6 Sol is the best "vision" model OpenAI ever released 里用即将公开的内部 VLM 基准跑检测、计数、OCR 与抽取。结论:Sol 是 OpenAI 迄今最强视觉档;Terra / Luna 也好过 GPT-5.5,但弱于 Sol。文首日期写 Jul 16,8 月 HN 再次把它顶起来,和 Sol 降价、Agent 用眼需求叠在一起。
数字摘要
- 检测 mAP@50:GPT-5.5 约 13.8 → Sol 约 46.2(Terra/Luna 约 44.7 / 43.3)。
- 计数:Sol 约 73.0%(5.5 约 64.9%)。
- OCR 均值相似度:Sol 约 90.7%,与 5.5 的 91.2% 接近;定向文本抽取 Sol 约 82.5%,略低于 5.5 的 87.6%。
提示格式敏感:对 GPT-5.6 用绝对 XYXY 像素框效果更好;错用 Gemini 那套 0–1000 YXYX 大约掉 15 mAP。约 2000×2000 及以上大图在低 reasoning 时框会漂,官方建议提高 effort 或先缩放裁剪。
成本与延迟
基准里 Sol 约 10 秒/图、约 2.5 美分/图;Terra ~6 秒 / ~1 美分;Luna ~5 秒 / <0.5 美分。Gemini 3.5 Flash 在其检测/计数仍更强且更便宜时,大批量标注仍可能选 Gemini。Playground 可同题对比 Fable 5 等。
怎么用在 Agent
UI Agent、单据版面、屏幕理解会明显受益;别把「OpenAI 视觉最好」读成「全面碾压开源/Gemini」。降价渠道见 Sol 降价一半,和视觉单价一起算才有意义。