OpenRouter 在 8 月 21 日发了 Visual Image Benchmarks。作者 Brian Thomas,覆盖当时平台上全部 39 个图像模型,用 15 个刻意刁难的 prompt 横评。
结果做成网格,可以按价格和生成耗时排序,每张图下面标价格和耗时。prompt 分成七个族,包括不可能场景、计数、文字、空间关系、否定、基于参考图的最小编辑,以及多主体一致性。
官方自己说做这套的原因是,图像模型的样例页多是挑过的好看图,LLM-as-a-judge 还抓不到人一眼能看出的细节,arena 分数量的是大家更喜欢哪个输出,不是模型实际能做到什么。这套 prompt 的写法让人可以肉眼即时判断对错,比如红酒杯是不是真的斟到杯口。
官方表示会扩到视频和音频,并随新模型持续更新,也在 Discord 的 #feedback 征集下一轮能难住模型的 prompt。