返回快讯列表
开源生态

OpenRouter 上线图像横评,39 个模型跑同一批刁难 prompt

OpenRouter 8 月 21 日发布 Visual Image Benchmarks,39 个图像模型在 15 个高难度 prompt、7 个 prompt 族下横评,结果可按价格和耗时排序。

OpenRouter 在 8 月 21 日发了 Visual Image Benchmarks。作者 Brian Thomas,覆盖当时平台上全部 39 个图像模型,用 15 个刻意刁难的 prompt 横评。

结果做成网格,可以按价格和生成耗时排序,每张图下面标价格和耗时。prompt 分成七个族,包括不可能场景、计数、文字、空间关系、否定、基于参考图的最小编辑,以及多主体一致性。

官方自己说做这套的原因是,图像模型的样例页多是挑过的好看图,LLM-as-a-judge 还抓不到人一眼能看出的细节,arena 分数量的是大家更喜欢哪个输出,不是模型实际能做到什么。这套 prompt 的写法让人可以肉眼即时判断对错,比如红酒杯是不是真的斟到杯口。

官方表示会扩到视频和音频,并随新模型持续更新,也在 Discord 的 #feedback 征集下一轮能难住模型的 prompt。

更多快讯