Vad testet mäter

En artikel som lades upp på arXiv den 7 oktober presenterar UltraText Bench, ett test av om en bildgenerator klarar tät visuell text: långa teckensträngar utspridda över flera områden i samma bild, placerade där prompten säger och fortfarande läsbara när bilden kommer ut.

Testet har 432 människogranskade prompter i 24 kategorier av verkliga scener och tre svårighetsgrader, jämnt fördelade mellan engelska och kinesiska. Varje prompt anger de exakta strängarna för mellan fyra och tolv separata textområden, tillsammans med en strukturerad referens som beskriver varje områdes innehåll, placering och visuella egenskaper.

Genereringen sker enbart utifrån prompten. Det finns ingen referensbild, ingen layoutmask och inget redigeringssteg — modellen får veta vilka orden är och var de ska stå, och måste producera bilden i ett svep.

Hur det poängsätts

Poängsättningen är automatisk. Författarna använder en syn- och språkmodell som heter Q-Judger för att jämföra varje genererad bild mot den fullständiga referensen längs fyra dimensioner: textens korrekthet, textens tydlighet, rumslig kvalitet och scenkvalitet. Tio deltagare medverkade i en mänsklig utvärdering av de automatiska poängen.

En uppslagen ordbok med spalter av tryckta ord
Scener med många separata texter är där poängen rasar. Illustrationsbild. Stefan G · pexels · Pexels License

Att skilja korrekthet från tydlighet visar sig spela roll. Författarna rapporterar att Z-Image-Turbo vinner 3,81 tydlighetspoäng över Z-Image-Base samtidigt som den tappar 14,76 korrekthetspoäng med de angivna inställningarna — den producerar alltså skarpare och mer läsbar text men får fler tecken fel. En enda sammanvägd poäng hade visat en förbättring.

Var modellerna faller

Huvudresultatet är vad som händer när textmängden ökar. Över 24 modellkonfigurationer följer prestandan antalet områden och antalet tecken snarare än scenens svårighet. Qwen-Image-2512:s engelska sammanvägda poäng faller från 86,50 på den lättaste nivån till 42,86 på den svåraste.

Det är ungefär halva poängen, från en modell som är bekvämt bra i den lätta änden. Att återge korta strängar — en skylt, en etikett, ett ord på en mugg — har förbättrats tillräckligt i hela fältet för att inte längre skilja modeller åt. En meny, en affisch eller ett formulär gör det.

Närbild på tryckt arabisk text på en boksida
Tät text skiljer en bild av ett dokument från ett dokument. Illustrationsbild. Ahmad Shaufi · pexels · Pexels License

Hur siffrorna ska läsas

Det är författarnas egna siffror, publicerade i en förtryckt artikel som inte granskats av kollegor, och bedömaren är själv en modell som läser liten text. Den mänskliga utvärderingen omfattade tio personer, vilket är en rimlighetskontroll snarare än en validering.

Testet täcker bara engelska och kinesiska, vilket lämnar utanför de skriftsystem där återgivning är svårast: arabisk sammanbindning, devanagaris ligaturer, höger-till-vänster-layout. Och som med varje fast promptsamling kommer poängen att betyda mindre när prompterna finns i träningsdata.

Varför det spelar roll

Tät text är avståndet mellan en genererad bild som ser ut som ett dokument och en som är ett dokument. En modell som kan placera tolv korrekta strängar på rätt platser är en modell som kan producera en användbar affisch, bild, förpackningsskiss eller gränssnittsvy. På de här uppgifterna är inget av de testade systemen framme på den högsta svårighetsgraden, och de som ser närmast ut är de som mäts på den lägsta.