Úloha: model dostane objemné podklady z naší produkční práce (desítky stran textu, fotografie, tabulky s čísly) a musí z nich vytvořit kompletní publikovatelný obsahový výstup: strukturu, texty a práci s fakty z podkladů i z obrázků. Je to nejtěžší reálná úloha, kterou po lokálních modelech chceme — a přesně ta, kde se láme „umí česky“ vs. „píše publikovatelně“.
Hodnocení: 12bodová rubrika, šest kategorií po 0–2 bodech — věcná správnost, úplnost, jazyk a údernost, práce s vizuálními fakty, odolnost proti vymýšlení a forma. Každý výstup hodnotíme proti zlatému standardu vytvořenému člověkem s přístupem ke všem podkladům. Skóre v tabulce je průměr z více domén a opakovaných běhů.
Poctivost: skóre porovnáváme jen v rámci stejné verze úlohy — při vylepšení vstupů se čísla hýbou víc, než kolik dělá výměna modelu (ověřili jsme si to draze). Proto tabulka roste pomalu a u modelů bez plného běhu uvádíme jen kvalitativní poznámky. A protože testujeme na naší produkční úloze, model skvělý u nás nemusí být nejlepší na vaši úlohu — berte žebříček jako silné vodítko, ne rozsudek.