Zmínka, doporučení a citace odpovídají na různé otázky
Zmínka říká, že odpověď obsahuje rozpoznaný název vaší firmy. Sama neříká, jestli ji AI nabídla jako vhodného dodavatele. Věta „firma X tuto službu neposkytuje“ obsahuje název, ale pro obchod je zásadní ověřit její správnost a negativní význam.
Doporučení vyhodnocuji podle celého textu. AI musí firmu skutečně nabídnout jako možnost pro potřebu uvedenou v otázce. Sleduji i podmínky: doporučení jiné pobočky nebo služby, kterou neposkytujete, si zaslouží vlastní poznámku. Výskyt jména v přehledu trhu bych bez dalšího kontextu za doporučení nepovažoval.
Citace znamená odkaz uvedený jako zdroj odpovědi. U měření rozlišuji odkaz nalezený při vyhledávání a odkaz skutečně citovaný ve výsledném textu. Pokud poskytovatel tuto informaci nevrací, označím ji jako nezjištěnou. Odkaz pak otevřu a ověřím, zda podporuje konkrétní tvrzení.
| Modelový příklad | Co zaznamenat | Co ověřit |
|---|---|---|
| „Můžete oslovit firmu X.“ | Zmínka a doporučení | Odpovídá služba a lokalita? |
| „Firma X službu nenabízí.“ | Zmínka s negativním tvrzením | Je tvrzení aktuální a doložené? |
| Odkaz na článek firmy bez jejího jména | Citace vlastní URL | Kterou větu zdroj podporuje? |
| Technická chyba místo odpovědi | Neúspěšný test | Lze test bezpečně zopakovat? |
U každého procenta hledejte jmenovatel
Vezměme čistě modelový příklad. Naplánujete dvanáct testů, deset vrátí použitelnou odpověď a ve čtyřech je vaše firma zmíněná. Podíl zmínek mezi platnými odpověďmi je 4 z 10, tedy 40 %. Současně musíte uvést, že se podařilo získat 10 z 12 plánovaných odpovědí. Jsou to dvě různá čísla.
Technický výpadek nesmí automaticky vypadat jako odpověď bez vaší firmy. Při čtení reportu proto hledám počet platných, chybných a případně nevyhodnotitelných výsledků. Ptám se také, jak se zachází s přerušeným textem. Pouhá přítomnost několika slov ještě neznamená dokončenou odpověď.
Pravidla platnosti potřebuji znát před hodnocením výsledku. Pokud se změní, nechávám přepočítat i starší srovnávané odpovědi a změnu popíšu. Jinak by posun mohl vzniknout jen jiným způsobem počítání.
Jaký rozsah má měření L9
Základní sada L9 obsahuje 30 zákaznických otázek. Přes API je pokládám službám ChatGPT, Gemini a Claude se zapnutým vyhledáváním: ChatGPT a Claude jednou, Gemini dvakrát. To znamená 120 plánovaných odpovědí pro hlavní část měření. Skutečný počet použitelných výsledků uvádím podle dokončeného běhu.
Otázky přímo na firmu a navazující otázky sleduji odděleně. Do hlavního podílu je nepřimíchávám. Google a Seznam mohou tvořit samostatné rozšíření; Perplexity do současné základní sady nepatří. Rozsah musí být v reportu rozepsaný, aby bylo zřejmé, která část co měří.
API test má popsané podmínky a lze ho archivovat. Netvrdím, že tím reprodukuji osobní historii, nastavení a prostředí každého uživatele běžné aplikace. Když porovnáváte nabídky měření, ptejte se právě na prostředí a způsob získání odpovědí.
Opakování ukazuje proměnlivost, pokud skutečně proběhlo
AI může na stejný vstup vrátit jiný výstup. Upozorňuje na to i dokumentace OpenAI pro vyhodnocování modelů. Jednu odpověď proto čtu jako konkrétní pozorování v konkrétním okamžiku. [1]
V naší základní sadě mám dvě opakování u Gemini. Mohu tak ukázat, kde se tato dvě pozorování liší. U ChatGPT a Claude s jedním během za otázku ze stejného měření stabilitu neodvozuji. Dvě odpovědi zároveň neposkytují podklad pro jistotu, jak dopadne každý další test.
Před porovnáním kontroluji přesné znění otázky, jazyk, lokalitu, model, vyhledávání, kontext a počet opakování. Změněnou otázku označím jako novou. Při změně modelu nebo dostupnosti služby výsledky doplním o omezení a porovnám jen část, u které podmínky dávají smysl.
Nakonec zkontrolujte odpovědi, které změnily závěr
Prohlédnu si nové a ztracené zmínky, doporučení i citace. Kontroluji záměnu podobných názvů, starý název firmy a rozdíl mezi značkou výrobku a jeho prodejcem. Automatické hodnocení si ověřuji ručním čtením; i OpenAI doporučuje kalibrovat automatické metriky lidským posouzením. [1]
Užitečný závěr pak zní konkrétně: u této otázky se změnila odpověď, přibyl tento zdroj a informace o službě je stále chybná. Z takového nálezu mohu připravit opravu a další kontrolu. Samotné vyšší souhrnné procento mi neřekne, jestli AI nabízí správnou službu správnému zákazníkovi.
Zdroje a ověření
Externí tvrzení opírám o níže uvedené zdroje. Doporučený postup a příklady vysvětlují práci L9 Studios.
- OpenAI: Evaluation best practices
Proměnlivost odpovědí při stejném vstupu a ověření automatických metrik lidským hodnocením.
Zdroje ověřeny 2. 10. 2026. Při změně služby se může změnit i dostupnost popsaných funkcí.