Našel systém správný důkaz?
Recall, precision, relevance, správné metadata a respektování oprávnění.
MADAI / AI EVALUATION
Jeden celkový dojem nestačí. Měříme zvlášť nalezení správných zdrojů, kvalitu odpovědi, volbu nástroje, provedení akce, bezpečnost a provozní náklady.
Produkční evaluace je verzovaný testovací systém. Umožní porovnat modely, prompty, retrieval i nástroje a zachytit regresi před nasazením změny.
01 / RÁMEC
Architekturu, data, modely i automatizaci navrhujeme kolem konkrétních pracovních scénářů a testů, ne kolem obecného dojmu z chatu.
Recall, precision, relevance, správné metadata a respektování oprávnění.
Správnost, úplnost, citace, nejistota, formát a doménová pravidla.
Výběr nástroje, parametry, pořadí kroků, approval gate a konečný stav.
02 / REALIZACE
Jeden celkový dojem nestačí. Měříme zvlášť nalezení správných zdrojů, kvalitu odpovědi, volbu nástroje, provedení akce, bezpečnost a provozní náklady.
Výsledek musí být opakovatelný, dohledatelný a provozně zvládnutelný. Proto oddělujeme kvalitu modelu, retrieval, nástrojové akce, bezpečnost a lidské rozhodování.
Verzovaná sada reálných dotazů, zdrojů a očekávaných výsledků.
Kategorie selhání: retrieval, reasoning, tool use, permissions, latency a UX.
Automatický test před změnou modelu, promptu, chunkingu nebo konektoru.
Oddělené uživatelské hodnocení, incidenty a vzorkované odborné audity.
03 / ROZHODNUTÍ
Odpovědi určují rozsah pilotu, úroveň autonomie, výběr modelů a provozní náklady.
Ne. Obecné benchmarky pomohou při předvýběru, ale produkční rozhodnutí musí vycházet z úloh, jazyka, dat a rizik konkrétního systému.
Odděleně hodnotíme retrieval a generování. Jinak nelze určit, zda model odpověděl špatně, nebo nedostal správný zdroj.
Vedle výsledku kontrolujeme trasu: zvolený nástroj, parametry, oprávnění, potvrzení, vedlejší efekty a schopnost bezpečně zastavit.
Společně vymezíme data, očekávaný výstup, rizika a evaluační sadu. Teprve potom rozhodneme o modelu a integracích.