MADAI / AI EVALUATION

Evaluace, která oddělí model, retrieval a akci.

Jeden celkový dojem nestačí. Měříme zvlášť nalezení správných zdrojů, kvalitu odpovědi, volbu nástroje, provedení akce, bezpečnost a provozní náklady.

V kostce

Produkční evaluace je verzovaný testovací systém. Umožní porovnat modely, prompty, retrieval i nástroje a zachytit regresi před nasazením změny.

Nejdříve měřitelný systém. Potom škálování.

Architekturu, data, modely i automatizaci navrhujeme kolem konkrétních pracovních scénářů a testů, ne kolem obecného dojmu z chatu.

01 / RETRIEVAL

Našel systém správný důkaz?

Recall, precision, relevance, správné metadata a respektování oprávnění.

02 / RESPONSE

Odpověděl věcně a s oporou?

Správnost, úplnost, citace, nejistota, formát a doménová pravidla.

03 / ACTION

Použil správný nástroj bezpečně?

Výběr nástroje, parametry, pořadí kroků, approval gate a konečný stav.

Co musí být připravené před produkcí

Jeden celkový dojem nestačí. Měříme zvlášť nalezení správných zdrojů, kvalitu odpovědi, volbu nástroje, provedení akce, bezpečnost a provozní náklady.

Výsledek musí být opakovatelný, dohledatelný a provozně zvládnutelný. Proto oddělujeme kvalitu modelu, retrieval, nástrojové akce, bezpečnost a lidské rozhodování.

  1. 01
    Golden set

    Verzovaná sada reálných dotazů, zdrojů a očekávaných výsledků.

  2. 02
    Failure taxonomy

    Kategorie selhání: retrieval, reasoning, tool use, permissions, latency a UX.

  3. 03
    Regression gate

    Automatický test před změnou modelu, promptu, chunkingu nebo konektoru.

  4. 04
    Production feedback

    Oddělené uživatelské hodnocení, incidenty a vzorkované odborné audity.

Otázky, které mají přímý vliv na architekturu.

Odpovědi určují rozsah pilotu, úroveň autonomie, výběr modelů a provozní náklady.

Stačí obecný benchmark modelu?+

Ne. Obecné benchmarky pomohou při předvýběru, ale produkční rozhodnutí musí vycházet z úloh, jazyka, dat a rizik konkrétního systému.

Jak měřit RAG?+

Odděleně hodnotíme retrieval a generování. Jinak nelze určit, zda model odpověděl špatně, nebo nedostal správný zdroj.

Jak testovat agenty?+

Vedle výsledku kontrolujeme trasu: zvolený nástroj, parametry, oprávnění, potvrzení, vedlejší efekty a schopnost bezpečně zastavit.

Začněte úlohou, kterou lze otestovat.

Společně vymezíme data, očekávaný výstup, rizika a evaluační sadu. Teprve potom rozhodneme o modelu a integracích.

Naplánovat konzultaci →