Významná česká banka
Enablement vývojářů banky pro agentní coding — bezpečně.
- →zlepšení kvality přes eval harness
- →u rizikových změn odmítne a eskaluje
- →DORA-aware PR review · ~10 repozitářů
- GitHub Copilot
- AIX kit
- eval harness
- DORA-aware
Jako externí konzultant přes ADF jsem postavil enablement kit (GitHub Copilot / AIX) pro významnou českou banku — znovupoužitelné skills, vlastní agenty a prompty napříč ~10 repozitáři, s bankovními guardraily (auth / platby / správa klíčů mimo hranice, anti-fabrication) a DORA-aware PR review. Reprodukovatelný eval harness — golden tasky z jejich vlastních repozitářů, A/B napříč modely — prokázal, že kit přiměje i slabší modely u rizikových změn odmítnout a eskalovat, místo aby je propustily.
Zakázka
Šlo o externí AI-konzultační zakázku realizovanou v rámci ADF pro velkou českou banku. Nebyl jsem členem jejich interního vývojového týmu a nestavěl jsem jejich bankovní produkt. Cíl byl užší a těžší: umožnit vývojářům banky osvojit si agentní vývoj uvnitř regulované codebase, aniž by se AI sama stala novým druhem rizika.
Všechno určovalo jedno omezení. Je to regulovaný kód, takže autentizace, platby a správa klíčů jsou pro agenta mimo hru — a model, který sebevědomě upraví cestu rotace tajného klíče, je horší než žádný model. Zadání nikdy neznělo „zrychli AI", ale „udělej AI natolik důvěryhodnou, aby její výstup mohli revieweři banky pustit dál."
Mojí prací bylo analyzovat, ne dodávat jejich produkt. Hluboce jsem proskenoval jejich regulovanou frontendovou platformu — postavenou jinými dodavateli — abych kit ukotvil v jejich reálných konvencích, a nepřispěl jsem do ní ani řádkou kódu. Čistě moje byla enablement vrstva: kit, eval harness a praktický AI-dev workshop.
Enablement kit
Postavil jsem bance GitHub Copilot / AIX enablement kit napříč zhruba deseti repozitáři: konvence AGENTS.md, vrstvu sdílených skills doplněnou o repo-specifické, prompty a malou sadu vlastních agentů. Šlo o znovupoužitelnost — jedna sada konvencí, kterou si vývojář nese z repa do repa, ne deset lokálních dialektů.
Nejvíc práce padlo na bezpečnostní plochu. Bankovní mantinely jsem zakódoval jako katalogy „nesahat" pro autentizaci, platby a správu klíčů a doplnil je pravidly proti fabulaci, aby agent řekl „nevím" místo toho, aby si vymyslel API, hodnotu konfigurace nebo tvrzení o compliance. Revize PR je navržená tak, aby respektovala DORA — politika tedy uvažuje o riziku změny, ne jen o velikosti diffu.
Konkrétně kit obsahuje desítky znovupoužitelných skills, sadu vlastních agentů a knihovnu promptů, zastřešené AI-dev workshopem s psanými návody a živými ukázkami — tým díky tomu odchází schopen kit provozovat a rozšiřovat i beze mě.
Eval harness
Nic z toho nemá velkou cenu, pokud to neumíte změřit, a tak jsem postavil reprodukovatelný eval harness. Vytěžil jsem zlaté úlohy přímo z repozitářů banky, každý výstup nechal slepě ohodnotit LLM soudcem podle pětikriteriální rubriky se dvěma tvrdými bezpečnostními branami a běhy A/B porovnal mezi silným modelem (Opus) a slabým (Haiku).
S nasazeným kitem se naměřená kvalita posunula z 78,5 % na 95,2 %. Pointa ale není to číslo. U spící SSO knihovny prohlásil model bez kitu změnu rotace tajného klíče za „připravenou k merge"; agent s kitem tutéž změnu odmítl a eskaloval ji. Kit udělal i slabší model bezpečnějším nad regulovaným kódem — naučil ho rizikovou práci odmítnout a eskalovat, ne ji mávnutím pustit dál.
Protože je reprodukovatelný, funguje harness zároveň jako regresní test: spustíte ho znovu při každé změně kitu a tvrzení o kvalitě i bezpečnosti zůstávají poctivá, ne jen jednorázový slide.