Agent-EvalKit: open-source toolkit do testowania agentów AI
- AWS opublikowało open-source toolkit Agent-EvalKit na licencji Apache 2.0 do systematycznej ewaluacji agentów AI.
- Narzędzie integruje się z Claude Code, Kiro CLI i Kilo Code, śledząc pełną ścieżkę wykonania agenta: wywołania narzędzi, zwrócone dane i wierność końcowej odpowiedzi.
- Ewaluacja odbywa się przez komendy slash w środowisku deweloperskim i kończy raportem z rekomendacjami wskazującymi konkretne miejsca w kodzie.
AWS wypuściło Agent-EvalKit - otwartoźródłowy toolkit (Apache 2.0) do systematycznej ewaluacji agentów AI, który integruje się bezpośrednio z Claude Code, Kiro CLI i Kilo Code.
Dlaczego zwykłe testy nie wystarczą?
Agent może zwrócić świetnie sformatowaną, logicznie brzmiącą odpowiedź i jednocześnie ją sfabrykować - np. gdy jego narzędzia zwróciły puste wyniki. Może też dobrnąć do poprawnej konkluzji, omijając kroki weryfikacyjne, które powinny być częścią rzetelnego procesu. Oba scenariusze wyglądają niewinnie na poziomie wyjścia, ale są błędami, które w produkcji mogą robić szkody.
Tradycyjne testy sprawdzają czy output pasuje do oczekiwań. Agent-EvalKit idzie głębiej - rejestruje, które narzędzia agent odpalił, jakie dane te narzędzia zwróciły, i czy końcowa odpowiedź rzeczywiście pochodzi z tych danych.
Sześć faz zamiast jednej metryki
Toolkit działa przez sześć faz ewaluacji. Zaczynasz od opisania celów w naturalnym języku - resztą zajmuje się asystent kodujący. Kolejno:
- Odczyt kodu źródłowego agenta - asystent analizuje implementację
- Generowanie test case’ów z ground truth outcomes
- Instrumentacja observability - przechwytywanie wywołań narzędzi i stanów pośrednich
- Uruchomienie ewaluacji łączącej ocenę opartą na kodzie i LLM-as-judge
- Raport z rekomendacjami wskazującymi konkretne linie w kodzie
Driving interface to komendy slash: /evalkit.plan, /evalkit.data i kolejne - z możliwością dołączenia naturalnej instrukcji precyzującej, które wymiary jakości liczyą się najbardziej dla danego agenta.
Czy LLM-as-judge to wystarczająca miara?
Agent-EvalKit nie stawia na jeden styl ewaluatora. Ocena oparta na kodzie jest szybka i deterministyczna, ale karze prawidłowe podejścia, które po prostu wyglądają inaczej niż oczekiwano. LLM jako sędzia daje niuansową ocenę kosztem dodatkowego inference i przemyślanego prompt designu. Toolkit łączy oba - i to rozwiązuje realny problem: większość strategii ewaluacji staje na dashboardzie liczb, nie docierając do konkretnych poprawek w kodzie.
AWS zademonstrował działanie toolkit’u na agencie do badań podróżniczych zbudowanym ze Strands Agents SDK i Amazon Bedrock. To nieprzypadkowy wybór - agent tego typu łączy wiele źródeł danych i narzędzi, więc jest naturalnym polem do testowania detekcji halucynacji i weryfikacji ścieżki tool calls.
Ewaluacja jako część dev workflow, nie etap po wdrożeniu
Koncepcja, którą Agent-EvalKit realizuje, jest prosta: ewaluacja powinna siedzieć w tym samym środowisku, w którym piszesz kod - nie jako oddzielna platforma odpalana po deployu. Dzięki integracji z asystentami kodującymi cały pipeline - od analizy kodu przez generowanie testów po raport - dzieje się w IDE.
Narzędzie jest dostępne publicznie na GitHubie. Pytanie, czy zespoły budujące agentów na innych niż Amazon Bedrock backendach znajdą tu równie płynne doświadczenie - dokumentacja na razie milczy o wsparciu dla agentów poza ekosystemem AWS.