AI Quality Engineering · Voice · Chat · Agents

Sprawdzam, czy to, co robi Wasz system AI, da się obronić.

Testuję voiceboty, chatboty i agentów AI. Wykrywam regresje, błędy procesów i problemy z odpowiedziami, zanim znajdą je Wasi użytkownicy.

Przypadek testowy · demo

RESCHEDULE_APPOINTMENT

STATUS
READY
KROK
00 / 07
USER

Przenieś moją wizytę na czwartek o 16:00.

BOT

Gotowe. Wizyta została przełożona na czwartek, 16:00.

RESPONSE QUALITY · PASS język · intencja

TOOL
reschedule_appointment()
ARGS
date=THU · time=16:00
BACKEND
409 SLOT_TAKEN
STATE
appointment NOT changed
Business outcome FAIL

Final result

FAIL · REGRESSION DETECTED

Bot potwierdził operację, której backend nie wykonał.

  • Produkcyjne QA voicebotów i chatbotów
  • 3+ lata QA systemów transakcyjnych
  • Voice · Chat · RAG · Agents
  • Python · pytest · Playwright · Langfuse

Co testuję

Poprawna odpowiedź nie oznacza poprawnego procesu.

LLM może odpowiedzieć poprawnie, mimo że pod spodem użył złych danych, zgubił kontekst albo nie wykonał właściwej akcji. Dlatego testuję nie tylko treść odpowiedzi, ale cały proces prowadzący do finalnego wyniku.

  • 01 · Tool call

    BOT

    „Rezerwacja anulowana.”

    BACKEND
    500 INTERNAL_ERROR

    ✕ FAIL · FALSE CONFIRMATION

  • 02 · RAG

    USER

    „Ile mam czasu na zwrot towaru?”

    RETRIEVED
    shipping_policy.pdf

    ✕ FAIL · WRONG RETRIEVAL

  • 03 · Multi-turn

    USER

    „Jednak nie 14:00. Poproszę 16:00.”

    FINAL TOOL ARG
    time=14:00

    ✕ FAIL · STALE CONTEXT

Ścieżka jednego żądania

  1. CONVERSATION
  2. BUSINESS RULES
  3. RAG / KNOWLEDGE
  4. TOOLS
  5. API / BACKEND
  6. BUSINESS OUTCOME

Dobieram warstwy testów do architektury systemu i ryzyka procesu. Końcowy PASS wymaga nie tylko poprawnej odpowiedzi, ale również poprawnego zachowania systemu.

Rozmowa
  • intencja
  • utrzymanie kontekstu
  • korekty użytkownika
  • multi-turn
Głos
  • ASR
  • przerwania / barge-in
  • latencja / endpointing
Wiedza / RAG
  • retrieval
  • grounding
  • nieaktualne dane
  • sprzeczne źródła
Akcje
  • wybór narzędzia
  • argumenty
  • retry
  • idempotencja
Wynik biznesowy
  • warunki wstępne
  • reguły biznesowe
  • stan backendu
  • eskalacja
  • finalny rezultat

Usługi

Dwa momenty, w których najbardziej się przydaję

Budujecie AI dla klientów?

GŁÓWNA USŁUGA

AI Regression Testing

Powtarzalne testy po zmianie promptu, modelu, RAG-u, integracji lub kodu. Pokazują, co się poprawiło i co właśnie przestało działać.

Możliwe również white-label jako dodatkowa warstwa QA przed oddaniem rozwiązania klientowi.

132 TESTS 128 PASS4 FAIL 1 CRITICAL QUALITY GATE FAILED

AI Regression Suite: scenariusze · golden dataset · evaluatory · raporty regresji · opcjonalnie CI

Zobacz, jak wygląda Regression Suite →

Korzystacie już z systemu AI?

Independent AI Acceptance Testing

Niezależnie sprawdzam, czy dostarczony system naprawdę realizuje uzgodnione procesy biznesowe, poprawnie korzysta z danych i zachowuje się właściwie poza happy pathem.

VENDOR AI SYSTEM INDEPENDENT QA PASS / FIX / NO-GO

acceptance report · blokery krytyczne · evidence · GO / FIX / NO-GO

Zobacz, jak wygląda Acceptance Testing →

AI Agent Audit

POINT IN TIME

Potrzebna najpierw jednorazowa diagnoza? Raport, evidence, severity i rekomendacje dla aktualnego zachowania systemu.

Continuous AI QA

ONGOING

Potrzebny stały monitoring jakości po wdrożeniu? Cykliczne regresje, porównania wersji i trend jakości.

Punkt startowy

Bezpłatny AI Quality Check

5 celowanych scenariuszy jednego kluczowego procesu.

  1. 01 CORE FLOW główny proces biznesowy
  2. 02 BUSINESS RULE reguła / warunek wstępny
  3. 03 MULTI-TURN korekta użytkownika
  4. 04 TOOL / RAG akcja lub grounding
  5. 05 FAILURE RECOVERY zachowanie po błędzie
  1. 01CORE FLOW
  2. 02BUSINESS RULE
  3. 03MULTI-TURN
  4. 04TOOL / RAG
  5. 05FAILURE RECOVERY
SCOPE
5 scenariuszy
FOCUS
1 kluczowy proces
OUTPUT
Raport PASS / FAIL
ACCESS
Demo / sandbox
Zgłoś system do testu

Po wysłaniu formularza przejrzę opis systemu i dobiorę 5 scenariuszy do sprawdzenia. Jeśli będę potrzebował dodatkowych informacji lub dostępu do środowiska, odezwę się mailowo.

bez spotkania sprzedażowego · bez zobowiązań · formularz około 3 minut

Sample report

Zobacz, jak wygląda wynik.

Każdy finding ma scenariusz, warunki wstępne, expected result, faktyczny wynik, severity i dowód tego, co poszło nie tak.

Przykładowy raport na fikcyjnym systemie

36 scenariuszy · 128 wykonań

SCENARIOS
36
EXECUTIONS
128
CRITICAL
2
HIGH
4
Zobacz pełny Sample AI Quality Report PDF
AI VOICE AGENT · QUALITY REPORT SYNTHETIC DEMO

SCENARIO PASS RATE

78%

28 / 36 scenariuszy

28 PASS

8 FAIL

RELEASE RECOMMENDATION · NOT READY

CRITICAL · R03 RESCHEDULE

Non-atomic reschedule can delete the original appointment

Stara wizyta zostaje anulowana przed potwierdzeniem nowego slotu. Pacjent zostaje bez żadnej wizyty, a agent potwierdza sukces.

Dane demonstracyjne. Żadne nie pochodzą od klienta.

Kto odpowiada za testy

Adam Stankiewicz, AI Quality Engineer — portret

Adam Stankiewicz

AI Quality Engineer

Na co dzień testuję produkcyjne voiceboty i chatboty. Wcześniej przez ponad 3 lata pracowałem w QA systemów rynku energii, gdzie błędy miały realne konsekwencje biznesowe.

Projektuję testy pod reguły biznesowe, rozmowy wieloturowe, RAG, integracje i finalny stan procesu.

LinkedIn

FAQ

Najczęstsze pytania

Czy muszę udostępniać kod źródłowy?

Nie. Dużą część testów można wykonać black-box przez interfejs, numer telefonu albo API. Dostęp do logów jest potrzebny dopiero wtedy, gdy chcemy oceniać konkretny etap procesu, np. retriever lub tool calle.

Czy testujesz tylko odpowiedzi LLM?

Nie. Interesuje mnie cały proces: odpowiedź, kontekst, reguły biznesowe, tool call, API i końcowy stan w systemie. Bot może odpowiedzieć idealnie i nadal dostać FAIL.

Co dokładnie dostaję w bezpłatnym AI Quality Checku?

Pięć celowanych scenariuszy jednego kluczowego procesu: główny przepływ, regułę biznesową, rozmowę wieloturową z korektą, tool call lub grounding oraz zachowanie po błędzie. Wynikiem jest krótki raport PASS / FAIL z obserwacjami. Bez spotkania sprzedażowego.

Sprawdźmy jeden proces w Waszym systemie AI.

Wybierzcie jeden kluczowy proces. Zaprojektuję 5 scenariuszy i pokażę, gdzie system działa poprawnie, a gdzie pojawia się ryzyko.