Jak działają detektory esejów AI (i czemu nie są idealne)
Tim · Zespół redakcyjny SUS IT
Tim to inżynier oprogramowania i badacz AI ze specjalizacją w metodach detekcji.
Statystyka za detekcją tekstu — perplexity, burstiness — oraz dlaczego najlepsze narzędzia mylą się na ludzkiej prozie.
Detektory pisania z AI weszły do workflow edukacyjnego i redakcyjnego: skany prac studentów, fragmentów manuskryptów, spamu generowanego masowo. Ale jak to działa i czemu ludzki tekst bywa flagowany? Zrozumienie mechaniki pomaga nie mistyfikować probabilistycznego wyniku z wyrokiem.
Rdzeń problemu: język to statystyka
Język naturalny jest zjawiskiem statystycznym. Modele językowe uczą się na ludzkich korpusach — więc uczą się produkować statystycznie wiarygodny język, co utrudnia detekcję. Zadaniem detektorów jest znaleźć subtelne różnice, które przetrwają zmianę tematu i stylu.
Perplexity: jak przewidywalne są słowa?
Popularna metryka to perplexity: jak „zaskoczony” jest model każdym kolejnym słowem, znając kontekst. Ludzie częściej wprowadzają mniej przewidywalne wybory: żargon, idiom, skok myślowy. Tekst z LLM bywa bardziej „gładko prawdopodobny”. Długi fragment niskiej perplexity to sygnał do sprawdzenia.
Burstiness: ile zmienia się złożoność?
Drugi filar to burstiness — zmienność długości i struktury zdań w akapicie. Ludzie naturalnie „pękają” rytmem: długie zdanie, krótkie, gęsty fragment techniczny, potem metafora. Modele często utrzymują podobną głębię zdania po zdaniu, co daje płynny, ale zbyt jednolity rytm.
Czemu metryki nie są niezawodne
Perplexity i burstiness opisują tekst, nie tożsamość autora. Formalny raport inżynierski z założenia ma być przewidywalny i spójny — to dobra cecha stylu, nie dowód na ChatGPT. Wielojęzyczni autorzy też mogą pisać statystycznie „gładziej”. Fałszywe alarmy nie znaczą „zepsuty detektor” — znaczą „nakładające się rozkłady”.
Problem danych treningowych
Detektory trenuje się na znanych ludzkich i AI-tekstach. Jakość i różnorodność danych ograniczają skuteczność. Detektor na GPT-3.5 może gorzej łapać GPT-4o czy Claude 3.5. Angielski vs inne języki to osobna historia. Modele generatywne się zmieniają — detektory muszą się przebijać z lagiem retrains.
Zero-shot vs fine-tuning
Zero-shot liczy perplexity gotowym modelem — transparentnie, ale bywa mniej dokładnie. Klasyfikatory fine-tunowane mogą być celniejsze na swojej dystrybucji, ale podatniejsze na przeuczenie. Najlepsze systemy łączą podejścia i kalibrują pewność zamiast binarnego „tak/nie”.
Co robi odpowiedzialny detektor
Zwraca wynik z poziomem pewności, podświetla fragmenty napędzające ocenę, komunikuje znane tryby porażek i rekomenduje ludzki przegląd przy konsekwencjach. Analiza dokumentów w SUS IT tłumaczy, które wzorce podbiły wynik — detekcja bez uzasadnienia zaprasza do nadużyć.
Co zrobić z wynikiem
Jeśli własny tekst dostał wysoki wynik AI, dopracuj perspektywę autora, zmienność zdań, konkretne przykłady z doświadczenia i domenowy żargon — potem ponowny skan. Jeśli jesteś nauczycielem lub redaktorem, potraktuj wynik jako zaproszenie do rozmowy: zapytaj o proces, przejrzyj wskazane fragmenty, szukaj dodatkowych dowodów zanim podsumujesz sprawę.