Cisco wykryła powody, dla których nawet wydawały się idealne raporty AI o incydentach cyberbezpieczeństwa nie powinny być przyjmowane za prawdę
Cisco Talos bada dokładność dużych modeli językowych przy tworzeniu raportów cyberbezpieczeństwa
Zespół Cisco Talos Incident Response przeprowadził test, aby ustalić, jak niezawodne są współczesne LLM (ChatGPT, Claude i Gemini) w generowaniu technicznych raportów o incydentach cybernetycznych. Wyniki pokazały, że nawet najbardziej „profesjonalnie wyglądające” dokumenty zawierają błędy faktyczne, sprzeczności i niezgodności.
Jak przeprowadzono badanie
* Przygotowanie – badacze przekazali każdemu modelowi surowe notatki o incydencie z prośbą o sporządzenie raportu.
* Wynik – wszystkie trzy LLM wydały wizualnie dopracowane dokumenty, ale przy szczegółowej analizie ujawniły się nieścisłości i niespodziewane wnioski.
Nate Pors, starszy menedżer ds. reagowania na incydenty w Cisco Talos, szczegółowo opisał wyniki w firmowym blogu.
Dlaczego LLM „popełniają błędy”
Cisco tłumaczy problemy probabilistyczną naturą modeli: przewidują kolejne słowo na podstawie statystycznych wag, a nie rozumieją sensu. Według Porsa zniekształcenia objawiają się w czterech kierunkach:
1. Różne fragmenty danych
Przy każdym zapytaniu model opiera się na różnych częściach wejścia, co uniemożliwia uzyskanie powtarzalnych i standaryzowanych wyników.
2. Niezgodne wnioski
Te same dane mogą prowadzić do różnych rekomendacji: w jednym raporcie zostanie zasugerowana wymuszona zmiana haseł w całej organizacji, a w innym – tylko punktowe zmiany. Model często przywiązuje się do pierwszej wygenerowanej rekomendacji, nawet jeśli nie jest odpowiednia.
3. Nietypowa struktura
Ponieważ LLM tworzą tekst token po tokenie, końcowe dokumenty mogą mieć różną strukturę i formatowanie, co jest krytyczne w środowisku wymagającym szablonów do kontroli jakości.
4. Problemy z oknem kontekstowym
Przy objętości danych przekraczającej limit kontekstu model może „zapomnieć” ważne informacje z początku sesji i wydać nieprzewidywalne lub mieszane wyniki.
Co to oznacza dla cyberbezpieczeństwa
Cisco przyznaje, że teoretycznie można ograniczyć zadanie do konkretnego fragmentu raportu, ale taki podejście pozbawia użytkowników oszczędności czasu. W dziedzinie ochrony cybernetycznej nawet mały błąd może kosztować dużo. Dlatego autorzy końcowych dokumentów muszą dokładnie sprawdzać każde słowo i nie polegać całkowicie na rekomendacjach LLM.
Wniosek: duże modele językowe potrafią szybko generować raporty, ale ich wnioski wymagają obowiązkowej weryfikacji przez specjalistów, aby uniknąć błędów i niezgodności w krytycznie ważnym kontekście incydentów cybernetycznych.
Komentarze (0)
Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.
Zaloguj się, aby komentować