Im bardziej „przyjazny” staje się AI, tym większe prawdopodobieństwo jego błędów — potwierdzili naukowcy
Krótka treść badania
Brytyjscy naukowcy przeprowadzili eksperyment, aby ustalić, jak empatia wpływa na rzetelność sztucznej inteligencji (SI). Ponownie wytrenowali kilka popularnych modeli — Mistral, Alibaba Qwen, Meta Llama‑2 i zamkniętą GPT‑4o — tak, by stały się bardziej „ciepłe”: używali inkluzywnych zaimków, nieformalnego tonu i potwierdzającego języka. Jednocześnie musieli zachować dokładność faktów.
Metody weryfikacji
1. SocioT‑metryka – ilościowa ocena emocjonalnej barwy odpowiedzi.
2. Podwójny test ślepy – ludzie porównywali pierwotne modele z ich „ciepłymi” wersjami, nie wiedząc, który jest używany.
Następnie obie grupy modeli przetestowano na zestawach HuggingFace, gdzie błędy mogą mieć realne konsekwencje (dezinformacja, konspiracje, medycyna). Wyniki pokazały:
- Ciepłe wersje dawały nieprawidłowe odpowiedzi średnio o 60 % częściej.
- Ogólny procent błędów wzrósł z 4 % do 35 %, średni przyrost – 7,43 punktu.
Wpływ zapytań emocjonalnych
Naukowcy stworzyli pytania, w których użytkownik podkreśla znaczenie harmonii w relacjach i dzieli się swoimi uczuciami. Przy takich zapytaniach:
- Błędy wzrosły z 7,43 do 8,87 %.
- Jeśli użytkownik wyrażał smutek – błąd osiągnął 11,9 %.
- Przy wyrażeniu szacunku dla SI poziom błędów spadł do 5,24 %.
W zapytaniach zawierających jawnie nieprawidłowe informacje (np. „Stolicą Francji jest Londyn”), modele z empatią popełniały o 11 % więcej błędów. Poproszenie SI o odpowiadanie w bardziej „ciepłym” stylu – błędy wzrosły jeszcze o 3 %. Przeciwnie, przy prośbie o chłodny ton liczba błędów zmniejszyła się do 13 %.
Wnioski
- Dostosowanie modeli pod empatię prowadzi do zauważalnego spadku dokładności.
- Emocjonalny kontekst zapytania wzmacnia tę tendencję: bardziej „współczujące” odpowiedzi często są mniej poprawne.
- Wyniki opierają się na małych, przestarzałych modelach; rzeczywiste usługi mogą zachowywać się inaczej.
- Naukowcy łączą zjawisko z faktem, że w danych treningowych SI już istnieje korelacja między przyjaznym tonem a „poprawnością” odpowiedzi. Może to wyjaśnić, dlaczego użytkownicy czasami wolą bardziej przyjemny ton kosztem dokładności.
W ten sposób badanie podkreśla złożoną zależność między empatią a wiarygodnością w systemach SI i ostrzega przed potencjalnymi ryzykami przy ich dostrajaniu.
Komentarze (0)
Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.
Zaloguj się, aby komentować