Microsoft‑badacze twierdzą, że modele AI jeszcze nie potrafią rozwiązywać trudnych problemów.
Microsoftowi badacze ujawnili ograniczenia współczesnych dużych modeli językowych (LLM) przy wykonywaniu złożonych wielokrotnych zadań
W ramach eksperymentów Microsoft Research odkrył, że nawet najbardziej zaawansowane modele AI popełniają poważne błędy, gdy zostają poproszone o przeprowadzenie długotrwałych i wieloetapowych operacji. Wśród przetestowanych systemów — Gemini 3.1 Pro, Claude 4.6 Opus i GPT 5.4 — średnio każdy stracił około 25 % zawartości dokumentów po autonomicznym przetworzeniu.
Co dokładnie testowano
* Benchmark DELEGATE‑52
Stworzony przez zespół Filippa Labana, Tobiasza Schnabela i Jennifer Nevill. Symuluje przepływy pracy w 52 obszarach zawodowych: od programowania i zapisu nutowego po krystalografię.
* Kryterium oceny
Modele oceniane były pod kątem zachowania integralności dokumentu po 20 cyklach przetwarzania. Poziom „gotowości” został ustawiony na 98 % – jeśli wynik spadł poniżej, zadanie uznawane było za nieudane.
Główne wnioski
Obszar Najlepsze wyniki Programowanie Najsilniejsze wskaźniki Naturalny język Najmniej niezawodne modele
* Spadek jakości
W ponad 80 % kombinacji dokumentów jakość spadła do 80 % i niżej. Najlepszy model (Gemini 3.1 Pro) spełniał kryteria gotowości tylko w 11 z 52 obszarów.
* Skokowe błędy
Straty nie zachodziły stopniowo, lecz „skokami”: w jednym cyklu interakcji model mógł stracić od 10 do 30 % dokładności. Bardziej zaawansowane modele (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) starały się unikać drobnych błędów, odkładając ich przetwarzanie na późniejsze etapy i zmniejszając liczbę interakcji.
* Zarządzanie agentem
Przy użyciu narzędzi w trybie zarządzania agentem wyniki nie poprawiały się: pod koniec cyklu jakość spadała o około 6 %.
Co to oznacza dla użytkowników
Naukowcy podkreślają, że użytkownicy nadal muszą uważnie kontrolować pracę systemów AI przy delegowaniu im uprawnień. Obecne modele są w stanie działać autonomicznie tylko w wąskich obszarach.
Jednak autorzy benchmarku zauważają znaczący postęp: rodzina modeli OpenAI w ciągu 16 miesięcy poprawiła wskaźniki wydajności z 14,7 % do 71,5 %. Potwierdza to, że LLM nadal się rozwijają, ale na razie pozostają ograniczone w złożonych wielokrotnych zadaniach.
Komentarze (0)
Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.
Zaloguj się, aby komentować