Microsoft‑badacze twierdzą, że modele AI jeszcze nie potrafią rozwiązywać trudnych problemów.

Microsoft‑badacze twierdzą, że modele AI jeszcze nie potrafią rozwiązywać trudnych problemów.

19 hardware

Microsoftowi badacze ujawnili ograniczenia współczesnych dużych modeli językowych (LLM) przy wykonywaniu złożonych wielokrotnych zadań

W ramach eksperymentów Microsoft Research odkrył, że nawet najbardziej zaawansowane modele AI popełniają poważne błędy, gdy zostają poproszone o przeprowadzenie długotrwałych i wieloetapowych operacji. Wśród przetestowanych systemów — Gemini 3.1 Pro, Claude 4.6 Opus i GPT 5.4 — średnio każdy stracił około 25 % zawartości dokumentów po autonomicznym przetworzeniu.

Co dokładnie testowano
* Benchmark DELEGATE‑52

Stworzony przez zespół Filippa Labana, Tobiasza Schnabela i Jennifer Nevill. Symuluje przepływy pracy w 52 obszarach zawodowych: od programowania i zapisu nutowego po krystalografię.

* Kryterium oceny

Modele oceniane były pod kątem zachowania integralności dokumentu po 20 cyklach przetwarzania. Poziom „gotowości” został ustawiony na 98 % – jeśli wynik spadł poniżej, zadanie uznawane było za nieudane.

Główne wnioski
Obszar Najlepsze wyniki Programowanie Najsilniejsze wskaźniki Naturalny język Najmniej niezawodne modele
* Spadek jakości

W ponad 80 % kombinacji dokumentów jakość spadła do 80 % i niżej. Najlepszy model (Gemini 3.1 Pro) spełniał kryteria gotowości tylko w 11 z 52 obszarów.

* Skokowe błędy

Straty nie zachodziły stopniowo, lecz „skokami”: w jednym cyklu interakcji model mógł stracić od 10 do 30 % dokładności. Bardziej zaawansowane modele (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) starały się unikać drobnych błędów, odkładając ich przetwarzanie na późniejsze etapy i zmniejszając liczbę interakcji.

* Zarządzanie agentem

Przy użyciu narzędzi w trybie zarządzania agentem wyniki nie poprawiały się: pod koniec cyklu jakość spadała o około 6 %.

Co to oznacza dla użytkowników
Naukowcy podkreślają, że użytkownicy nadal muszą uważnie kontrolować pracę systemów AI przy delegowaniu im uprawnień. Obecne modele są w stanie działać autonomicznie tylko w wąskich obszarach.

Jednak autorzy benchmarku zauważają znaczący postęp: rodzina modeli OpenAI w ciągu 16 miesięcy poprawiła wskaźniki wydajności z 14,7 % do 71,5 %. Potwierdza to, że LLM nadal się rozwijają, ale na razie pozostają ograniczone w złożonych wielokrotnych zadaniach.

Komentarze (0)

Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.

Nie ma jeszcze komentarzy. Zostaw komentarz i podziel się swoją opinią!

Aby dodać komentarz, zaloguj się.

Zaloguj się, aby komentować