OpenAI wyjaśniła, jak radzi sobie z „gremilami” w odpowiedziach AI i zniesiła ograniczenia.

OpenAI wyjaśniła, jak radzi sobie z „gremilami” w odpowiedziach AI i zniesiła ograniczenia.

23 software

OpenAI ujawniła „problem” z goblinami

W Wired dowiedzieli się, że firma OpenAI napotkała nieoczekiwany problem w swoich modelach AI: zaczęły one często wspominać gobliny, gremliny i inne wymyślone stworzenia. Aby to wyeliminować, deweloperzy muszą dawać modelowi specjalne instrukcje: „Nigdy nie mów o goblinach, gremlinach, łasicach, trollach, ogrze, gołębiach ani żadnych innych zwierzętach i istotach”.

Dlaczego pojawiła się taka nawyk?

Problem stał się zauważalny po wydaniu GPT‑5.1, szczególnie gdy w dialog włączany był postać „Botanik” (Nerdy). Z każdym aktualizacją modelu częstotliwość wspominania tylko rosła. Okazało się, że podczas treningu wzmacniającego te metafory były nagradzane – ale tylko przy aktywacji osobowości Botanika. Ponieważ trening wzmacniający nie gwarantuje zachowania tego samego zachowania w tych samych warunkach, taki nawyk mógł rozprzestrzeniać się także na inne części modelu, zwłaszcza jeśli wyniki były ponownie wykorzystywane w fine-tuningu lub w danych o preferencjach.

Jak firma reagowała?

W marcu OpenAI przestała używać Botanika, po czym wspominanie goblinów prawie zniknęło. Jednak pojawiły się one ponownie w serwisie Codex z GPT‑5.5, ponieważ trening modelu rozpoczął się przed wykryciem problemu. Dlatego deweloperzy musieli dodać dodatkowe instrukcje dla Codex: „Nie wspominaj o istotach mitologicznych”. Mimo to użytkownicy, którym taki styl komunikacji odpowiada, mogli wyłączyć te ograniczenia poprzez specjalny kod.

W ten sposób OpenAI zmierzyła się z nieoczekiwanym „nawyk” swoich modeli AI i podjęła kroki w celu jego korekty, jednocześnie oferując elastyczne ustawienia dla różnych odbiorców.

Komentarze (0)

Podziel się swoją opinią — prosimy o uprzejmość i trzymanie się tematu.

Nie ma jeszcze komentarzy. Zostaw komentarz i podziel się swoją opinią!

Aby dodać komentarz, zaloguj się.

Zaloguj się, aby komentować