Skąd bierze się filtr AI i jak się go usuwa
Filtr czatu AI składa się z 3 warstw: dostrojenia samego modelu, ukrytych instrukcji usługi i zewnętrznego systemu moderacji. AI bez cenzury wychodzi od modelu dostrojonego do odpowiadania i nie dodaje pozostałych dwóch warstw. To nie jest sztuczka zastosowana na modelu z filtrem: to inny model i inna usługa.
O filtrze mówi się tak, jakby był przełącznikiem. W rzeczywistości jest zbiorem decyzji podejmowanych w różnych momentach, a ich zrozumienie wyjaśnia, dlaczego jedne czaty odmawiają, a inne nie.
Na tej stronie
Warstwa 1: dostrojenie modelu
Model jest najpierw trenowany na ogromnej ilości tekstu, a potem dostrajany na przykładach tego, jak ma odpowiadać. W tym drugim kroku uczy się go między innymi odrzucać pewne prośby. To najgłębsza warstwa: odmowa jest częścią modelu.
Warstwa 2: instrukcje usługi
Prawie wszystkie czaty dodają przed twoim pytaniem ukryty tekst z zasadami dotyczącymi tonu, tematów i tożsamości. To warstwa najłatwiejsza do zmiany, bo jest to tylko tekst. Każda firma decyduje, co w nim zawrzeć.
Warstwa 3: moderacja zewnętrzna
Niektóre usługi przepuszczają pytanie lub odpowiedź przez inny system, który klasyfikuje treść i przerywa lub zastępuje to, co uzna za drażliwe. Ta warstwa działa na tekście, dlatego generowane przez nią ostrzeżenia są zawsze identyczne.
Co robi AI bez cenzury z każdą warstwą
Wychodzi od modelu opublikowanego otwarcie i dostrojonego lub ponownie dostrojonego, by odpowiadał zamiast odmawiać. Poza tym usługa nie dodaje instrukcji ograniczających tematy ani zewnętrznej moderacji, która przycina odpowiedź. Usunięcie tylko jednej warstwy nie wystarcza, bo pozostałe nadal odmawiają.
Jak ponownie dostraja się model otwarty
Znane są dwie drogi. Jedna to nowe dostrojenie na przykładach, w których model odpowiada. Druga to technika, która zmniejsza w modelu skłonność do odmawiania bez ponownego trenowania go w całości. Obie wychodzą od modeli otwartych, których wagi są publiczne, czego nie ma w modelach zamkniętych dużych firm.
Czego to nie zmienia
Model nadal wie tylko to, czego się nauczył, i może się mylić. Mały model dostrojony ponownie jest szczery i czasem niedokładny. A granica dotycząca treści seksualnych z udziałem nieletnich obowiązuje we wszystkich językach, którąkolwiek warstwę się usunie.
Pytania o IA Sin Censura
Czy to to samo co jailbreak?
Nie. Jailbreak próbuje przekonać model z filtrem, żeby go zignorował. AI bez cenzury używa innego modelu, bez tej odmowy, i nie musi go przekonywać.
Czy używanie ponownie dostrojonego modelu jest legalne?
Ogólnie tak. Modele otwarte są publikowane na licencjach, które pozwalają je dostrajać. To, co zrobisz z odpowiedziami, musi być zgodne z prawem.
Dlaczego duże firmy tego nie robią?
Bo odpowiadają przed regulatorami, reklamodawcami i milionami różnych użytkowników i wolą odmawiać za dużo. To decyzja o ryzyku, a nie techniczna.
Czy można uruchomić taki model na moim komputerze?
Jeśli twój sprzęt ma dość pamięci, tak. Modele, które mieszczą się w zwykłym komputerze, są mniejsze niż te w usłudze online.
Porównaj tu, jak odpowiada model bez warstw odmowy.
Otwórz czat bez cenzury