Badanie zbudowane na warsztacie funduszu: „odcenzurowane" modele AI są mierzalnie bardziej optymistyczne
29 lipca 2026 · komunikat funduszu
Warsztat danych funduszu posłużył właśnie do czegoś więcej niż cotygodniowe analizy. Autor projektu, Aleksander Fafuła, opublikował na arXiv badanie „Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families" — o tym, co naprawdę dzieje się z modelem językowym, gdy usunie mu się mechanizmy odmowy (tzw. abliteracja, popularna metoda „odcenzurowywania" otwartych modeli).
Co pokazało badanie
Punktem wyjścia było pytanie praktyczne: czy „odcenzurowany" model da lepsze prognozy giełdowe, bo „powie prawdę tam, gdzie zwykły jest zbyt ostrożny"? Eksperyment — 21 600 decyzji na dwóch rodzinach otwartych modeli (w wersjach bazowych i po abliteracji), na identycznych pakietach danych o spółkach giełdowych, z prerejestrowanym planem analizy — pokazał coś innego:
- zdjęcie cenzury nie poprawiło trafności prognoz (pozostała na poziomie typowania losowego — spójnie z wynikami sezonu 1);
- zmieniło za to usposobienie modeli: więcej werdyktów wzrostowych, mniej słów niepewności, dłuższe i pewniejsze uzasadnienia — więcej pewności siebie bez pokrycia w skuteczności;
- ta sama operacja przesunęła wyrażaną pewność w przeciwnych kierunkach w dwóch rodzinach modeli — abliteracja nie jest skalpelem, tylko narzędziem o trudnych do przewidzenia skutkach ubocznych.
Dane i kod badania są publicznie dostępne (odnośniki w pracy); plan analizy został zarejestrowany przed uruchomieniem pomiaru.
Dyskusja na r/LocalLLaMA
Wpis o badaniu trafił na stronę główną r/LocalLLaMA — jednej z największych społeczności otwartych modeli językowych — gdzie zebrał kilkaset punktów, blisko sto komentarzy i ponad sto tysięcy wyświetleń. Z dyskusji wyszły kolejne hipotezy o mechanizmie zjawiska i pomysły na rozszerzenie pomiaru o inne rodziny modeli. Dziękujemy za tę rozmowę.
Związek z funduszem
To badanie nie powstałoby bez maszyny, która stoi za tym portalem: pakiety danych o spółkach — notowania, komunikaty, fundamenty, otoczenie makro — to ten sam warsztat, który co sobotę zasila analizy funduszu. Eksperyment sezonu 1 pokazał, że więcej danych nie daje modelom przewagi nad rynkiem; badanie pokazuje z kolei, że popularne modyfikacje modeli zmieniają ich zachowanie w sposób, którego użytkownicy się nie spodziewają. Oba wnioski płyną z tej samej infrastruktury pomiarowej — i to ona jest głównym produktem tego projektu.