REKLAMA

Mamy nową broń w walce z maszynami. Za samą ideę już ją kocham

Nowa czcionka robi z konia ziemniaka. Internet właśnie dostał nowe narzędzie w walce z scraperami AI. Pomogła wiedza naszych dziadków.

czcionka ligatura scrapery AI

Projekt nazywa się ShieldFont, a jego twórcy - Isaque Seneda i Gabriel Abrucio - twierdzą, że to „praktyczny opt-out z nieautoryzowanego treningu AI”. W praktyce działa to tak, że ludzie widzą normalny tekst, a scraper dostaje coś, co wygląda jak sensowny tekst, ale semantycznie jest kompletną bzdurą.

Mechanizm jest prosty, ale diabelnie sprytny. ShieldFont wykorzystuje ligatury do podmiany całych słów na inne - podobne gramatycznie, ale kompletnie niepasujące do kontekstu. W efekcie człowiek widzi poprawny tekst, bo zamiana odbywa się dopiero na etapie renderowania strony. Natomiast scraper, który pobiera surowy HTML, dostaje wersję „skażoną”.

Czytaj też:

Twórcy przez trzy miesiące dopracowywali słownik takich zamienników i skończyli z listą prawie 12 tys. słów, które mogą zostać podmienione. Co więcej, każde z nich ma trzy różne możliwe zamienniki, a autor strony może mieszać je nawet między akapitami.

Proste ligatury można zademonstrować bez żadnego kombinowania z SheldFontem. Oto przykład. Poniżej lista z dwoma wpisami. Włączcie proszę precyzyjne zaznaczanie na swoim urządzeniu.

  • fi

Jeżeli nie macie ustawionej jakiejś bardzo nietypowej czcionki w przeglądarce, to powyższe oba wpisy na liście dla waszego oka nie różnią się niczym. A teraz zaznaczcie oba, najpierw jedno, potem drugie. Pierwszy to dwie literki, "f" i "i". Drugi to symbol "fi" z tablicy znaków. Pojedynczy znak. Idąc dalej można dojść do... czegoś takiego:

Zabawa czcionkami pozwala ukrywać słowa w słowach

To działa, algorytmy głupieją

Statystyki robią wrażenie:

  • średnio 24,5 proc. wszystkich słów na stronie zostaje podmienionych,
  • w przypadku „content words” - czyli słów niosących faktyczną treść - to już 45,8 proc.,
  • w zależności od tekstu, 31-56 proc. sensu zostaje skutecznie „zniszczone”.

W testach na sześciu popularnych pipeline’ach scrapingowych ShieldFont sprawił, że ponad 90 proc. stron zostało odrzuconych przez filtry jakości. A z tych, które przeszły, około 20 proc. słów to tzw. „training-time garbage”: poprawna językowo treść, który nie niesie żadnej prawdy.

Po lewej tekst widziany przez czytelnika. Po prawej to, co naprawdę jest napisane (sprytnie ukryte przez zabawę czcionkami i ligaturami)

To oznacza jedno: scraper albo nie dostaje nic, albo dostaje śmieci. W obu przypadkach wygrywa autor strony.

Oczywiście, że da się to obejść. Ale będzie boleć

Twórcy ShieldFont nie udają, że stworzyli magiczną tarczę. Każdy tekst, który da się przeczytać, da się też zinterpretować przez AI - wystarczy wyrenderować stronę jak przeglądarka i użyć OCR. Problem w tym, że scraperzy działający na masową skalę nie robią tego, bo to kosztuje.

Według autorów takie „pełne renderowanie” jest od 5 do 13 razy droższe niż zwykłe pobranie HTML-a. A jeśli mówimy o miliardach stron to robi się z tego koszt, który może zniechęcić nawet największych graczy. ShieldFont nie ma więc zatrzymać AI. Ma sprawić, że nieopłacalne stanie się bezmyślne, masowe zbieranie treści bez zgody autorów.

Jest haczyk: ludzie też mogą oberwać rykoszetem

Niestety poza AI w Internecie rządzą jeszcze inne algorytmy od Big Techów, na których zmuszeni są polegać twórcy. Chodzi o wyszukiwarki internetowe (pozycjonowanie SEO) i media społecznościowe. W przypadku zastosowania ShieldfFonta:

  • wyszukiwarki mogą mieć problem z indeksowaniem,
  • tłumaczenia maszynowe mogą się wykładać,
  • screen readery mogą czytać bzdury, co szczególnie byłoby bolesne,
  •  kopiowanie tekstu z takiej strony może dać efekt „co ja właśnie wkleiłem?”.

To nie jest więc rozwiązanie dla każdego. Raczej dla tych, którzy mają dość tego, że ich treści lądują w datasetach bez pytania o zgodę.

Bycie widocznym w sieci nie oznacza zgody na wykorzystanie treści do treningu modeli.

ShieldFont jest próbą technicznego wymuszenia tego, by scraperzy musieli się bardziej postarać. Twórcy zachęcają innych do eksperymentów. Im więcej takich metod pojawi się w sieci, tym trudniej będzie scraperom stworzyć uniwersalny sposób obejścia. Możliwe więc, że ShieldFont nie jest końcem historii, ale jej początkiem.

W ostatnich latach widzieliśmy już blokady crawlerów, pozwy, nowe licencje, a nawet całe serwisy zamykające się przed AI. ShieldFont wpisuje się w ten trend, ale robi to w sposób wyjątkowo kreatywny. Czy to wystarczy, by zatrzymać gigantów AI? Oczywiście, że nie. Ale może samo to ich spowolnienie wystarczy, by przypomnieć im, że Internet nie jest darmową kopalnią danych.

Maciej Gajewski
Redaktor

Redaktor Spider's Web - ekspert w tematykach Microsoftu i RTV. Lubi oglądać się zarówno za siebie – wspominając przełomowe dokonania w informatyce – jak i przed siebie, będąc nieustannie ciekawym tego, co będzie dalej. Jego zainteresowania to przede wszystkim software: UI/UX, algorytmy, uczenie maszynowe, chmura czy sztuczna inteligencja. Nic dziwnego, że jako specjalizację obrał sobie pilnowanie firmy Microsoft. Uwielbia też sztukę gier i kina, przez co wyrósł na pasjonata sprzętu RTV – a i o technologii wspomnianych gier i filmów ma wiele ciekawego do opowiedzenia. Jego pierwsza obecność w mediach dotyczyła muzyki – współtworzył Overkill.pl. Ciąg dalszy jego rozwoju dotyczył już tylko nowych technologii. Zanim dołączył do zespołu Spider’s Web przez lata współtworzył CHIP.pl i Magazyn CHIP.