Tokenizer

Model nie widzi liter ani słów - widzi tokeny, czyli kawałki tekstu. Wpisz zdanie po polsku i to samo po angielsku, a potem porównaj, ile kawałków wyszło.

Przykłady z lekcji

… tokenów · 0 słów

… tokenów · 0 słów

Ty widzisz: 9 liter „a”. Model widzi: 0 klocki, z czego 0 zawierają tę literę w środku. Do środka klocka model nie zagląda, więc liczenie liter to dla niego zgadywanie.

Jak działa ten tokenizer?

Model nie czyta całych słów - najpierw tnie tekst na tokeny, korzystając z gotowego słownika kawałków, tego samego typu, jakiego używają prawdziwe modele (o200k_base dla nowszych, cl100k_base dla starszych). Wpisany tekst dzielimy dokładnie tym algorytmem, osobno dla polskiego i angielskiego zdania, i liczymy, ile tokenów wyszło z każdego. Stosunek tych dwóch liczb pokazuje, o ile droższy jest tekst po polsku. Cały podział liczy się lokalnie w Twojej przeglądarce - nic nie jest wysyłane na żaden serwer.

Wszystko liczy się w Twojej przeglądarce - wpisany tekst nie wychodzi na żaden serwer. Zostaje w pamięci tej przeglądarki, żeby odświeżenie strony nie skasowało pracy w środku zajęć; przycisk „Wyczyść” usuwa go z powrotem. Podział pochodzi z tokenizera modeli OpenAI; inne modele tną trochę inaczej, ale zasada jest ta sama.

Tokenizer - AI Lab