Tokenizer
Model nie widzi liter ani słów - widzi tokeny, czyli kawałki tekstu. Wpisz zdanie po polsku i to samo po angielsku, a potem porównaj, ile kawałków wyszło.
… tokenów · 0 słów
… tokenów · 0 słów
Ty widzisz: 9 liter „a”. Model widzi: 0 klocki, z czego 0 zawierają tę literę w środku. Do środka klocka model nie zagląda, więc liczenie liter to dla niego zgadywanie.
Jak działa ten tokenizer?
Model nie czyta całych słów - najpierw tnie tekst na tokeny, korzystając z gotowego słownika kawałków, tego samego typu, jakiego używają prawdziwe modele (o200k_base dla nowszych, cl100k_base dla starszych). Wpisany tekst dzielimy dokładnie tym algorytmem, osobno dla polskiego i angielskiego zdania, i liczymy, ile tokenów wyszło z każdego. Stosunek tych dwóch liczb pokazuje, o ile droższy jest tekst po polsku. Cały podział liczy się lokalnie w Twojej przeglądarce - nic nie jest wysyłane na żaden serwer.
Wszystko liczy się w Twojej przeglądarce - wpisany tekst nie wychodzi na żaden serwer. Zostaje w pamięci tej przeglądarki, żeby odświeżenie strony nie skasowało pracy w środku zajęć; przycisk „Wyczyść” usuwa go z powrotem. Podział pochodzi z tokenizera modeli OpenAI; inne modele tną trochę inaczej, ale zasada jest ta sama.