Maszyna następnego słowa
To jest prawdziwy model językowy, tylko bardzo mały. Patrzy na kilka ostatnich słów, sprawdza w swoich zliczeniach, co po nich zwykle występowało, i losuje kolejne słowo z nierównymi szansami. Ta sama pętla, co w dużym modelu, tylko że tu widać każdy jej krok.
Tekst, który już jest
Gdańskleżynad
Model patrzy tylko na podświetlone słowa. Reszty zdania w tej chwili nie bierze pod uwagę.
Co model pamięta z tekstów
Ciąg „leży nad” widział 1000 razy.
Lista kandydatów
- morzem710×71%
- Motławą180×18%
- Wisłą70×7,0%
- Bałtykiem38×3,8%
- stołem2×0,2%
Liczba przy słupku to udział w zliczeniach. Wyszarzonych model dziś nie bierze pod uwagę.
Losowanie
Model losuje liczbę od 0 do 1 i sprawdza, w czyje pole trafiła. Większe pole, większa szansa.
Dopisanie
jeszcze nic
Dopisane słowo wraca na początek jako część tekstu i wszystko liczy się od nowa.
Możesz wpisać cokolwiek. Jeśli model nigdy nie widział takiego ciągu, skróci okno i zacznie zgadywać - to też jest wynik.
Z czego model się nauczył
Zestaw z lekcji: „Gdańsk leży nad ___”. Liczby przy kandydatach wychodzą dokładnie takie, jak na tablicy. Policzone z 17 zdań, razem 5520 słów.
Zobacz wszystkie zdania korpusu
- Gdańsk leży nad morzem.710×
- Gdańsk leży nad Motławą.180×
- Gdańsk leży nad Wisłą.70×
- Gdańsk leży nad Bałtykiem.38×
- Gdańsk leży nad stołem.2×
- Nad morzem wieje mocny wiatr.12×
- Nad morzem stoi stary żuraw.6×
- Nad morzem jest latem tłok.5×
- Motława płynie przez środek miasta.9×
- Żuraw stoi nad Motławą od wieków.5×
- Statek płynie po Motławie wolno i cicho.4×
- Wisła wpada do morza pod Gdańskiem.7×
- Gdańsk ma port, stare miasto i plażę.6×
- Gdańsk to miasto nad Bałtykiem.5×
- Nasza klasa pojechała nad morze na cały dzień.8×
- W Gdańsku pada deszcz przez pół roku.3×
- Port w Gdańsku pracuje przez całą noc.4×
Naucz model własnym zdaniem
Dopisane zdanie od razu wchodzi do zliczeń. Jedno zmieni rozkład ledwo zauważalnie, pięć podobnych zmieni go wyraźnie - tak samo działa uczenie dużego modelu.
Korpusy w narzędziu: Gdańsk, Szkolny tydzień, Bajka. Wszystkie leżą w kodzie platformy i widać je w całości powyżej - model nie ma żadnej innej wiedzy.
Czym to się różni od prawdziwego modelu?
Zgadza się mechanizm: kontekst, rozkład prawdopodobieństwa kolejnego kawałka, losowanie z nierównymi szansami, dopisanie i powtórzenie wszystkiego od nowa. Zgadza się też temperatura, która spłaszcza albo wyostrza rozkład, i to, że ten sam start daje dwa różne zdania.
Różnice są trzy. Duży model patrzy na tysiące ostatnich tokenów, a nie na trzy słowa. Pracuje na tokenach, czyli kawałkach słów (to jest obok: tokenizer). I zamiast tabeli zliczeń ma miliardy wag, które potrafią uogólniać na zdania, jakich nigdy nie widział. Nasz model tego nie umie: kiedy nie zna ciągu, skraca okno i zaczyna zgadywać, co widać na ekranie jako komunikat o skróceniu.
Czego nie ma ani tu, ani tam: kroku „sprawdź, czy to prawda”. Dlatego model potrafi napisać zdanie gramatyczne i całkiem nieprawdziwe.
Wszystko liczy się w Twojej przeglądarce - wpisany tekst i dopisane zdania nigdzie nie są wysyłane. Ustawienia i zapisane przebiegi zostają w pamięci tego urządzenia, żeby odświeżenie strony nie skasowało pracy w środku zajęć.