Maszyna następnego słowa

To jest prawdziwy model językowy, tylko bardzo mały. Patrzy na kilka ostatnich słów, sprawdza w swoich zliczeniach, co po nich zwykle występowało, i losuje kolejne słowo z nierównymi szansami. Ta sama pętla, co w dużym modelu, tylko że tu widać każdy jej krok.

Przykłady z lekcji
Okno kontekstu
Wybór kandydata

Tekst, który już jest

Gdańskleżynad

Model patrzy tylko na podświetlone słowa. Reszty zdania w tej chwili nie bierze pod uwagę.

Co model pamięta z tekstów

Ciąg „leży nad” widział 1000 razy.

Lista kandydatów

  1. morzem710×71%
  2. Motławą180×18%
  3. Wisłą70×7,0%
  4. Bałtykiem38×3,8%
  5. stołem2×0,2%

Liczba przy słupku to udział w zliczeniach. Wyszarzonych model dziś nie bierze pod uwagę.

Losowanie

Model losuje liczbę od 0 do 1 i sprawdza, w czyje pole trafiła. Większe pole, większa szansa.

Dopisanie

jeszcze nic

Dopisane słowo wraca na początek jako część tekstu i wszystko liczy się od nowa.

Możesz wpisać cokolwiek. Jeśli model nigdy nie widział takiego ciągu, skróci okno i zacznie zgadywać - to też jest wynik.

Z czego model się nauczył

Zestaw z lekcji: „Gdańsk leży nad ___”. Liczby przy kandydatach wychodzą dokładnie takie, jak na tablicy. Policzone z 17 zdań, razem 5520 słów.

Zobacz wszystkie zdania korpusu
  • Gdańsk leży nad morzem.710×
  • Gdańsk leży nad Motławą.180×
  • Gdańsk leży nad Wisłą.70×
  • Gdańsk leży nad Bałtykiem.38×
  • Gdańsk leży nad stołem.2×
  • Nad morzem wieje mocny wiatr.12×
  • Nad morzem stoi stary żuraw.6×
  • Nad morzem jest latem tłok.5×
  • Motława płynie przez środek miasta.9×
  • Żuraw stoi nad Motławą od wieków.5×
  • Statek płynie po Motławie wolno i cicho.4×
  • Wisła wpada do morza pod Gdańskiem.7×
  • Gdańsk ma port, stare miasto i plażę.6×
  • Gdańsk to miasto nad Bałtykiem.5×
  • Nasza klasa pojechała nad morze na cały dzień.8×
  • W Gdańsku pada deszcz przez pół roku.3×
  • Port w Gdańsku pracuje przez całą noc.4×

Naucz model własnym zdaniem

Dopisane zdanie od razu wchodzi do zliczeń. Jedno zmieni rozkład ledwo zauważalnie, pięć podobnych zmieni go wyraźnie - tak samo działa uczenie dużego modelu.

Korpusy w narzędziu: Gdańsk, Szkolny tydzień, Bajka. Wszystkie leżą w kodzie platformy i widać je w całości powyżej - model nie ma żadnej innej wiedzy.

Czym to się różni od prawdziwego modelu?

Zgadza się mechanizm: kontekst, rozkład prawdopodobieństwa kolejnego kawałka, losowanie z nierównymi szansami, dopisanie i powtórzenie wszystkiego od nowa. Zgadza się też temperatura, która spłaszcza albo wyostrza rozkład, i to, że ten sam start daje dwa różne zdania.

Różnice są trzy. Duży model patrzy na tysiące ostatnich tokenów, a nie na trzy słowa. Pracuje na tokenach, czyli kawałkach słów (to jest obok: tokenizer). I zamiast tabeli zliczeń ma miliardy wag, które potrafią uogólniać na zdania, jakich nigdy nie widział. Nasz model tego nie umie: kiedy nie zna ciągu, skraca okno i zaczyna zgadywać, co widać na ekranie jako komunikat o skróceniu.

Czego nie ma ani tu, ani tam: kroku „sprawdź, czy to prawda”. Dlatego model potrafi napisać zdanie gramatyczne i całkiem nieprawdziwe.

Wszystko liczy się w Twojej przeglądarce - wpisany tekst i dopisane zdania nigdzie nie są wysyłane. Ustawienia i zapisane przebiegi zostają w pamięci tego urządzenia, żeby odświeżenie strony nie skasowało pracy w środku zajęć.