Token – często mniej niż słowo

Promptujemy swoje zapytania do sztucznej inteligencji. Patrzymy na odpowiedź, widzimy słowa, zdania, język, w którym złożyliśmy zapytanie. Wszystko pasuje, ale za tym kryją się nie słowa i język, tylko jednostki obliczeniowe nazywane tokenami.
Tokeny przekształcane w identyfikatory liczbowe i przekazywane do sztucznej sieci neuronowej.

Czas czytania artykułu

2–3 minut

Ale jak to?

Sztuczna inteligencja nie rozmawia z nami w sposób dosłowny odpowiadając nam na nasze pytania zgodnie z tym, co w tej chwili myśli. (Myśli?) To nie jest rozmowa, gdzie ktoś nas wysłuchuje i poproszony o wyrażenie opinii, dokładnie nam ją przedstawia budując zdania korzystając z wachlarza słów, które poznał, aby jak najlepiej opisać to, co chce wyrazić – bo przecież język jest bogaty w barwne określenia.

Rzeczywiście rozmowa płynie. Wymieniamy się poglądami. Z tym że z naszego ludzkiego mózgu płyną słowa z ciężarem lub lekkością znaczeń zbudowanych przez doświadczenie, a po drugiej stronie, tam w sztucznych sieciach neuronowych, ma miejsce poważna matematyka.

Ale zanim działania matematyczne się wydarzą, aby tworzyć ciąg słów, sieć musi mieć skądś te elementarne części, z których zbuduje później zdania, napisze wiersz czy książkę. I właśnie te elementarne części to tokeny.

Czym jest ów token?

Wyobraź sobie, że zanim zaczniesz czytać Tolkiena (a może Lewisa?) przecież musisz nauczyć się czytać pojedyncze słowa. Sylabizujesz. Tniesz te duże słowa na kawałki. Z samym i pójdzie Ci gładko, ale nieprawdopodobny będzie trudniejsze do ugryzienia.

Tu może być trochę podobnie. Token to może być całe słowo takie jak: pies, muzyka. Ale może być też częścią słowa. Wtedy jedno słowo może być zbudowane z kilku tokenów. Trochę jak z tymi sylabami. Masz to?

Tokenizer

Tylko jasna sprawa, że tokeny to nie są sylaby i nie musisz już teraz ciąć słowa nieprawdopodobny, aby wiedzieć, ile wyszło tokenów (no dobra, pociąłeś!).

To wróć. O liczbie tokenów w słowie zadecyduje tokenizer. Ale gratuluję Ci umiejętności sylabizowania.

Tokenizer to mechanizm, który dzieli tekst na tokeny zgodnie z określonym sposobem tokenizacji. No świetnie. To już naprawdę jest kolorowo. Ale spokojnie. Weźmy na przykład zdanie: To jest nieprawdopodobne!

Tokenizer ma swoje vocabulary (oczywiście, że znasz angielski i wiesz, że oznacza to słownictwo). To jest skończony zbiór tokenów, które dany tokenizer zna. To tak, jakby dany zaprogramowany tokenizer znał określoną liczbę sylab i nimi ciął słowa na odpowiednie kawałki, które zna. Ty już to widzisz i sylabizujesz, prawda?

I wiesz, nie na darmo użyłam słów: dany tokenizer, bo można tokenizery zaprogramować na różne sposoby, zatem nie ma jednego uniwersalnego katalogu tokenów. Zapamiętasz?

Vocabulary

Już doskonale wiesz, że to skończony zbiór wszystkich tokenów, którymi dany tokenizer może się posługiwać. Token nie musi być słowem. Jego elementami mogą być różnego rodzaju fragmenty tekstu. Zatem vocabulary może zawierać jednostki odpowiadające całym słowom, fragmentom słów, znakom interpunkcyjnym, fragmentom zawierającym spację oraz innym jednostkom zależnym od konstrukcji tokenizera.

Ty rozumiesz vocabulary jako słownictwo, ale dla tokenizera to po prostu zamknięty zbiór tokenów. Tych jego własnych. Tych, które zna, zamknięte w pudle. Gdy pracuje z tekstem i nie ma całego słowa wśród swoich tokenów, potnie je na mniejsze dostępne sobie tokeny. Tylko te znajdujące się w tym własnym pudle.

Co z tym zamkniętym pudłem?

Każdy token znajdujący się w vocabulary (owe pudło) ma przypisany własny numer identyfikacyjny. Zatem słowo muzyka może mieć numer 528. Sieć neuronowa nie pracuje ze słowem muzyka, tylko z przypisanym jego tokenowi identyfikatorem, czyli token ID. Dla przykładu wyobraźmy sobie, że zdanie:

To jest nieprawdopodobne! może być podzielone na tokeny:

To / jest / nie / prawdopodobne / !

i mieć takie identyfikatory:

51 / 208 / 1037 / 402 / 14.

I to ta sekwencja identyfikatorów jest przekazywana dalej do sieci neuronowej. A co ona z tym robi, zadecydują embeddingi. Ale to już historia na inną opowieść.

Autor: Magdalena Siatkowska

Budujmy razem Twoją edukację

Edukacja oparta na neurobiologii to nie nowoczesny styl nauczania, ale naturalny sposób rozwoju i przyjmowania wiedzy, zgodny z tym jak działa nasz mózg.

Adres e-mail
Numer telefonu