Z przyjemnością wysłuchałem dzisiaj rozmowy 3 profesorów: Piotra Sankowskiego, Andrzeja Dragana i Aleksandra Mądrego.
Jeden z ciekawszych wątków rozmowy dotyczył faktu, że OpenAI, oraz inne firmy będące na czele peletonu AI, przestały w ostatnich latach publikować artykuły na temat postępów w rozwoju architektury sieci neuronowych. OpenAI rozpoczęło wyścig, w którym każdy chroni własne know-how. Andrzej Dragan wyraził opinię, że OpenAI wykorzystało wcześniejszą pracę naukowców Google, a następnie zamknęło dostęp do własnych badań, które przecież mogą być bardzo istotne dla ludzkości. Faktycznie, architektura sieci neuronowych, które nazywamy Transformerami, została w dużej mierze przedstawiona w słynnym artykule “Attention is all you need” napisanym przez naukowców z Google. Jednak historia jest bardziej skomplikowana.
Wielu specjalistów od uczenia maszynowego uważa, że tak zwany mechanizm atencji (to nazwa wyspecjalizowanych warstw w sieciach neuronowych, specyficznych właśnie dla Transformerów) po raz pierwszy został opracowany w artykule o 2 lata młodszym od Attention is All You Need. Artykuł nosił tytuł Neural Machine Translation by Jointly Learning to Align and Translate. Jednym z jego autorów był Yoshua Bengio, jeden z 3 intelektualnych ojców uczenia głębokiego. Badacze z Google w swoim artykule odsyłają zresztą do tego wcześniejszego o 2 lata artykułu, gdy opisują mechanizm atencji. Faktycznie Bengio wraz z Dzmitry Bahdanau i KyungHyun Cho nie używają terminu “atencja”. Mówią o mechanizmie dopasowania (ang. “aligment”).
Słynna grafika z ich artykułu przedstawia francuskie zdania tłumaczone maszynowo na zdania angielskie i ich, dzisiaj powiedzielibyśmy, macierze atencji (kiedyś postaram się przybliżyć wam, czym jest atencja):
Stało się tak, że Attention is All You Need jest obecnie uważany za artykuł rewolucyjny, jeżeli chodzi o maszynowe przetwarzanie języka naturalnego. Autorzy zrezygnowali w nim całkowicie z architektury rekurencyjnej na rzecz stosów warstw jednokierunkowych i atencji. W tym artykule o 2 lata wcześniejszym architektura była hybrydowa i RNN też tam było. Jednak to nie jest takie oczywiste, że to Google zawdzięczamy Transformery, to był raczej szereg koncepcji krążących wśród badaczy. W każdym razie z Attention is All You Need pochodzi najsłynniejsza grafika w uczeniu maszynowym, przedstawiająca architekturę Transformera Encoder-Decoder:
Bardzo szybko zdano sobie sprawę, że encoder (lewy blok) i decoder (prawy blok) mogą być niezależne — że przy pomocy tylko połowy tej pierwotnej architektury możemy budować bardzo ciekawe modele. Lata 2018-2020 to dominacja Transformerów będących Encoderami. Słynna rodzina modeli, której pierwszy przedstawiciel pochodził z Google i nazwał się “Bert”. Berty nie mają zdolności generowania języka, ale przy ich pomocy, gdy wyposażymy je w odpowiednie głowice z dodatkowymi warstwami, potrafią robić bardzo dużo pożytecznych rzeczy, na przykład klasyfikować tekst. OpenAI poszło trochę pod prąd i skupiło się na Transformerach Decoderach. W roku 2019 wytrenowali model GPT-2, który dla wielu badaczy był przełomowym momentem (a pamiętajmy, że GPT-2 był dużo, dużo, dużo słabszy od współczesnych modeli). Andrej Karpathy powiedział, że to właśnie w czasie lektury artykułu na temat GPT-2 (tak wtedy jeszcze OpenAI publikowało takie rzeczy) uświadomił sobie, że potrzebna jest po prostu większa skala, że pompowanie modelu i zbioru treningowego są właściwą drogą. Wówczas wielu się z tego śmiało. W roku 2020 OpenAI wytrenowało GPT-3, no a potem model GPT-3.5, który pokazali całemu światu i jesteśmy tu, gdzie jesteśmy.
Zgadzam się z profesorem Aleksandrem Mądrym, że patenty to bardzo śliska sprawa jeżeli chodzi o algorytmy i architektury sieci. Formalnie — mało kto o tym wie — Google posiada patent na architekturę sieci przedstawioną w Attention is All You Need. Z tego, co mi wiadomo, nigdy nie skorzystało z możliwości skarżenia kogokolwiek. Byłoby to bardzo trudne, bo wystarczy drobna zmiana wobec pierwotnej architektury neuronowej i prawnicy mogą podważyć zasadność takiego pozwu.
Faktycznie, jak mówi Andrzej Dragan, obecnie badania są o wiele bardziej zamknięte i w zasadzie nic nie wiadomo na temat tego, co się dzieje za murami OpenAI, Google itd. Ale historia przepływu idei pomiędzy Google i OpenAI jest dość złożona, bo Transformer to była pewna koncepcja, zgodnie z którą w sieci powinien nastąpić “moment komunikacji” pomiędzy informacjami w niej płynącymi, informacja a, mówi do informacji b: hej ja mam w sobie takie wagi, a jakie ty masz, może razem się jakoś dostroimy. Koncepcja okazała się rewolucyjna, a dzisiaj wszyscy liczący się gracze trenują swoje Transformery Decodery.
Poland falls to Sweden 5-1. What an effort by Poland today.
Lyszczarczyk 1G
Zabolotny 33 SVS
Poland is off tomorrow but plays France on Tuesday in one of their biggest tournament games.
Przegrywamy 4:5 po dogrywce z medalistami ostatnich MŚ Elity. Przez większość meczu prowadziliśmy, wspaniały występ Hokejowych Orłów, mamy też ważny punkt, a przede wszystkim PRZEKONANIE że możemy tu grać i wygrywać! BRAWO 👏👏👏