@andrzejdragan Cwiercfalowe jak u Walborna. Wirtualne pochłonięcia i reemisje będą tak samo w szkiełku, które prążki tylko przesuwa, i ćwierćfalówkach, które je kasują? Nie?
W innych eksperymentach (znaczniki polaryzacyjne, kwantowa gumka, interferometria atomowa) cząstka dolatuje do ekranu cała i zdrowa, a interferencja i tak znika, ale to już się nie zmieści na dziarce jak lagrangian QED
Sabine wrzuciła film, w którym pisze, że nawet fizycy źle rozumieją słynny kwantowy eksperyment z podwójną szczeliną. Ma zresztą rację, co udowodniła opisując, jak ona sama go rozumie. No i rzeczywiście nie do końca rozumie :)
To, czego najwyraźniej nie rozumie (w skrócie twiXterowym) pomiar fotonu nie „zmienia natychmiastowo funkcji falowej”, szczególnie tej drugiej, „niemierzonej”. Pomiar fotonu pochłania foton i tyle. Nie da się mierzyć fotonu bez niszczenia go (vide lagrangian QED). Zatem detektor po prostu blokuje jedną z dróg i nic dziwnego że pod jego wpływem znika efekt interferencji.
@andrzejdragan A płytka falowa za szczeliną? nic nie pochłania, a prążki znikają. Polaryzator pod 45 st je przywraca (więc koherencja nigdy nie zginęła). “Nowy foton” nie miałby czego
@LeszBuk@andrzejdragan@OlaGatner Nie możesz mieć obu na raz. Albo w kontekście są własne predykcje modelu i na prawo nie ma nic do maskowania albo jest co maskować i w kontekście siedzi korpus
@LeszBuk@andrzejdragan@OlaGatner Klasyfikator nie ma maski właśnie dlatego, że tam etykieta faktycznie pojawia się dopiero przy stracie. W llm-ach etykietą pozycji t jest wejście pozycji t+1, czyli ten sam tensor, tylko przesunięty o jeden
@LeszBuk@andrzejdragan@OlaGatner To ty mylisz trening z inferencją;) cały ground truth wchodzi naraz, maska ukrywa prawą stronę, a strata jest liczona pomiędzy logitami a etykietą. Gdyby model doklejał własne predykcje, to maska nie miałaby czego maskować (trening byłby sekwencyjny jak w rnn)
@LeszBuk@andrzejdragan@OlaGatner Realne implementacje długiego kontekstu to okna przesuwne z garstką tokenów globalnych, wzorce rzadkie, warstwy naprzemienne lokalne/globalne, ring attention itd większość par tokenów w tym oknie nigdy nie wchodzi ze sobą w żaden kontakt
@LeszBuk@andrzejdragan@OlaGatner Lol, nie. Model widzi ground truth, a nie własne predykcje. Nawet w inferencji prefiks zawiera prompt, którego model nigdy nie przewidywał
@andrzejdragan@LeszBuk@OlaGatner Skoro maska obcina wszystko po prawej, to token nie kształtuje się globalnie tylko na prefiksie. Globalność w sensie dwukierunkowym masz w enkoderach ale tam z kolei autoregresji nie ma w ogóle