Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.
Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.

didaskalia · @didaskaliaWP
Where viewers went back to watch this video again, from YouTube's public Most replayed graph, lined up with what was said at that moment.
Most replayed moment #1
3:1613.7x the video's typical replay level
inteligencji, żeby nie mówić jak jest, tym bardziej, że są mądrzejsi ode mnie, którzy się na tym lepiej znają, tylko chciałem trochę dowiedzieć się jak jest, robiąc różne eksperymenty, analizując różne wyobrażenia na ten temat i testując to po prostu. I tu jest taki zbiór nie tyle przemyśleń, bo te
Said at 3:09
Most replayed moment #2
9:497.9x the video's typical replay level
to się nagle okazuje, że że te siły się nie równoważą i elektron zaczyna działać sam na siebie siłą oddziaływania wzajemnego różnych kawałków ładunków elektrycznych, które są na nim zgromadzone w takim modelu, gdyby to była kulka. No i teraz ludzie patrzyli patrzyć jaka to jest siła. No i ta siła
Said at 9:43
Most replayed moment #3
44:113.6x the video's typical replay level
bardziej konsekwencja inteligencji. To >> no właśnie tak. >> Ten ta definicja nie mówi, co się dzieje na poziomie kognitywnym w moim mózgu, że on jest w stanie się adaptować. To jest objaw inteligencji. To jest konsekwent. Więc pytanie, co jest źródłem, >> co jest wcześniej jakm. >> No i y na poziomie nieco niższym,
Said at 44:03
The graph counts replays. It does not show where viewers stopped watching.
Words
18,634
Runtime
2:43:37
Speaking pace
114wpm
Reading time
78min
114 words per minute, below the 160 25th percentile of 349 measured videos. That distribution comes from the 349-video hook study.
Opening (first 30 seconds)
Fizycy się trochę wyleczyli z takiej choroby, że my już wszystko wiemy. Nauką empiryczną się ludzie zajednia na poważnie 400 lat temu. Ja bym był w ciężkim szoku, gdybyśmy przez 400 lat odkryli cokolwiek, co jest fundamentalnie prawdziwe. Patrzę na odległą gwiazdę i ona świeci, ale wiem, że to światło dociera do mnie z dużym opóźnieniem. Ale
57 words, the words spoken in the first 30 seconds at 114 words per minute.
Free, no signup. See how the first 30 seconds hold attention, with rewrites.
Sentence shape
| Measure | This transcript |
|---|---|
| Sentences | 877 |
| Average words per sentence | 21.2 |
| Longest sentence | 171 words |
| Questions asked | 54 |
| Sentences containing a number | 67 |
Most used terms
Filler phrases
1 in total: um 1.
A literal whole-word count of the same phrase list the Prepublish browser extension uses, so a phrase inside another word is not counted and a phrase used in its ordinary sense still is. It is a count and not a judgement.
Run the check on the words above: where attention is likely to drop, with a rewrite for each weak line. The free check shows the scores and the one issue costing the most.
What this transcript is
Every word below is the caption track YouTube publishes for this video, pulled from the video itself and reproduced unchanged. It is not Prepublish's writing, not a summary, and not a re-transcription: it is the video's own published captions. Polish captions, generated automatically by YouTube, in the video’s original language. Source: the video on YouTube. A channel that would rather this page did not exist can ask for its removal through the contact page, and it is removed.
Fizycy się trochę wyleczyli z takiej choroby, że my już wszystko wiemy. Nauką empiryczną się ludzie zajednia na poważnie 400 lat temu. Ja bym był w ciężkim szoku, gdybyśmy przez 400 lat odkryli cokolwiek, co jest fundamentalnie prawdziwe. Patrzę na odległą gwiazdę i ona świeci, ale wiem, że to światło dociera do mnie z dużym opóźnieniem. Ale w zasadzie jak to uzasadnić, że to światło dociera z opóźnieniem, a nie z przyspieszeniem?
A w zasadzie dlaczego ta gwiazda nie zaburza mojej przeszłości, a moją przyszłość? Najlepszym predktorem przyszłości, czyli najlepszym sposobem na przewidywanie co się wydarzy jest posługiwanie się teorią, która najlepiej opisuje moje dotychczasowe obserwacje [muzyka] i jest najprostsza. >> Wszyscy wiemy, że że te modele potrafią robić coś fajnego, jak się jak mają szczęście, ale też robią często błędy. Te błędy dostarczają odpowiedzi, czy te modele recytują, czy one rozumują, czy rzeczywiście są papugi, czy też [muzyka] one są zdolne do kreatywności.
Nigdy ścieć neuronowa nie będzie niczym więcej niż tylko funkcją, tylko matematyką. To jest prawda. No tylko co z tego? A co nie jest matematyką? Dzień dobry. Patrycjusz Wyżga. Witam i zapraszam na Didasia. To niezwykla niezwykła przyjemność gościć jednego z moich ulubionych dotychczasowych gości w programie Lidali, ale też jednego z państwa ulubionych. Co do tego nie mam żadnych wątpliwości. Andrzej Dragan. Dzień dobry. >> Cześć.
Co? Pan profesor Andrzej Dragan jest fizykiem z Uniwersytetu Warszawskiego i autorem najnowszej książki. Proszę państwa, jak ty czytasz ten tytuł? Kwowadis. Kwowajis. >> Ja go wolę nie czytać. Kwowajis chyba. >> Dokąd zmierza sztuczna inteligencja? Proszę państwa, jest takie wydanie czarne w okładce miękkiej jest i takie zielone ze złotymi w twardej oprawie. Najnowsza książka, w której po prostu zbierasz w jednym miejscu różne przemyślenia dotyczące sztucznej inteligencji.
Próbujesz to to opowiedzieć, próbujesz także poprognozować, ale jest też dużo jak to u Dragana, proszę państwa, kto czytał fantechizm, ten doskonale wie. Autor trochę z przekąsem pisze o tym, że to książka złupa, ale tak naprawdę, bo różne rzeczy tam powrzucane, różne przemyślenia na różne tematy, w większości na na tematy i zagadnienia, który w których autor nie jest kompetentny, jak sam sugeruje, chociaż zawsze to jest niezwykle smakowite danie.
Zawsze to jest smakowita zupufa. >> Czy tobie też jest tak, że kwantechizm był pisany z myślą o czytelniku, który niespecjalnie szanuje autorytety. I ja celowo tą książkę podbiłem jej trochę poziom trudności, dlatego że standardowa książka popularnaukowa to ujaśnia jak jest i ktoś to mówi, ktoś jest ekspertem i i generalnie trzeba go słuchać i nie ma nie ma wyjścia, no bo co biedny czytelnik ma zrobić. Natomiast chodziło mi o to, żeby w kwantizmie tego nie było, żeby pokazać różne eksperymenty myślowe i nie mówić na przykład, że czarna dziura to jest to czy to i koniec, tylko dlaczego sądzimy, że na przykład w pobliżu horyzontu zdarzeń czas się zatrzymuje i tak dalej.
Chodziło mi to, żeby pokazać skąd się wzięły te wyobrażenia nasze w naszych głowach, żeby nikt nie musiał nam wierzyć, tylko żeby można to było prześledzić i samemu ocenić. I trochę też w podobny sposób chciałem skonstruować tą książkę o o sztucznej inteligencji, żeby nie mówić jak jest, tym bardziej, że są mądrzejsi ode mnie, którzy się na tym lepiej znają, tylko chciałem trochę dowiedzieć się jak jest, robiąc różne eksperymenty, analizując różne wyobrażenia na ten temat i testując to po prostu.
I tu jest taki zbiór nie tyle przemyśleń, bo te przemyślenia to są mało warartościowe, raczej zbiór yyy yyy yyy faktów i yyy i testów i i eksperymentów myślowych i prawdziwych zaszczą inteligencją, żeby sprawdzić po prostu czym ona jest, czym ona nie jest i tak dalej. >> No takie bonus operandi naukowca, który który eksperymentuje i który trzyma się faktów. To jest przede wszystkim świetna zabawa, proszę państwa, świetna frajda lektura tej książki. serdecznie polecam, no bo mnóstwo niezwykłych w jego stylu, w takim draganowym stylu różnych powiedzonek, różnych, różnych sentencji, różnych sposobów upraszczania rzeczywistości.
No jest efekt Dragana w fotografii. Wygląda na to, że jest także w literaturze coś coś w rodzaju >> nie nie no nie strasz >> sznytu sznytu Dragana. Jest też trochę oczywiście o nauze, no bo pisze profesor także o tym, czym się zajmuje. Piszesz na przykład tak na 126. Niektórym się zdaje, że nauka to prawienie mądrości. Elektron to przecież fermion diraka, charakteryzowany nieprzewidywalną reprezentacją spinorową grupy Płonkarego.
Tyle że tylko że >> nieprzywiedlną nawet tego się nie da przeczytać po ludzku. >> Tak. Tylko, że tylko że nauka nie polega na używaniu siedmioslabowych wyrazów. Pisze dalej: "Wymyślamy sobie mądre słowa, żeby nazwać mało zrozumiałe zjawiska. Dlatego im więcej ktoś takich słów używa, tym mniej rozumie o czym mówi. Nauka polega na rozumieniu, a nie na nazywaniu." >> No właśnie. I to jest interesujące, że fizycy się trochę wyleczyli z takiej choroby, że my już wszystko wiemy y o rzeczywistości. tak na tą chorobę chorowano dosyć powszechnie pod koniec XIX wieku i no w zasadzie co tu jest do rozumienia elektron to przecież wiemy co to jest opisujemy to teorią mamy równania koniec dyskusji.
No to nie nie do końca tak jest i fizyce mają trochę inne wyobrażenie na temat tego, co to znaczy rozumieć bo my rzeczywiście mamy elektron opisywany różnymi teoriami. Na przykład klasyczna XIXwieczna teoria Maxwella, to jest zbiór równań opisujących ładunki elektryczne, pola, które wytwarzają jak to wszystko oddziałuje. Prąd elektryczny, silniki elektryczne, wszystko działa w oparciu o tą teorię. Ale bądźmy trochę bardziej krytyczni.
Elektron to w tej teorii jest jakiś taki ładunek elementarny. Y, cząstka, która ma nie ma żadnego rozmiaru. Y, w teorii kwantowej ona jest punktowa. W teorii klasycznej nie wiemy, czym jest. Może to jest kulka o skończonych rozmiarach, może, może nieskończenie mały, nie wiadomo. Ale z tym pojęciem jest dużo problemów, bo taki ładunek elektryczny wytwarza wokół siebie pole elektryczne. I teraz mógłbyś zapytać, co to jest pole elektryczne i odpowiedź jest, nie wiem, co to jest, ale wiem jakim równaniem to się, jakim to się, jaką teorią się to opisuje, jakim równaniom to podlega, jak się zmienia, ale co tu jest jakaś własność przestrzeni wokół ładunku elektrycznego.
Wiemy też, że to pole elektryczne niesie ze sobą energię. To znaczy wokół tego ładunku elektrycznego w tym polu jest zgromadzona energia. I teraz jak chcemy taki ładunek przesunąć z miejsca na miejsce, to przesuwamy nie tylko ładunek, ale to pole, które jest do niego przyklejone, które podróżuje razem z nim. I ponieważ to pole ma peą energię, to energia też łączy się z masą. I w związku z tym efektywnie ten naładowana cząstka ma pewną dodatkową masę wynikającą z istnienia tego pola wokół.
Czyli jakbym miał taki sam elektron tylko bez ładunku, to on wydawałby mi się lżejszy niż taki, który jest naładowany, bo on jeszcze ma dodatkowy ciężar związany z tym, że wokół jest to całe pole. No teraz zastanówmy się, ile tego ciężaru jest dodatkowego. To się mądrze nazywa masa elektromagnetyczna. Yyy, no okazuje się, że jak się zaczyna liczyć ile tego ładunku, ile tej masy jest, to jej jest całkiem sporo. I jest nawet taka hipoteza, yyy, to może w ogóle nie ma żadnej innej masy w elektronie poza tą masą elektromagnetyczną, że wszystko co odczuwamy jako ciężar elektronu to jest tylko ta masa, która jest w polu elektromagnetycznym na zewnątrz ładunku.
No i gdyby tak było, to by znaczyło, że ten elektron musiał mieć bardzo konkretny rozmiar. Dlatego, że jak się zbliżamy do elektronu, to to pole wzrasta, więc gęstość tej energii wzrasta. Im mniejszy elektron, tym efektywnie musiała być większa jego masa, bo tego pola byłoby coraz więcej, coraz bliżej. I okazuje się, że jak gdyby cała masa elektronu miała być tą masą elektromagnetyczną, to jego rozmiar by był rzędu 10 do-15 m. wydaje się mało, ale to jest tak naprawdę w skalach kwantowych bardzo, bardzo dużo i wiemy z całą pewnością, że elektron jest jeżeli ma skończony rozmiar, to jest na pewno dużo mniejszy niż te 10 do-1 met.
Nie wiemy dokładnie nic na ten temat ile to tam ten rozmiar miały być, bo w teorii kwantowej w ogóle nie widzimy jakiegokolwiek rozmiaru. On jest wydaje się zerowy, ale wiemy na pewno, że jest mniejszy niż ta mas, ten p promień, który by był niezbędny, żeby cała masa była masą elektromagnetyczną. I teraz co z tego wynika? No wynika z tego, że masa elektromagnetyczna tylko to jest na pewno więcej niż cała masa elektronu.
Więc co to w ogóle znaczy? To znaczy, że w środku jest jakaś ujemna masa. Y i jak to w ogóle zrozumieć? Nie ma na to odpowiedzi. Y gdyby rozmiar elektron był zerowy, to ta masa byłaby nieskończona. Jeszcze gorzej, bo wtedy mielibyśmy nieskończnie małą cząskę, która jest nieskończnie ciężka. I ludzie próbowali sobie z tym jakoś poradzić z tym, z tym problemem w elektromagnetyzmie. To robił Lawrence i inni. Potem to robił Paul Dirak, chyba najwybitniejszy albo jeden z najwybitniejszych fizików z XX wieku.
I Dirak miał bardzo interesujący pomysł jak częściowo ten problem rozwiązać i on analizował takie pytanie, które wcześniej stawiał przed nim Lawrence. Jak to jest z popychaniem elektronu? Jak go popycham, to co stawia opór? Bo ten opór przy popychaniu, to się nazywa bezwładność, nie? Jak na przykład popycham coś ciężkiego, to jest trudno, jak popcham coś lekkiego, to jest to jest łatwo. Ta bezwładność, skąd ona się w ogóle bierze?
No on sobie wyobraził, że że elektron to jest taka kulka o skończonych rozmiarach i i ta kulka ma jakieś jakoś rozłożony ładunek elektryczny na swojej powierzchni i ten ładunek jest jakoś tam utrzymywany na tej powierzchni i ale ponieważ ładunki się odpychają tych samych znaków to ten ładunek sam na siebie działa różnymi siłami. Ten kawałek elektronu działa na ten kawałek i one się wzajemnie odpychają i normalnie w normalnych warunkach te siły się kasują i ładunek nie działa sam na siebie żadną siłą.
No bo ta ta siła jaką ten kawałek działa na ten, jest dokładnie przeciwna. co ta te ta siła odwrotną. No więc wszystko jest niby dobrze, ale jakbym popchnął ten ładunek, to się nagle okazuje, że że te siły się nie równoważą i elektron zaczyna działać sam na siebie siłą oddziaływania wzajemnego różnych kawałków ładunków elektrycznych, które są na nim zgromadzone w takim modelu, gdyby to była kulka. No i teraz ludzie patrzyli patrzyć jaka to jest siła.
No i ta siła się okazuje bardzo dziwna. W szczególności jak się napisze równanie ruchu, jak ta siła elektronu, którą działa sam na siebie działa, to się okazuje, że ta siła powoduje, że elektron jak tylko go ktoś trochę przesunie, on zacznie przyspieszać jeszcze bardziej i jeszcze bardziej i zacznie się rozpędzać do nieskończoności. Znaczy do do prędkości światła, ale ale jego energia będzie do nieskończoności. Czyli sensownie brzmiący model elektronu powoduje, że dochodzimy do wniosku, że po pierwsze gdyby eton był nieskończonie mały, to był nieskończnie ciężki, to jest kłopot, ale jak miał skończone rozmiary z kolei, to by się okazało, że działając sam na siebie siłami by się przyspieszał i nie wiadomo skąd energia by się miała w ogóle brać.
Dirak w rozpaczy, żeby ten problem rozwiązać, przyjął bardzo dziwną hipotezę, że trzeba trochę poważniej potraktować Maxwela niż to wcześniej robiono. Równanie Maxa, czyli równanie opisujące fizykę elektromagnetyzmu. No bo równanie Maxelo to jest zbiór równań psujących jak się zmienia pola elektryczne, magnetyczne i one mają taką ciekawą własność, że one są odwracalne w czasie, że jak zamienię kierunek upływu czasu na przeciwny, to są tekstem równania.
Fizyka do przodu i do tyłu w czasie jest taka sama. W ogóle się nie zmienia. Teraz tak, z drugiej strony wiemy, że jak mam ładunek i nim poruszę, to to powoduje, że się rozchodzi fala elektromagnetyczna i dopiero za jakiś czas zaburzy jakiś odległy punkt, który jest gdzieś dalej. Dopiero o tym ruchu ktoś odległy dowie się z jakimś opóźnieniem, no bo fala potrzebuje czasu, żeby się tam dostać. Ten efekt to się nazywa efekt retardowania i takie potencjały pól elektromagnetycznych. rozuren są tak zwane potencjały retardowane ale direk powiedział przecież nie ma żadnego powodu, żeby mówić że elektron zaburza przyszłość jakiegoś odległego punktu w tym momencie a nie przeszłość no bo przecież równania są symetryczne w czasie i na przykład jak się patrzy tylko na równania Maxuela, które są odwracalne w czasie i zada pytanie patrzę na odległą gwiazdę i ona świeci ale wiem że to światło dociera do mnie z dużym opóźnieniem że nawet niektórzy mówią że tej gwiazdy dawno nie istnieje bo mogła ju się dawno wypalić, bo tyle czasu zaj zajęło dotarcie światła do do mojego oka, ale w zasadzie jak to uzasadnić, że to światło dociera z opóźnieniem, a nie z przyspieszeniem.
Czyli na przykład jak powiedzieć, że a w zasadzie dlaczego ta gwiazda nie zaburza mojej przeszłości, a moją przyszłość? Dlaczego to ta prowokacja światła nie idzie w czasie? Przecież równania taką możliwość jak najbardziej dopuszczają. Yyy i nie jest łatwo, szczerze mówiąc, uzasadnić, dlaczego my widzimy przeszłość i odległą przeszłość gwiazdy, patrząc na nią, a nie jej odległą przyszłość. To to nie jest oczywiste na podstawie samych równań Maxwella.
I Direk powiedział: Potraktujmy poważnie w takim razie tą tą możliwość, że gwiazda czy w ogóle ładunek elektryczny, bo o świecenie to jest wi się z oscylacji ładunków elektrycznych, że one zaburzają nie tylko przyszłość, ale też przeszłość. I jeżeli w sposób symetryczny to uwzględnimy, to się okazuje, że efekt nieskończenia masy elektronu przy jego małym rozmiarze się kasuje i nagle elektron dostaje skończony rozmiar.
Y, problem z tym samoprzyspieszeniem wcale się do końca nie rozwiązuje, się robi jeszcze ciekawiej, bo się okazuje, że takie równanie ruchu takiego elektronu ma taką dziwną własność, że on zacznie się ruszać jeszcze zanim przyłożę siłę, którą chcę spowodować, żeby się zaczął ruszać. No jest znowu kłopot i i ludzie nie wiedzą jak ten problem rozwiązać. Więc mówienie, że my wiemy co to jest elektron, bo se kto zdefiniuje mądrym słowem to jest jakiś absurd.
Dla fizyka zrozumieć to jest patrzeć na jakiś problem z 15 różnych kierunków i umieć myśleć o jakimś problemie na wiele różnych sposobów i nie dochodząc do sprzeczności. W przypadku takiego pojęcia jak elektron tak nie jest i ani w teorii klasycznej nie wiemy jak to jest, ani w teorii kwantowej nie wiemy jak jest. Mamy teorię, która kwantową teorię Polak, która elektronkę kwantową, która tych problemów nie rozwiązuje, ale wie jak sobie z nimi radzić.
To znaczy wie jak zadawać takie pytania, żeby nie było kłopotów. Natomiast do rozumienia to jest bardzo odległa droga i dlatego fizycy są szczególnie już teraz po tych bolesnych doświadczeniach XIX wieku przeczuleni na punkcie tego, co znaczy rozumieć i ile tak naprawdę trzeba włożyć wysiłku, żeby jakiekolwiek najprostsze nawet zagadnienie można było uznać za zrozumiałe. No był taki bardzo ważny fizyk początku XX wieku, który jako młody człowiek usłyszał od swojego nauczyciela, żeby się fizyką absolutnie nie zajmował.
On chyba był też utalentowany muzycznie. Idź w inną stronę, bo fizyka jest skończona w zasadzie d trzy lata i temat będzie zamknięty. W ogóle się tym nie zajmuj. >> Tak to Max Plank. >> No właśnie Max Plank. >> I ciekawe było też z tą historią to, że Max Plank dostał nagrody do Nobla wiadomo za swoje odkrycie, ale właśnie co on zrobił? On próbował opisywać świecenie ciał, czyli jakie światło widzimy, jak coś podgrzejemy.
Jak weźmiesz kawałek metalu, to on świeci. No i to światło, które widzimy, zmienia się jego własność wraz z temperaturą. Im coś jest goręsze, tym zmienia się kolory, które widzimy. Na przykład światło tej szklanki też jest emitowane w pewnym w pewnym sensie, tylko że go nie widzimy. Widzimy tylko światło odbite, bo szklanka jest za zimna. To światło, które byś z niej wychodzi jest yem pod czerwonym, którego oko nie widzi.
Więc y zaczy zaczynamy to rejestrować dopiero przy pewnej temperaturze. Na przykład światło słońca jest widoczne, bo jest ono bardzo gorące. I teraz plan był kłopot, żeby zrozumieć dlaczego ciała świecą w ten sposób, bo teoria klasyczna dawała złe wyniki, nie zgadzała się z obserwacjami i nikt nie potrafił tego wyjaśnić. Plank napisał dwie prace. Najpierw zgadł matematyczny wzór, który opisuje rozkład tego promieniowania przy danej temperaturze. >> Zgadł. >> Znaczy co?
Podstawiał różne i nie wyszło. >> Tak. Tak. Miał krzywą eksperymentalną i zauważył, że a taki wzór świetnie pasuje do tych danych. >> Jasne. Ale to punktem wyjścia był eksperyment. >> Tylko wszystko wynika z eksperiment. >> Dołowywał teorię do do tego co wychodziło. >> Wyobrażenie, że se możemy coś wydedukować patrząc sufit. To to jest >> no nie no dobra. To jest w ogóle ciekawy wątek do za chwilę do tego wrócimy. >> Fizyka jest jest opisem rzeczywistości. Żeby tą rzeczywistość opisywać, musimy najpierw ją zbadać.
Więc to jest >> do ale wiesz no takie umysły jak Albert Einstein czy czy być może twój ulubiony Paul Dirak no to bardzo często jest tak, że oni mają pewne namiastki rzeczywistości coś tam widzą ale ta ogólna teoria względności szczególna teoria względności Einsteina no to wynika z jakiejś tam no zanurzenia tego mózgu w ciele Homo sapiens w takiej a nie innej rzeczywistości ale jednak jest tam dużo odklejonych myśli na na >> właśnie właśnie do tego chciałem przejść i jak skąd się wzięła w głowie Einsteina myśl za którą zanego to >> przepraszam to to to zachęcam zachęcam tam przerywaj.
Yyy, y no więc Plank najpierw zgadł jaki ten rozkład na papierze by mógł być, żeby pasować do obserwacji, ale to oczywiście nie wystarczyło, żeby zaspokoić jego ciekawość, bo zaczęł się zastanawiać, ale skąd ten wzór miałby się w ogóle wziąć? Y albo jak przekonuje profesor Bralczyk, że można nawet wziąć, to wie. Otóż Pl nie poddał się i myślał dalej i zauważył, że ten wzór uda się uzyskać, jak się weźmie klasyczną teorię, którą wszyscy znali, używali, ale wprowadzi drobną modyfikację mówiącą, że światło wysyłane przez rozgrane ciało jest wysyłane w porcjach.
To znaczy energia tego światła nie jest niepodzielna w nieskończoność, tylko się składa z małych kawałków. Te kawałki nazywano kwantami. Ale sam Plank nie wiedział, czy to jest tylko tyk matematyczny. Jeszcze ciekawostka, która nie ma żadnego znaczenia. Czy co w ogóle jeszcze jest innego? Yyy, równolegle do tego była inna dyskusja na temat yyy w ogóle elektromagnetyzmu i kłopotów z elektromagnetyzmem yyy których nikt nie potrafił rozwiązać i elementarnych paradoksów y które m yyy no yyy najprostszy przykład takiego paradoksu klasycznego elektrę sobie ładunek elektryczny i wsadzę go w pole magnetyczne to taki ładunek lata w kółko.
To jest własność pól pól magnetycznych. Dlatego, że siła jaką jaką polecne działa na ładunek jest zależna od prędkości. Im większa prędkość tym te promień będzie się zmieniał, zwiększał albo zmniejszał w zależności od prędkości. I to wydaje się niegroźne, ale można zadać pytanie. Ale przecież jak przejdę do takiego układu odniesienia, który się porusza razem z ładunkiem, to ten ładunek w tym układzie spoczywa, a siła magnetyczna w związku z tym powinnać zero.
No bo jak nie ma prędkości, to nie ma siły. To jest siła, która zależy, jest proporcjonalna do prędkości. Więc można zadać pytanie, co znaczy, że ładunek będzie latał w kółko w układzie, którym się porusza, ale jak przejdę do układu, który się porusza razem z ładunkiem inercjalnego układu, to to ta siła przestanie działać i ładunek już nie będzie się poruszał w kółko. Nikt nie potrafi tego rozwiązać przez 30 lat. I były różne hipotezy.
Zaczęło się od Woldemara Voa, który postawił taką dziwną hipotezę, że gdyby tak w specyficzny sposób modyfikować prawa, jakimi przekształca się czas i przestrzeń pod wpływem ruchu, to część tych problemów by się udało rozwiązać. Potem przyszedł Larmor, potem przyszedł Thomson, potem przyszedł Lawrence i wszyscy rozwijali tę koncepcję, że trzeba by może trochę zmodyfikować wzory transformacyjne dla czasu i przestrzeni, ale wszyscy oni traktowali to jako ciekawostkę matematyczną. trochę tak jak Plank ten swój wzór i potem wszedł Plank to wszystko uporządkował i już był prawie że na dobrej drodze żeby postawić kropkę ale ubiegł go Albert Einstein i napisał pracę którą wszyscy teraz świetnie znamy powtarzając te te wzory transformacj Lorence tylko wyprowadzając je i lepiej uzasadniając i pokazując że to nie jest tylko trik matematyczny tylko fundamentalna własność czasu przestrzeni y i tak zmienia się rzeczywistość jak zaczyna się ruszać.
Czas i przestrzeń ulegają zmianie. Więc on trochę postawił kropkę na i te wzory, których używał, większość tych efektów, o których pisał, czy transformacja Lorenca, które się tam pojawiły, to jest coś, co się Lorencowi, czy skrócenie Lorenca Fitoralda, które też było efektem pracy wcześniejszych fizyków i spekulacji na ten temat, to też był znane trochę w innym kontekście, bo to interpretowano inaczej, ale chyba się myślę, że świzycy się zgodzą, że że gdyby Albert Einstein nie odkrył teorii względności w w tym 1905 roku to rok czy dwa czy trzy lata później czy pi lat później zrobiłby to puank re albo Lawrence albo ktoś inny.
Nie można tego samego powiedzieć o piątej symfonii Beethovena. Beetoven skomponował tą symfonię i i gdyby tego nie zrobił to już ona nie powstanie. Więc to trochę być może jest też głos w dyskusji na temat tego, czy się fizyka odkrywa, czy się wynajduje, ale to jest raczej jasne, że że Einstein postawił tą kropkę, ale chciałem teraz jeszcze połączyć in inną kropkę, bo bo chcesz coś powiedzieć? >> Nie, nie, bo nie rozgaduję.
Nie, bo bardzo miło mi się cie słucha, bo tak chciałem tylko powiedzieć, że że trochę się na okoliczność łączenia kropek tutaj spotkaliśmy, bo tak piszesz w książce o sztucznej inteligencji, do tego sobie dojdziemy. >> Dlatego chcę trochę do tego dobrąć w takim pokraczny sposób, ale zacznę jeszcze od fizyki. Otóż w tej pracy Einsteina jest jeden niezwykle ciekawy szczegół, na który się historycy nie nie zrozumieją dla nich powodu, nie zwracają uwagi, bo wszyscy się zachwycają tą tym odkryciem, ale Einstein tego samego roku zrobił jeszcze inną pracę i jeszcze inną i ten rok 1905 nazywa się genialnym rokiem, tym takim cudownym rokiem, kiedy on wpadł na trzy zupełnie niezależne pomysły z trzech różnych dziedzin. teory względności efekt fotoelektryczny o którym chcę teraraz powiedzieć i jeszcze ruchy Browna jeszcze coś zupełnie innego z trzech różnych dzi fizyki miał trzy genialne pomysły które w zasadzie posunęły naprzód trzy różne dziedziny >> prawie jak 1991 dla muzyki rockowej czarny album Metallic i ten Pearl Jemu jeszcze Never Mind Nirvany >> no w filmografii to samo jestem jednego roku Forest Gump i tam jeszcze parę innych filmów nie pamiętam ale ale są takie takie takie sytuacje.
I teraz ja chciałem trochę od odczarować co tu się wydarzy, jak to się stało, że on te trzy pomysły miał i jak to możliwe? Otóż w tej pracy tej żywności jest pod koniec jak wszystko to opisuje to przekształcenie czasu przestrzeni jak opisuje jak to wpływa na transformację pól elektromagnetycznych jak rozwiązuje to problemy elektromagnetyzmu niektóre jest taki rachunek pod sam koniec który jest dosyć skomplikowany i jest między następującym otóż Einstein pisze tak wyobraźmy sobie że leci sobie światło w przestrzeni z prędkością światła i powiedzmy, że Obszar, w jakim to światło się znajduje, to jest jakaś taka kula, która się przesuwa z prędkością światła i w tej kuli jest jakaś energia zgromadzona związana z tym światłem.
Trochę tak jak energia tego elektronu, o którym mówiłem wcześniej. Jest jakaś energia. Zadajmy pytanie, jak ta energia by się zmieniła, gdybym przeszedł do innego układu odniesienia, gdybym patrzył na tą kulę światła poruszając się na rowerze. No i Einstein najpierw przekształca kształt tej kuli do nowego układu, potem przekształca pola elektroniczne w środku, potem oblicza całkowitą energię w tym nowym układzie odniesienia i dostaje wynik.
I y pisze ten wynik. To jest bardzo prosty wzór. Energia w jednym układzie to jest energia w drugim układzie razy taki pierwiastek z takiego bardzo prostego wyrazu zarządzącego od prędkości. I Einstein pisze tak: "O, bardzo ciekawe. Ten wzór na transformację energii jest taki sam jak wzór na transformację częstości światła albo koloru światła. I tak to zostawia i nie pisze w ogóle po co on ten rachunek robił, jaki jest sens, tylko po prostu tak to zostawia.
I parę miesięcy później pisze pracę o o efekcie fotoelektrycznym, w której jako pierwszy fizyk poważnie traktuje hipotezę Planka. Nawet Plank nie traktował swojej hipotezy poważnie. On nie wiedział, że to jest trik matematyczny, co to w ogóle jest. >> A potem są Einstein nie traktował swoich własnych pomysłów poważnie w innych tylko. >> To to jest inna konsekwencja tej tej sytuacji. Ale Einstein jako pierwszy potraktował ideę planka bardziej poważnie niż sam plank.
Dlaczego? Bo w tym w tej hipotece planka była taka był był to było skonkretyzowane w taki sposób, że te cząstki światła, o których on mówił, te fotony to mają minimalną energię, która zależy od koloru tych fotonów, od częstości światła. I ten wzór, którym zapostulował, jest taki, że energia jest proporcjonalna do częstości. Einstein w tej swojej pracy zauważył, że częstość światła się transformuje z układu do układu tak samo jak energia.
I on nie powiedział po co to zrobił, ale można się domyśleć, dlatego że to pokazuje, że ten wzór planka, który on jemu spadł z nieba, to jest jedyny możliwy wzór, który w sposób sensowny mógłby mieć takie własności transformacyjne, że z układu do układu wszystko się zgada, że ten wzór jest cały czas taki sam w każdym układzie. Gdyby plank zapostulował, że energia światła jest proporcjonalna do kwadratu częstości na przykład albo do jakiej jakąkolwiek inną funkcją częstości jest niż zapostulował to to by nie miało szans się zgadać z teorią zzględności.
Więc Einstein zrobił ten rachunek żeby się przekonać w mojej ocenie że hipoteza Planka rzeczywiście z biegiem okoliczności zgadza się z z tą strukturą teorii zgzęności i to mu wydaje mi się nadało pewnej odwagi, żeby te kropki połączyć. Ale zauważ, że że ta praca w efekcie fotoelektrycznym, która jest w której postuluje istnienie fotonów już już otwartym tekstem mówiąc, że po prostu fotony istnieją tylko w ten sposób da się wyjaśnić efekt fotolektryczny >> i za z tych trzech plac za tą dostał >> za tą dostała właśnie bali mu się dać zaatory względności z różnych powodów to to nie jest to nie jest coś co spadło z nieba on połączył kropki on obliczył najpierw się przekonał do tej wzemności, a potem zbadał jej konsekwencje i to mu to go przekonało, że to jest bardzo podobne do tego, co zrobił chwilę wcześniej Plank i połączył te dwie kropki.
Więc to genialne odkrycie numer dwa to był efekt połączenia dwóch kropek, które nie były aż tak daleko od siebie. W tym sensie oczywiście to jest genialny przeskok i jest to coś co zapewniało nieśmiertelność, ale ten krok nie jest niewyobrażalny w tym sensie, że można wziąć studentów, pokazać im te prace, przeanalizować to i wspólnie dojść do tych wniosków nie obaw. Jakbym dostawił, jakbym podsunął to pod nos studentom i zadał pytanie, co, jaki z tego wynika wniosek i zostawił ich na tydzień, to być może któryś z nich by wpadł na ten kolejny krok.
Oczywiście trzeba wiedzieć na co patrzeć i mieć szczęście być w odpowiednim miejscu i i mieć świetną intuicję i to to się zdarza rzadko. A wt nie miał żadnej podpowiedzi. Natomiast to to to nie są rzeczy, które spadają z nieba. Te genialne olśnienia to jest często efekt łączenia kropekm >> dostrzegania analogii. On zauważył, że wzór planka jest analogiczny do struktury, która się pojawia w teorzędności. Kolejna praca o efekcie fotkowa to była taka praca w której on patrzył na takie zjawisko, w którym jak się patrzy przez mikroskop na na cząsteczki w jakimś płynie w zawiesinie, które się tam okazuje, że w taki dziwny sposób ruszają tak jakś przyspieszają, nagle ruszają się w różnych kierunkach, to się nazywa ruchy Browna.
On, żeby to wyjaśnić postawił hipotezę, że to dlatego, że ciec składa się z atomów, które drgają i czasami dochodzi do zdarzenia z taką cząsteczką zawiesiny i i w wyniku tego zdarzenia jest taki niekontrolowany przekaz energii i to wyjaśnia to zjawisko. Ale to znowu jest łączenie kropek, bo Einstein najpierw chwilę wcześniej przekonał się to do istnienia fotonów, cząstek światła i to go też upewniło, że być może wszystko składa się z cząstek, może też materia i takie hipotezy były wcześniej. formułowane istnienia atomów, ale to mu znowu nadało pewność, że to jest coś więcej niż tylko hipoteza.
I innymi słowy fizycy, nawet najgenialniejsi często i w ogóle naukowcy i ludzie swoje największe odkrycia zawdzięczają łączeniu dwóch bliskich kropek i tylko wtedy jesteśmy w stanie rzeczywiście coś coś poprnąć na >> tak funkcjonuje naturalna inteligencja i być może ten to wprowadzenie rozjaśni państwu rozmowę o sztucznej inteligencji i łączeniu kropek, bo to określenie będzie będzie wracało tak na marginesie zresztą o Einsteinie się mówi, że on nie był genialnym matematyką.
Na przykład ten Lawrence był mu potrzebny i szereg innych, jak to wykazałeś różnych osiągnięć przed nim, żeby on mógł z pewnych rozwiązań skorzystać, z pewnych też takich zwykłych narzędzi po prostu jakby atrybutów, który które ktoś skonstruował, z których on jako wcale nie genialny matematyk, ale genialny fizyk z tą swoją intuicją mógł po prostu wykorzystać dodając do tego swoją intuicję. >> No pojęcie czasopestrzeni na przykład zawdzięczamy nie Einsteinowi, tylko jego nauczycielowi matematyki Hermanowi Minkowskiemu, który zresztą miał złe złą opinię o Einsteinie jako studencie. uważał, że że się obija yyy yyy ale zmienił zdanie i 2 lata po napisaniu pracy w Einsteinach on napisał swoją własną pracę o obrotach czasoprzestrzeni y i wprowadził będzie czasopestrzeni jako niezbędny jakby taki naturalny sposób opisu tym jest ruch.
Z kolei Einstein, który miał już był zniechęcony do Minkowskiego, na początku bagatelizował, że to jest taki trik matematyczny bez większego znaczenia, a jak później przyszło co do czego i miał zająć się ogólną treną zgzlędności 10 lat później, zajęło mu to 10 lat, to się z ideą Minkowskiego przeprosił i i to pojęcie czasu przestrzenie stało się absolutnie centralne dla całej teorii. >> Ja bardzo państwa przepraszam, że chociaż się umówiliśmy na okoliczność rozmowy o sztucznej inteligencji, bo o tym napisał Andrzej Dragan książkę, że ja dopytuję o fizykę, ale uwielbiam jak jak on o fizyce opowiada.
Zresztą mówiłem o tym, że z Einsteinem było podobnie, że on pewne swoje rzeczy na przykład fizykę kwantową, której by przecież jednym z ojców założycieli, bo nie mógł zaakceptować tego, Bóg nie gra w kości, wiadomo, ale też fale grawitacyjne, które mu wychodziły, traktował jako pewien artefakt matematyczny, mówił, no tak wychodzi rzeczywiście, że że jak się zderzą dwie czarne dziury gdzieś tam, to znaczy jeż on nie widział rozumił energii, którą my bylibyśmy kiedykolwiek w stanie zbadać, zmierzyć tu na ziemi, które byłyby efektem zderzenia dwóch czarnych dziur gdzieś w końcu wszechświata i one byłyby w stanie tak jak to dzisiaj wiemy, że tak się dzieje.
W pewnym sensie jak ten kamień na środku spokojnego stawu rzucone i potem są takie fale, które się spokojnie rozchodzą po całym stawie, ostatecznie do brzegu dobiją, to wynikało z Einsteina, ale on nie wierzył, że my to kiedykolwiek zmierzymy. Ostatecznie to zrobiliśmy w 2015 czy 16 za co była nagroda Nobla. jest jeszcze lepiej, bo ja pamiętam takie nagłówki jak jak zmierzono dwie fale fale grawitacyjne w wyniku zderzenia się dwóch czarnych dziuró to były takie nagłówki w prasie wajie bodajże wesie że wielki sukces Einsteina Einstein znów miał rację potwierdzono jego teorię 100 lat później >> dokładnie odwrotnie >> znaczy Einstein w 1935 roku, jeśli mnie pani się myli napisał artykuł w którym otwarcie kwestionuje możliwość istnienia czarnych dziur.
Napisał artykuł tylko po to, żeby pokazać czarne dziury nie istnieją. To są tylko artefaktem matematycznym i coś takiego nigdy nie może powstać. y i i i przy innej okazji a a one wynikają matematyczne rzeczywiście tego teorii to Karl Schwarceld to to jako pierwszy wykazał, więc on >> ale na bazie Einsteina >> na bazie równań Einsteina, które Einstein odkrył, ale jak się okazuje też nie do końca ufał swojej własnej teorii.
Trochę jak Plank, który >> prowadził pojęcia kwantu i nie do końca wiedział, co co znaczy w jakimś sensie wyobraźnia tego genialnego fizyka nie ogarniała efektów jego własnej teorii w pewnym sensie. Nie, nie, nie. No to, to on, on, on to rozumiał, tylko że to nam się wydaje teraz, że coś jest oczywiste, ale to dlatego, że o wiele trudniej jest coś odkryć, a o wiele łatwiej jest tego się nauczyć od innych. O, to był taki moment, że ludzie nie wiedzieli, czy czarne dziury istnieją, czy nie.
A to pytanie otwarcie stawiał i i sprawdzał, czy to jest możliwe, żeby taki mechanizm był stabilny, czy rzeczywiście on mógł mógł być czymś więcej niż tylko artefaktem teorii. No bo teoria jest pewną idealizacją. Kto wie, może ona się załamuje. A a rzeczywiście w środku czarnej dziury jest ten problem, że tam jest osobliwość, która jest załamaniem się teorii wzorności. Ein mi się nie podobało, że jego teoria się załamuje w tym tym miejscu, więc on chciał jakoś uzasadnąć, dla dlatego >> to do załamania nie dojdzie, ale ale też ale też same fale grawitacyjne on krytykował i napisał artykuł o tym, że fale grawitacyjne nie mogą istnieć, nie będą stabilne z różnych powodów i to polski fizyk Andrzej Trautman, profesor Andrzej Trautman zresztą od którego się uczyłem ogólny zalności dawno temu, pokazał jako pierwszy bardzo odważnie i ambitnie, że jak najbardziej stabilne fale grawitacyjne mogą istnieć i i to jemu i Robinsonowi zawdzięczamy teorie fal grawitacyjnych. >> Tak jest.
Bardzo dziękuję, że o tym mówisz, bo to rzeczywiście jest jakiś taki no nie wiem, polski polski sznyt w całej tej historii, bo yyy ojciec y ojciec założyciel fizyki na na Uniwersytecie Warszawskim Leopold Infeld, który był współpracownikiem Alberta Einsteina, też w to nie wierzył, ale jego doktorantem był Andrzej Trautma i on się zgodził na ten doktorat, chociaż jakby nie niespecjalnie wierzył >> podobnie jak Einstein.
Nie pasowało to Infeldowi, bo Einstein, bo Infeld zgadzał się z Einsteinem, że FGY nie istnieją, a tu przychodzi młody gość i mówi: "Ale ja bym chciał napisać doktoratem, że istnieją". No i Infeld powiedział: "To świetnie, to to good luck. [śmiech] Proszę bardzo." No i to też świadczy o wielkiej klasie Infeldach, o tym, że jest otwarty na na na zmianę zdania. Bardzo trudna umiejętność. >> Tak. Tak. No i rzeczywiście potem yyy te te fale grawitacyjne odkryto Kiptorn, dobrze pamiętam nazwisko profesora, który który między innymi za to dostał nagrody Nobla.
Yyy >> no eksperyment z mierzeniem fali grawitacyjnych to był to była praca zbiorowa. Kiptorn i tam jeszcze inni byli pomysłodowcami tego eksperymentu. >> Y >> setki naukowców na ten >> tak no też Polacy. >> Profesor Rosińska na przykład serdecznie panią profesor pozdrawiamy też przy tym pracowała. To ten detektor Virgo Lajo, prawda? gdzieś zresztą pracę nad nad to to w ogóle jest początek nowej fizyki i fal grawitacyjnych.
To się całkiem nieźle teraz rozkręca. Kzą ciekawe czy to pokazuje jak jak krytycznie się zrobili fizycy. No bo to nie chodzi o to, żeby zrobić eksperyment w którym mierzymy falę grytacyjną, bo tam analiza numeryczna była tak skomplikowana, że dostrzeżenie oscylacji, które są mniejsze niż rozmiar atomu w jakimś jakimkolwiek detektorem wydaje się niemożliwe do osiągnięcia. Absolutnie się tego nie da zrobić. Kto kto przy zdrowych zmysłach uwierzy, że udało się zarejestrować fale grawitacyjne i dlatego zbudowano nie jedno tylko dwa laboratoria na dwóch końcach ziemi, żeby sprawdzić czy jeżeli jedno laboratorium wykryje fale to czy jednocześnie zrobi to drugie żeby upewnić się że efekt nie jest jakimś szumem fluktuacją czymś takim i dopiero >> to nadało nam pewności że że te że te pomiary chociaż wynikały z teorii że powinno się dać to zaobserwować rzeczywiście odzwierciedlają Tak. >> Zresztą oni na etapie rozruchów jeszcze robili sobie takie testy, że że była grupa naukowców, która nie wiedząc o tym, że jest sprawdzana, sugerowano się im, że coś wykryto, żeby oni to rzeczywiście zweryfikowali.
I pamiętam profesor Rosińska opowiadał mi o tym, że że tam był jakiś taki test, że i i wyszło, że to jednak jest nieprawda. Rzeczywiście to była nieprawda, ale to było to na etapie takiego sprawdzania aparatury i testowania, czy rzeczywiście to funkcjonuje tak jak tak jak powinno, bo to bo o czym my w ogóle mówimy? Mówimy o falowaniu wszystkiego, tak? Znaczy mówimy o tym, że mówimy o falowaniu czasoprzestrzeni, o tym, że gdzieś daleko zderzyły się czarne dziury i wszystko faluje.
My też. Ziemia faluje, te detektory falują. Właśnie dlatego to się dało wykryć, że tu się pojawiła minimalna różnica odległości, bo wszystko faluje, łącznie z nami. >> Przy czym to nie jest taki zwykły ruch w przestrzeni, tylko to jest raczej oscylowanie całej czasu przestrzeni. >> Czasu przestrzeni właśnie. >> Coś, coś trochę innego. >> Słuchaj, też też mi to y dziękuję za ten wstęp. w to wstęp. Ale no bo to też nieźle mi pasuje do takiego też o tym wspomniałeś, mówiłeś o tym przy okazji kwantechizmu, mówiłeś o tym przy okazji Planka, bo że Plank szukał równań, które by które by mu do tego pasowały.
No ale bo ja jeszcze trochę o o naturze fizyka, to kwantechizm w ogóle czy to nie jest trochę tak, Trautman też młody gość, który przychodzi do uznanego profesora Infelda. Czy to nie jest tak, że że fizyk, który ma ambicje i albo inaczej szansę na to, żeby żeby wiesz pokazać coś nowego, żeby, bo wy się zajmujecie opisywaniem przyrody, opisywaniem natury, żeby wydrzeć kolejny milimetr, że o chociaż o milimetr przesunąć granicę ludzkiej wiedzy i wydrzeć kolejną chociaż malutką tajemnicę funkcjonowania przyrody, że wy musicie być trochę rebeliantami i tak i taka trochę była twoja książka, takie jest też trochę trochę twoje podejście, taka też jest trochę twoja sylwetka.
No takiego trochę rebelianta, że no to nie nie pamam nie pamiętam, który to powiedział, że że że teoria musi być dostatecznie szal musi być bardzo szalona, żeby się okazała prawdziwa, prawda? Któryś z wielkich fizyków? >> To jakieś było wystąpienie kogoś w Kopenhadze i Nilsbor po tym wystąpie został i powiedział, że bardzo ciekawe tylko pytanie, czy twoja teoria jest wystarczająco szora, że była prawdziwa. >> No właśnie.
No bo, bo tak mówiłeś, że to cię trochę przyświecało przy pisaniu kwantechizmu, żeby trochę sprowokować do odrzucania autorytetów. No trochę tak chyba musi >> no to też trzeba ostrożnie dlatego, że y krytyczne myślenie wymaga otwartości na odrzucanie autorytetów, ale to nie znaczy, że odrzucanie autorytetów to jest coś, co z tego wynika automatyczne, że się jest krytycznym. No to to jest ten problem ze znalezieniem pewnego subtelnego balansu i to nie jest tak, że że ktoś kto podwadza wszystko co słyszy, to jest osoba krytyczny myślący.
Niestety tak nie jest. Jasne. A jak jak kuszące w pracy fizyka teoretycznego jest to, o czym powiedziałeś w kontekście Maxa Planka, że on szukał czegoś co już znał, żeby gdzieś to do tego to przywiązać, ale jak bardzo kiedy ty myślisz nad rozwiązaniami pewnych problemów, ty, twoi koledzy fizycy, teoretycy, to no jak gdzie się jak bardzo kuszące jest jednak, żeby no jest jakiś albo nie wiem, no fizyk eksperymentalny może, który współpracuje z teoretykiem i widzi jakieś nowe zjawisko, jak bardzo kuszące jest to, żeby to jednak przywiązać do jakichś wzorów teorii, które już znamy?
A jak to połączyć z szukaniem zupełnie nowego wzoru, którego jeszcze nikt nie napisał? >> No bardzo trudno jest zrobić eksperyment, który przeczy nam znanym obserwacjom i to to jest trochę choroba współczesnej fizyki obecnie, że zbyt wiele eksperymentów aż za dobrze zgadza się z naszymi teoriami. Są >> znaczące i ważne kontrprzykłady. Są przypadki, kiedy nam się wszystko rozjeżdża i nie wiemy co to oznacza. No i bardzo wszyscy liczą, że to będzie wskazówka na do jakichś zmian, ale jest pewien impas.
Nikt nie potrafi tych zmian wprowadzić. Te impasy były w fizyce nieraz. Te programy z elektromagnetyzmem, z elektronem to czy z prawem działania siły magnetycznej na ładunek, to był problem, który był nierozwiązany przez 30 lat. Nikt nie wiedział jak tą prostą zagadkę rozwiązać. Dopiero Abet Einstein przyszedł i powiedział od początku do końca jak to trzeba rozumieć. I no jesteśmy w takim impasie obecnym, który już się przeciąga. >> Na czym polega ten impas i czy to znaczy, że >> jest mnóstwo, jest mnóstwo takich impasów, >> taki najważniejszy, wiesz.
No nie wiem, >> to zależy co kto lubi. No w kosmologii są rozbieżności z obserwacjami. To są chyba najważniejsze. >> To to stało Einsteina, tak? No nie bardzo wiadomo jak interpretować sposób w jaki rozszerza się wszechświat, bo to nie jest zgodne z tym co by wynikało z rozkładu materii, które obserwujemy. >> Niektórzy to nazywają problemem ciemnej energii, ciemnej materii. dadzą są powiązane rzeczy, >> ale to to jest niezwykle fascynujące, dlatego że cały ten wszechświat, wszystko o czym ty opowiadasz, o czym ty piszesz, prace naukowe, twoi koledzy fizycy wszystko co napisano, wszystkie teorie fizyczne dotyczą 5% materii. >> To jest, nie wiem czy ta metryka jest właściwa.
No gdyby przyjąć taką hipotezę, że ogólna teoria względności jest prawdziwa i nasze obserwacje są prawdziwe, a t obserwację to trzeba też pamiętać, że to jest to nie są bezpośrednie często, to jest ciąg różnych powiązanych ze sobą pośrednich obserwacji i wnioskowań, które prowadzą do wniosku, że na przykład galaktyki się poruszają tak czy inaczej, czy czy wszechświat się rozsza tak czy inaczej, to się okazuje, że trzeba by, żeby to te obserwacje wyjaśnić, to trzebaby zwiększyć ilość materii we wszechświecie w sposób znaczący.
I dla większości tej materii nie widzimy, bo inaczej z tego powodu ruchy galaktycz się nie zgadzają i ramiona się przesuwają z inną prędkością kątową niż powinny na przykład. >> Mhm. >> Y, ale to wszystko przy założeniu, że że wszystko, że to chodzi tylko, że to chodzi tylko o brakującą materię. No jest wiele możliwości na jakie można zrobić jakiś błąd. Mhm. >> Dostaję, robię obliczenie, dostaję błąd i może to być wynik yyy błędnych danych, które wstawiam do teorii, a to może być wynik błędnej teorii.
Może teoria się nie zgadza, może ogólna teraz względności jest tylko przybliżeniem. A pewnie jest, tylko nie wiadomo czy akurat w tych skalach. Myślę, że nazywanie, że to jest to nazywamy ogólnie problem ciemnej materii oraz drugi pokrewny problem ciemnej energii, to jest taka ogólna nazwa na to, że nie potrafimy tego planu rozwiązać. To nie znaczy, że jest jakaś materia, której nie widzimy. Tak, to jest jedna z hipotez.
Bardzo wiarygodna zresztą, ale ale tylko jedna z hipotez. >> Jasne. Ale to to by mogło oznaczać, że cała fizyka, którą do tej pory napisano, może być w jakimś sensie co nie wiem czy błędna, czy niekompletna, czy właśnie przybliżeniem, że jakby jest wiesz większa część świata tak naprawdę działa zupełnie inaczej. Nie wiemy jak >> wiesz. No nauką empiryczną się ludzie zajęli na poważnie 400 lat temu. Ja bym był w ciężkim szoku, gdybyśmy 400 lat odkryli cokolwiek, co jest fundamentalnie prawdziwe.
Y raczej podejrzewam, że że większe rzeczy, które wiemy obecnie, to są tylko przybliżenia >> w najlepszym razie. >> Jasne. Też uroczo w takim swoim typowym dla siebie stylu piszesz i tłumaczysz, czym jest na przykład pojęcie fundamentalne w fizyce. To a propos tego elektronu to chyba w tym miejscu w książce, >> no jak czegoś nie rozumiemy to temu nadajemy mądrą nazwę. Tak, ta nieprzywiedna reprezentacja y grupy Pancarego się przeczytać tego nie da przecież yyy to jest mądre określenie, które jest pewnym matematycznym zabiegiem, który formalnie niby definiuje co nazwam elektron, ale z rozumieniem głębokim to nie ma aż tak dużo wspólnego, bo bo ta sformułowanie matematyczne ma tyle swoich problemów interpretacyjnych, chociażby te kłopoty, że z taką definicją elektronów wiąże się kłopot z tym samoprzyspieszaniem, z że on musiał mieć nieskończoną masę i tak dalej, że zaburza swoją nie tylko nie tylko przyszłość okolica, ale również przeszłość.
Być może my tego nie rozumiemy, więc zadowalanie się się mądrą definicją i i uznawanie, że problem jest rozwiązany jest naiwnością. Tym bardziej, że często definicja tak naprawdę w takim potocznym ujęciu to właściwie nawet nie dotyka sedna czy źródła czy czy jakby istoty, tylko raczej jest często tak jak to y ty świetnie pokazujesz pokazując różne powszechne łatwo dostępne definicje inteligencji, my często się skupiamy na pewnym opisie objawów na przykład albo funkcjonalności czegoś, nie? podajesz tutaj różne definicje inteligencji, na które trafiłeś.
Na przykład w Wikipedii to nie ma nic wspólnego z definicją, tylko to jest raczej opis zbioru pewnych objawień niby tej definicji, prawda? >> No taka taki kompromis, którzy psychologowie często, no bo to jest kwestia kompromisu, definicja jest tak duża, że nie ma jednej dobrej, nie wiadomo co powinno się nazwać inteligencją. Tak, ale to nie jest takie ważne, bo w końcu to jest tylko definicja. Definicje nie są żadnej wiedzy.
Jak to nazwę, to jest bez znaczenia, ale psychologowie mają taką definicję na przykład, że to jest umiejętność dostosowania się do zmian w otoczeniu czy umiejętnoś adaptacji. Jakoś z tym wiązą definicję. To jest dla mnie o tyle niesatysfakcjonujące, że że to jest bardziej konsekwencja inteligencji. To >> no właśnie tak. >> Ten ta definicja nie mówi, co się dzieje na poziomie kognitywnym w moim mózgu, że on jest w stanie się adaptować.
To jest objaw inteligencji. To jest konsekwent. Więc pytanie, co jest źródłem, >> co jest wcześniej jakm. >> No i y na poziomie nieco niższym, bo to też nie jest bardzo fundamentalny poziom, ale na poziomie nieco niższym. Ja jestem fanem, znaczy bardzo mi się podoba sformułowanie tego wszystkiego w języku, którego używa Markus Hatter. To jest y y taki matematyko-informatyk, który pracuje obecnie w Deep Mind, który jest twórcą takiej teorii inteligencji AXi to się nazywa, zmatematyzowanej, opartej na oczywiście ciągu bardzo interesujących y y twierdzeń matematycznych opartych trochę o teori kołomogorowa, o teori przewidywania, ale też centralnym konceptem, który tam się wokół którego się wszystko kręci jest umiejętność dostrzegania analogii, łączenie kropek, mówiąc trochę trochę w skrócie i rzeczywiście jest tak na przykład, że to co zrobił Einstein, za co go wielbimy, to jest chociażby ta analogia, której mówiłem pomiędzy sposobem w jaki transformuje się energia, a sposobem, w jaki transformuje się częstość.
On zauważył tą analogię. Izaak Newton. Za co za co go pamiętamy? No wszyscy pamiętamy o spadającym jabłku. Ale co to się stało? No, Newton po raz pierwszy zauważył pewną analogię, której nikt wcześniej przez tysiące lat nie zauważył, mianowice analogi pomiędzy prawami fizyki opisującymi spadające jabłka i prawami fizyki opisującymi ruchy planet na niebie. Nikt przy zdrowych zmysłach nie sądził, że jabłka i planety mają coś ze sobą wspólnego.
To były dwa zupełnie różne światy. Tam były jakieś sfery niebieskie, tutaj były jabłka spadające, bo są ciężkie. I dopiero nie to on powiedział nie jest fundamentalne prawo fizyki nazwijmy je prawem powszechnego ciążenia której analogicznie działa i do jabłek i do planet >> połączył kropki bardzo odległe >> to jest łączenie kropek bardzo odległych y w języku jak uważamy że ktoś na przykład w sposób inteligentny posługuje się językiem poeta na przykład i kluczowym pojęciem jest pojęcie metafory i sformułowanie pięknej metafory jest uznawane za objaw inteligencji A metafora to jest przecież nic innego jak analogia, tylko nie między prawami fizyki czy tam między innymi rzeczami, tylko między wrażeniami, sytuacjami.
I w ogóle cały język, którego używamy, którym teraz gadamy ze sobą, jest przepastnym zbiorem metafor. W każdym zdaniu się znajduje jakaś metafora i na przykład słowo przepastny zbiór, to też jest metafora, więc a metafora to jest analogia. Więc posługując posługiwanie się językiem wymaga używania analogii. Y, żeby spojrzeć na to jeszcze bardziej z innego kierunku, testy inteligencji, czy je lubimy, czy nie, one mierzą ten nienacachowany kulturowe w zasadzie tylko jedną rzecz, umiejętność dostrzegania analogii.
Jak się zapytam ciebie, że rękawiczka ma się do y do ręki jak skarpetka do trzy kropki, no to pytam się ciebie, jaka jest analogia między tymi relacjami? Mhm. >> Jak daje ciąg rysunków i masz wstawić kolejny do tego ciągu, jak w matrycach Ravena, no to pytam się o umiejętność dostrzegania analogii między jakimiś prawami zachodzącymi w tych w tych w następstwie rysunków. Jak masz testy liczbowe, gdzie masz uzupełnić ciąg liczbowy, to jest jeszcze inny rodzaj testu, ale żeby go uzupełnić, musimy dostrzegać analogię pomiędzy jakimiś relacjami, między liczbami. >> I na bazie tych analogii, które w tym co było, ja wyciągam pewien wniosek i dopisuję kolejne liczby albo wybieram kolejny rysunek na zasadzie prawdopodobieństwa wystąpienia kolejnego elementu. na przykład, bo tak jak HTER to mówi, yyy, najbardziej kompresując swoją ideę, czym jest inteligencja, że najlepszym predktorem przyszłości, czyli najlepszym sposobem na przewidywanie co się wydarzy jest posługiwanie się teorią, która najlepiej opisuje moje dotychczasowe obserwacje i jest najprostsza. >> Mhm. >> Czyli jak dotąd obserwowałem na przykład 1000 razy jakiś eksperyment i wiem jakie są wyniki i mam najprostszą możliwą teorię, która ten eksperyment opisuje, to ta teoria jest najlepszym sposobem na przeidwanie co się co chwilę wydarzy.
Mhm. >> Tak. Wokół takiej idei operuje cała nauka empiryczna. >> No właśnie. O to też wy robicie. >> Mamy eksperymenty, które robimy i one nam pozwalają opisywać prawa. Chcemy, żeby to prawo jak najprostsze, najbardziej eleganckie. Yyy, bo sądzimy, że najprostsze prawa są najlepszym sposobem na przewidywanie przyszłości opisu rzeczywistości. Y i też jest no wielu przykładów, że czasem mam może mieć to samo zjawisko opisane na wiele sposobów.
Na przykład ruchy planet, co opisywało świetne przecież przed Kopernikiem to Lemeusz. Bo świetna teoria ptolemejska, która w zasadniona była lepsza od teorii Kopernika >> w sensie przewidywalności ruchów kolejnych planet, co się pojawi kiedy. >> Tak, no bo Kopernik zakładał okręgi, a to nie do końca są kręki. To więc teoria ptalcka była trochę lepsza. >> Przypomnijmy, ona nie stawiała słońce w centrum układu. >> Nie, nie, to był inny układ odniesienia, ale teoria kopernikska była o wiele prostsza. >> Tak >> więc on sformułował trochę niepoprawną teorię, ale za to 1000 razy prostszą. >> Tak. >> Co zresztą zaraz poprawił Kepler i inni. yyy i ten ten pęd do upraszczania opisu rzeczywistości yyy no nie wiem jak to oceniać, ale efekty są niezłe.
No technologia cała, która powstaje jako efekt uboczny tej tej tej działał >> i i to co Hater mówi to właśnie to jest to powinniśmy nazwać inteligencją. Umiejętność kompresji danych dotychczasowych, że tak powiem. A żeby kompresować dane trzeba umie dostrzegać analogię. Bo w końcu do kompresowania danych trzeba zauważyć, że jakieś na przykład nie wiem ciąg z R1ek w pliku ma jakieś analogie, jakieś podobieństwa i jak te podobieństwa jestem w stanie dostrzegać, to jestem w stanie ten plik skompresować. >> To jest ten konkurs, prawda, słynny na kompresowanie danych. >> Jest nagroda Hattera 500 000 EUR dla programisty, który napisze najlepszy algorytm kompresji danych.
Nie po to, żeby robić algorytmy kompresji danych, tylko żeby po to, żeby rozwijać nasze rozumienie, czym jest inteligencja tak zdefiniowana. Czyli doszliśmy do 20% zdaje się, że mieliśmy tam 100 powiedzmy, że 100 mega, to dzisiaj potrafimy skompresować te 100 mega wyjściowe źródłowe do 20. >> A więc tylko konkretnie w tym konkretnym konkursie jest plik z Wikipedii, tam ma >> w tej chwili giga chyba tak, >> gigabajty są tam i i trzeba to skompresować po prostu.
Taki jest konkurs, można wygrać pół miliona euro. >> I to polega na tym, że że wyszukuje się pewne rzeczy, pewne powtarzalne rzeczy w tym kodzie, pewne powtarzalne sekwencje zer i jedynek. Jeżeli one są takie same i się powtarzają, to po co pisać pisać kilka razy to samo. Wystarczy zapisać, że to się powtarza, że to dokładnie powtarza się ileś tam razy i to już jest kompresowanie. No tak. Jeżeli jesteś w stanie ten sam zbiór danych zapisać o wiele prostszy sposób, no to to jest kompresja.
Ale żeby to zrobić to musisz zrozumieć strukturę tego czegoś i rzeczywiście dostrzec analogię. >> No dobra. No czyli tak łączył kropki Albert Einstein i to by mogło oznaczać, że to co ja z czym ja obcuję pisząc sobie z czatem GPT to ja też obcuję z czymś co łączy kropki w pewnym sensie wyszukuje pewne analogie i w dodatku przewiduje prawdopodobieństwo wystąpienia kolejnych no tak jak w tych testach Ravena na przykład a czy to oznacza, że że to jest dokładnie bo powoli, bo bo ja sporo wysiłku w tej książce kładę na na to, żeby w jakiś w miarę sensowny sposób mówić, czy to z czym mamy do czynienia to w ogóle jest inteligencja.
No bo jest słuszne pytanie, czy to co nazywamy sztuczną inteligencją to w ogóle jest inteligencja. No niektórzy sobie kpią, że to nie jest żadna inteligencja. To to jest kwestia definicji. Oczywiście taka formalna definicja, że się studentów uczy programowania to się im mówi, że sztuczna inteligencja programu to jest taka jego kompetencja, która gdyby to robił człowiek, to by wymagała inteligencji. No więc przy takiej definicji to to Deep Blue, który ograł Kasparowa też jest inteligentny, no bo zrobił coś, co wymaga inteligencji od człowieka, >> tak? >> Y, ale to nie każdemu się taka definicja musi podobać i słusznie.
I pytanie, czy to co robią na przykład modele językowe, to jest rzeczywiście inteligencja? No bo można się kłócić. Chociaż to nie jest jedyna możliwa definicja inteligencji. Przecież Penros na przykład się upiera, że inteligencja wymaga świadomości i bez świadomości nie ma inteligencji. To jest możliwa inna definicja tego, co to jest inteligencja. Nie bardzo wiem, czy to coś pomaga w tej dyskusji, bo >> a czy peny mówi coś na temat tego, skoro próbuje wyjaśnić w pojęcie inteligencji, czy on mówi coś na temat tego czym jest świadomość, czy skoro to jest ten dodatek nie mówi.
Właśnie to jest trochę problem, że my nie wiemy co to jest, a przynajmniej nie wiemy jakie są warunki dostateczne, żeby się pojawiła świadomość. Niektóre warunki konieczne znam, ale do ostatecznych to wydaje mi się, że nie, chociaż są na ten temat różne tezy i prace. Niektórzy twierdzą, że oni wszystko rozumieją. Ja ja ja nie mogę tego powiedzieć o sobie. Natomiast no to jest możliwy punkt widzenia. Tylko, że zwracam uwagę, że y jak mnie goni na przykład lew na pustyni, no to rozwiązaniem tego problemu jest zauważenie na przykład, że y posłużenie się inteligencją nie w sensie samoświadomości, tylko połączenie kropek, że na przykład jeżeli zrobię to, to i to, to mam w stanie mam szansę wskoczyć na drzewo.
To, czy jestem samoświadomy, czy nie ma, jest drugorzędne. Jak pójdę na egzamin do firmy Google na rozmowę o pracę i się mnie ktoś zapyta, dlaczego wszystkie studzienki są okrągłe, a to jest jedno z pytań testowych na na o ile pamiętam na na jednym ze takich rozmów wstępnych. No to jakby mu odpowiem, że że no nie wiem czemu są okrągłe, ale jestem bardzo samoświadomy, to nie sądzę, żeby to kogoś z działu HR przekonało. >> Dlaczego są? >> No żeby nie wpadły do środka chyba głównie. do tego, nie, że kwadratowa by mogła wpaść do środka, a okrągła nie tak łatwo.
Yyy, więc y tego typu teraz ja nie wiem czy czy jest sens mówić, że to jest tylko to inteligencja albo nie jest i nawet nie sądzę, żeby ta dyskusja miała głęboki sens, bo kłócenie się o słowa jest drugorzędne. Natomiast zwracam uwagę, że umiejętność dostrzegania analogii jest bardzo ważną umiejętnością, którą warto wyodrębnić spośród innych rzeczy, które zrobi ludzki mój, bo to jej zawdzięczamy bardzo wiele. I oczywiście nasz ludzk mózg ludzki robi dużo więcej rzeczy niż tylko dostrzega analogię.
Jest szereg intuicji, jest, jesteśmy świadomi, odczuwamy, mamy poczucie celu, y, mamy uczucia. No jest wymieniać nieskończoność. mózg jest kompletnie inny niż tylko jest czymś dużo więcej niż tylko maszynką do strzelania analogii. >> Natomiast natomiast tak konkretna umiejętność jest na tyle ważna, że jeżeli zdefiniujemy sobie, że to nazywamy inteligencją po prostu, to tak zdefiniowana inteligencja ewidentnie jest cechą nie tylko modeli językowych, ale wszystkich sieci neuronowych, które są zbudowane w oparciu o dostrzeganie analogii.
Jak się spojrzy na na budowę sieci neuronowej, to przecież jedyne co ona robi, to ona tylko patrzy na analogię. Yyy, ja w książce o tym piszę te dwa rozdziały, o tym jak działa, nie wiem, na przykład mechanizm perceptrona czy sieci konwolucyjne, czy jakiekolwiek sieci neuronowe w zasadzie robią tylko to, dostrzegą analogiem. >> Mhm. >> I właśnie dzięki temu one są w stanie wyjść poza bazę swojej wiedzy w jakiś sposób. >> No właśnie. >> No tylko podam przykład, żeby wiadomo o czym mówię.
Cała idea sieci normalnych jest taka, żeby trenować na jakimś zbiorze treningowym. Na przykład nie wiem, chcę odróżniać zdjęcia pieski piesków od zdjęć kotków. robię taki klasyfikator binarny, jak to się to się mówi i trenuję na jakimś zbioze treningowym, a potem chcę, żeby jak pokażę takiej sieci zdjęcie nowego kotka, którego nie było w tym zbiorze, to żeby sieć się zorientowała, to jest kotek, a nie piesek. >> Tak. >> W jaki sposób?
No przecież tego konkretnego zdjęcia w tym zbiorze nie było, >> więc to nie jest tak, że ona tylko jest w stanie się ograniczać do tego, co dokładnie widziała. >> Tak. >> Ona jest w stanie dostrzec, że to jest kotek pod warunkiem, że ten kotek przypomina inne kotki, które widziała. >> Analogię. czy jest jakoś w jakiś sposób analogiczny i im im im bardziej to zdjęcie nowego kotka będzie inne od tego zbioru treningowego, tym mniejsza szansa, że że model poprawnie go sklasyfikuje. >> Więc cała idea sieci neuronowych bazuje na tym, że trenujemy w taki sposób, żeby na jakimś małym zbiorze treningowym je uczymy, a potem one są w stanie dostrzegać analogię z z rzeczami, w których tych zbiorzeń nie było. >> Mhm.
Swoją drogą dokładnie tak samo się trenuje nie tylko sieci normow studentów. Jak mam egzamin z mechaniki, wykład z mechaniki kwantowej, na których uczę studenta, na przykład jakiś zagadnień z mechaniki kwantowej, jest zbiór problemów, które chcę, żeby umiał rozwiązywać i pokazuje te problemy, to na egzaminie knakologwium student przychodzi i dostaje zadanie, które jest podobne albo nawet czasem takie same, albo trochę zmodyfikowane i jeśli jeśli się uczy, to je będzie w stanie rozwiązać, bo nauczył się tych technik rozwiązywania i jest w stanie albo takie zadania rozwiązać, albo analogiczne, stosując analogiczną metodę.
Gdybym na egzaminie dał studentowi zadanie kompletnie inne z innego działu, które nijak nie przypomina materiału z wykładu, >> nie znalazłby analogii. >> Jaka jest szansa, że że student to nie rozwiąże? No więc oczywiście ona spada i im bardziej coś się różni od tego, co widzieliśmy w naszym treningu, tym jest naturalne, że będziemy coraz gorzej sobie z tym radzić. >> Mhm. >> I w tym sensie inteligencja jako dostrzegania analogii to jest takie narzędzie, które nam pozwala używać naszych doświadczeń, które mamy w rzeczywistości, które ileś tam lat się uczyliśmy różnych rzeczy.
I potem lądujemy w prawdziwym życiu i zdarza się nowa sytuacja, ale jeżeli dostrzegamy analogię, to będziemy z w stanie poradzić i się zaadaptować. Więc te lety zaczną się teraz łączyć. >> Ale jak się to ma do czegoś takiego, o czym opis, o czym piszesz w książce, do Alfa Go. Yyy, Alfa Go, które wygrało w grę dużo bardziej skomplikowaną i dużo trudniejszą niż w szachy z człowiekiem. 4:1 w tym słynnym meczu, jeśli dobrze pamiętam.
Tak, 4:1. Okej. To było jakoś tam nauczone, trenowane, nauczyło się i wygrało z człowiekiem. Ale był potem model Alfa Go 0. Czym się różniło Alfa Go 0 od Alfa Go do pewnego jednak załadowania pewnych danych i do braku tego? No więc to jest ciekawa historia, dlatego że w ogóle wszystko zaczęło się od Richarda Satona między innymi od od twórcy czegoś co się nazywa uczenie przez wzmocnienie i to jest taki taki człowiek, który od dawna ma piękną ideę, że trening sztucznej inteligencji powinien się odbywać nie poprzez naukę imitacji, tylko poprzez obserwację rzeczywistości, wyciągania wniosków I y y tak trening przez wzmocnienie to jest y nazwa tego tej techniki treningowej, w której sieć neuronowal jakikolwiek inny układ wykonuje jakieś zadania i dostaje informację zwrotną czy efekt jest dobry czy nie.
I na podstawie tej informacji zwrotnej jest w jaki sposób się automodyfikuje i yyy w taki sposób, żeby maksymalizować szansę, żeby nagroda była jak największa, czyli żeby było jak najbardziej zachęcane yyy w przypadku yyy i teraz Demis Hasabis i i jest autorem współautorem tego programu Alpha Go, ale przed nim były też inne programy do grania w różne inne gry, w którym po raz pierwszy udało się w sposób skuteczny zaadaptować ideę uczenia przez wzmocnienia do takiego spektakular programu, który na przykład gra w grę Go.
I teraz ten trening był taki, że na początku sieć była trenowana na podstawie dużej liczby gier wykonanych przez ludzi i w pewnym sensie uczyła się imitować ludzi i to nie jest to, co chciał zrobić. >> Jasne. To była pewna wielka olbrzymia baza, którą załadowano >> i to trochę tak, że że taka sieć na tym etapie grała jak taki przeciętny gracz w tę grę. Trochę tak jak wczesne modele językowe GPT3 czy GPT4, które uczyły się imitować teksty z internetu i one w zasadzie nie robiły nic więcej poza imitowaniem tekstów z internetu i imitowań.
No jeśli tam właśnie to była pewna forma imitacji ludzi i i Demis Hasabi zauważa, że gdyby na tym poprzestać, czy gdyby mieć tylko taki model, który przewiduje ruchy imitując styl gry przeciętnego grę w GO, to to tak jak CG GBT 4 nie ma się spodziewać, żeby coś takiego stworzyło tory względności. >> Znaczy będzie niezłe, ale nie będzie wybitne. Nie wygra z arcymistrzem. >> Tak, oczywiście. Natomiast oni na tym nie poprzestali i zaczęli dotrenowywać ten program w taki sposób, żeby on od tego poziomu zaczął grać sam ze sobą i poprzez wzmocnienie strategii, które prowadzą do zwycięstwa, a osłabianie tych, które prowadzą do przegranych w formie drzew decyzyjnych i to trochę bardziej szczegółowo opisuje w książcehm >> y i algorytmów takich drzewowych Monte Carlo y i dwóch trzeci neuronowych, które były odpowiedzialne za ewaluację i i przewidywanie ruchów.
Cześć grając sama ze sobą zaczęła poprawiać swój swoje swoje umiejętności i dopiero ten trening umożliwił przebicie poziomu mistrza świata i ogrania go w tym pojedynku. To zresztą w pięknym stylu, bo, bo to słynne posunięcie numer 37 w drugim dniu pojedynku, gdzie ruch, który wydała się kompletnym błędem i i na początku nawet twórcy tego programu myśleli, że to jest jakiś jakiś jakaś pomyłka, okazał się niezwykle kreatywnym, wyjątkowo ciekawym posunięciem, na które żaden człowiek nie wpadł.
Właśnie >> arcymism musiał być na papierosa. Znaczy on wyszedł na papierosa i jak wrócił zobaczył ten ruch to to tam jest piękno dokumentowane jak zbiór jego reakcji jakie >> miny które >> tak tak jak to najpierw mus to jest coś głupiego, potem że w ogóle coś bez sensu a potem dopiero do niego dotarło z tym mam do czynienia to posunięcie zostało przeszło do historii niektórzy to nazywają boskim posunięciem ruch 37 który jest takim symbolicznym momentem w którym sztuczna inteligencja pokazał że potrafi zrobić coś wyjątkowo pięknego, kreatywnego, czego nie było w >> w żadnej bazie no bo tam nawet jest prawdopodobieństwo wykonania tego ruchu przez człowieka jest niezwykle niskie.
Tam jeden do nie pamiętam miliona czy 100 000. >> Tak. Tak. I i oczywiście to był początek te tej tej całej ery uczenia przez mocny, nie? Nowa generacja tych programów, czyli Alfa Zero. >> No właśnie. Czym to się różni? Opowiedz teraz. >> No to w zasadzie jest bardzo podobny mechanizm, tylko że zaczynamy bez trenowania na bazie ludzkich gier. Pół roku później bodajże powstał ten program, w którym y sieć w ogóle nie wiedziała jak się gra, nie znała, mogła znać reguły gry, ale też nawet to nie było potrzebne, bo i bez tego można byłoby sobie poradzić.
Ale generalnie znała reguły stawiania pionków na czy to szachy, czy czy go, czy jakaś inna gra i tylko tyle. >> I grała sama ze sobą wiele razy i była wzmacniana funkcja nagrody zależała od tego, czy wygrywa, czy przegrywa. >> Znaczy musiała wiedzieć też na czym polega zwycięstwo w tej grze w >> Tak. I to jest to zewnętrzne kryterium, które musiało być >> jedno z niewielu, >> no w zasadzie jedyne można było nawet te yyy te taki grania, takie programy do grania w szachy trenować nawet w taki sposób, że nie, one na początku nie wiedzą jakie są prawidłowe ruchy, tylko trzeba by wtedy eliminować na przykład ogłaszać przegraną w momencie jak na przykład y silnik taki, tak jak program szachowy robi krzyzłe ruchy pod ją albo >> Tak, tak, tak.
Ale wystarczyłoby, żeby taki silnik wiedział na czym polega zwycięstwo w tej grze, >> jakie są, jaka jest, jak jaka jest fizyka świata. >> Tym światem jest, jest >> szachownica. >> Szachownica, która ma 64 pola >> i już i >> a ewolucja dzieje się sama niejako. >> No program uczył się grać grając sam ze sobą i usprawniał się. I to było spektakularne, bo po 40 minutach takiego treningu programskiwał poziom wyczynim spotom mistrza świata.
Po cterech godzinach treningu tego tego programu szachowego Alfa Zero zgan czterech czy ośmiu nie pamiętam pracuje się po cter godzinach on mniej więcej uzyskał poziom Stockfisha 8 ale po chyba po dwięciu godzinach takiego treningu skonfrontowano ze Stockfisem >> czyli zem już >> najlepszym ówczesnym silnikiem szachowym jak jest konkretnie sza >> do szachów zaprogramowany przez ludzi i stok został zdemolowany tam było chyba 27 zwycięstw zero porażek i i nie pamiętam kompletna demolka model, który się sam od siebie nauczył w pewnym sensie, któremu nie załadowano milionów cudownych rozgrywek szachowych i się nie nauczył od człowieka.
No to to jest ten przeskok, >> to jest ważne. On się nauczył sam sam ze sobą grając. No człowiek to jest jakby odgrywa ważną rolę, no bo musiał sformułować odpowiednie warunki do tej gry, do tego treningu, ale ale od tego momentu trening był w dużym stopniu autonomiczny i y co ciekawe współcześ to to nie jest szokujące, że ludzie przegrywają w szachy czy w go czy w inne gry z tymi silnikami. No bo w szłusznie można słusznie zauważyć, że przecież ludzie nie potrafią aż tylu operacji na sekundę wykonywać w swojej głowie.
Tak, >> Stockfis 8 na przykład robił 70 milionów operacji na sekundę, a człowiek dobry, znaczy mistr świata to nie jest w stanie zrobić więcej niż 100 ruchów w ciągu 10 minut przeanalizować pewnie to zbyt trudne, >> więc byliśmy rozwalani nawet zwykłą siłą walca drogowego po prostu i liczbą operacji. Natomiast to chodzi o to, chodzi o to, że my nie tylko przegrywamy z takim Alfa Zero, które się nauczyło grać autonomicznie, my nie nie jesteśmy w stanie napisać programu komputerowego klasycznymi technikami programistycznymi, gdzie programujemy jak ewaluujemy pożycem zachownicy, jak przewidywać ruchy, w jaki sposób mieć legamy drzewowe, który by wygrał z Alfa Zero.
Stockwisz został zdemolowany i to był koniec w zasadzie tradycyjnych silników szachowych. Stokwisz chyba, o ile pamiętam, od 16 wersji w górę już jest w całości oparty wyłącznie na sieciach neuronowych. Tam nie ma jakichkolwiek elementów ludzkiej ewaluacji, nie ma programów zaprogramowanych przez ludzi do przewidywania algorytmów tego, które człowiek zaprojektował, bo po prostu nasze pomysły są słabe i Alfa Zero wygrał nie ze Stockfiszem ilością obliczeń. >> Mhm.
Bo obliczał nie ma takich zdolności. >> Nie, nie, znaczy pewnie mógłby mieć, ale ale o ile Stockfisz robił 70 milionów operacji na sekundę, to Alfa Zero robił, ja pamiętam 60 000. o trzy rzędne wielkości mniej i to wystarczyło w zupełności. Po prostu lepiej wybierał ruchy, >> nie? Niesamowite. I teraz to jest oczywiście prosta gra yyy w szachy. Yyy oprócz tego mamy modele językowe, które są nauczone imitacji tekstów z internetu i wykazują pewne ciekawe umiejętności i o których ja tam piszę łączenia kropek i nawet są w stanie rozwiązywać proste zadania logiczne.
Czasem nie takie proste, ale właśnie przy bardziej złożonych się wywalają. szczególnie przy takich, które nie przypominają zadań treningowych. Więc ta dostrzeganie analogii jest w jakimś zakresie, ale jest niewielkie. to one interpolują pomiędzy różnymi problemami, ale nie są w stanie wyjść daleko poza ten ten zbiór. No i teraz jest pytanie, czy jesteśmy w stanie wdrożyć te techniki uczenia przez wzmocnienie do na przykład modeli językowych, >> żeby douczać je później nowych rzeczy i no to jest demis Hasabis, który dostał zresztą Nagodbla z chemii, myślałem dostanie z medycyny za program komputerowy Alpa Fold, >> który synteza Białek tak >> on zrobili program do przewidywania jaka jest trójwymiarowa Białek na podstawie ciągu aminokwasu.
To jeden z najważniejszych problemów biologii molekularnej, z którymi nikt nie potrafi sobie dobrze poradzić systematycznie, >> który został niejako rozwiązany. Czy czy on zaproponował narzędzie, czy skonzurował narzędzie, nie mając nic wspólnego, nie jest z żadnym biologiem molekularnym, a z tej dziedziny dostał nagrodę Nobla. No wszystko się robi interdyscyplinarne. No Jeffrey Hinton, czyli ojciec chrzestny uczenia maszynowego czy głębokiej sieci raczej dostał nagrodę Nobla za algorytm propagacji wstecznej, który rozpropagował czy od współ znaczy odkrył po raz kolejny zresztą dla dla tej branży.
Jest on twórcą pierwszych modeli językowych. jest y jemu zawdzięczamy w ogóle zainteresowanie głębokimi sieciami jemu i Janowi Lekunowi, ale algorytm propagacji seszej to jest algorytm trenowania sieci neuronowych. Zresztą bardzo proste, bo jak się wejne studenta fizyki to można to wytłumaczyć w 20 minut o co tu chodzi. Y i na tym wśraża dostał nagrodę z fizyki. >> Jasne. >> Więc to trochę się nieki. Wracając do tego, czy da się to zaimplementować te ten model do do >> właśnie no właśnie.
Ci ludzie z Deep Mind wykonali wiele pracy, żeby pokazać, że to jest do zrobienia. I pierwsze prace takie bardzo przełomowe pojawiły się w 2024 roku, półtora roku temu, w której wytrenowano inny model zupełnie do rozwiązania zadań z matematyki, a konkretnie z geometrii dwuwymiarowej. >> Ten program się nazywał alfa geometry i on jego zadaniem było właśnie rozwiązania z geometrii dwymiarowej na bardzo wysokim poziomie, na poziomie międzynarodowej olimpiady matematycznej.
I najciekawsze było po pierwsze to, że on był w stanie uzyskać poziom mniej więcej srebrnego medalisty, rozwiązując bardzo trudne z geometry, z którymi ja na pewno miałm poważne kłopoty, o ile w ogóle bym dał rady je rozwiązać. Są bardzo trudne zadania, no na poziomie szkoły średniej, ale mimo wszystko wymagające pomysłowości i to są oryginalne problemy, których nie ma w żadnej bazie zadań, bo tak się wybiera zadanie olimpiady, że one muszą być oryginalne.
Wiem, bo wiele lat sam >> na przykład to, >> na przykład tam jest takie zadanie, zresztąki w teksty >> i będzie jest widać. >> Ja przez wiele lat układałem zadanie na olimpiady z fizyki i pierwsze zasadnicze kryterium jest takie, że że nie może to zadanie być znane w jakimkolwiek zbiorze w podręczniku, w książce. To musi być inne. >> To musi być wymyślone po prostu. Znaczy zadanie na olimpiadę musi być wymyślone. >> Bo testujemy umiejętność myślenia, a nie te umiejętność recytowania, >> tak z pamięci jak papuga.
No więc pytanie czy więc okazuje się, że ten model alfa geometry był w stanie takie zanie rozwiązywać i najciekawsze jest to, że on uczył się nie studiując podręczniki, imitując styl rozwiązywania zadań z podręczników, >> tylko on w ogóle nie miał żadnych danych treningowych od człowieka, zero. >> Yyy, on uczył się na tak zwanych danych syntetycznych, które sobie sam wygenerował. Znaczy wygenerowano najpierw mniej więcej 100 milionu mniej lub bardziej losowych układów figur geometrycznych i Alfag Geometry uczył się przewidywania tych prawidłowości geometrycznych na tym zbiorze odgadując prawa geometrii.
Czyli generalnie poprzez wymyślanie sobie swoich własnych zadań nauczył się zadań praw geometrycznych na takim poziomie, że był w stanie później rozwiązywać zadania z olimpiady na tym dostając srebrny wiedol. I to jest oczywiście przełom. To nie jest, to jest jeszcze bardzo daleko od tego, gdzie sobie wyobrażamy, że tam może zdaść ta technologia, ale to jest taki wyłom w tej skal. Yyy, y jak jest widzimy pierwsze pęknięcie, to no łatwo sobie wyobrazić, co przy takim parciu na na rozwalenie tej skały się >> stanie za chwilę.
Tak. I oczywiście stało się za chwilę bardzo dużo. Po pierwsze te modele do zadań z matematyki zostały ulepszone. Już teraz mam jesteśmy na poziomie złotego medalu, ale >> czyli wygrywa olimpiadę matematyczną ten model. >> Z wygrywaniem to jeszcze nie do końca, dlatego że złoty medal to tych złotych medali tam jest trochę. Ale na przykład rok, rok później, czyli w tym roku pojawiły się dwa modele językowe. O5, czyli taki eksperymentalny model filmu Open AI i Gemini 2,5, taki trochę dosterydowany, żeby mieć dużo więcej czasu na inferencje.
I one były dotrenowywane właśnie w trzeciej fazie treningu. Y, to może warto powiedzieć, jak jest, jak się trenuje modele językowe. W ogóle trochę o tym w krzące piszę. Yyy, no bo te klasyczne modele językowe, takie sprzed roku, to były modele, które były trenowane do y przewidywania słów w tekstach napisanych przez ludzi i one były trenowane w zasadzie na całym internecie i one dobrze imitowały teksty z internetu. >> No bo no właśnie świetnie znały tą wielką bazę, bo tak trenowano w sensie wrzucono po prostu mnóstwo tekstów, co prawie cały internet i one sobie przeczytały te teksty. >> Nie, prawie chyba chyba cały >> cały internet.
Damy nie są otwarte, więc to można się domyślać, ale ale są sprytne testy, żeby sprawdzić na czym te modele były trenowane trochę przykład jak to robi >> różne zagadki tutaj podajesz tak >> tylko taki model ma tą wadę że on słaby nadaje się słabo do konwersacji z ludźmi no bo on będzie kontynuował dowolny tekst jak się na przykład go zapytam jaka jest teraz pogoda to on może na przykład kontynuować ten tekst mówiąc zapytał chłopiec patrząc w niebo i jak nie o to mi chodzi jak się pytam jaka spogd chcę zć odpowiedź i motyle były dotrenowywane. druga faza treningu, gdzie firmy zatrudniły dużą liczbę redaktorów, którzy pisali przykładowe dialogi.
Tam się pojawiły nowe formy jeszcze takich symboli, które na przykład oznaczały kiedy skończyć konwersację, kiedy zacząć, jakieś takie dodatkowe, tak się mówi tokeny, które doinformowywały od douzały go nowych nowych umiejętności. Na przykład kiedy, jak długo gadać w ogóle, bo bez tego to maty gad nieskończoność. tokeny, czyli fragmenty słów z lepki liter. >> Z lepki liter. Takie takie takie tak zmatematyzowane formy językowe, których używają te modele.
No i generalnie to był taki taki etap, na którym ludzie douczali modele jak się konwersuje i jest bardzo ciekawa praca z Open która szczegółowo opisuje tym redaktorom, którzy te pisali jakimi kryteriami się stosować, jak dokładnie yyy te teksty tworzyć, jakie powinny spełniać reguły, co robić, czego nie robić, żeby generalnie te modele sformatować do odpowiedniego stylu konwersacji. No ale to były nadal modele, które imitowały już nie tylko teksty z internetu, ale teksty tych redaktorów.
I wśród tych tekstów były też problemy logiczne. I dzięki temu, że modele językowe są w stanie imitować takie umiejętności, się okazuje, że one nie tylko rozwiązują dokładnie te zadania, które były w bazie treningu, ale też trochę podobne, więc nieco wychodzą poza tą bazę treningową w przeciwieństwie do papugi, która jest w stanie tylko wyrecytować dokładnie to, co usłyszała. ta elastyczność sztucnej inteligencji tych tych sieci neuronowych pozwala na wyjście nieco poza ten zbiór treningowy.
No ale to jest nadal w poważnym sposób ograniczone. Mhm. >> wyścig, który od kilku lat trwa i to jak na przykład okazuje się, że czy okazuje się cały masterpl czy jeden z elementów tego masterplanu firmy Open AI to był taki, żeby najpierw trenować ile się da na tych danych, które się da ukraść z internetu, pożyczyć, a potem przejść do fazy uczenia przez wzmocnienie. To Ilia Skever to od samego początku miał właśnie taką wizję, czyli doktorant Jeffre Hintona.
Dzisiaj go w firmie już nie ma. >> Nie ma go w firmie z różnych powodów. Ciekawa historia, >> ale w każdym razie to była druga faza treningu. No i teraz udało się wreszcie stworzyć przejść do tej trzeciej fazy treningu, gdy trenuje się modele rozumujące, tak zwane, >> które co do architektury to już jest kolejny krok naprzód. To już nie są zwykłe transformery. Ta architektura tych modeli jest jest zdecydowanie inna. Przede wszystkim one rozwiązują szereg nie wszystkie. znie nie wszystkie, ale dużą część ograniczeń z tych starszych modeli yyy i i w pewnym sensie przekraczają na przykład robiąc to, że są w stanie decydować jak długo warto myśleć nad danym problemem.
I okazuje się, że jakość, znaczy długość obliczania tych kolejnych słów przy przewidywaniu tego tekstu ma kolosalne znaczenie i wpływ na to, jak dobrze one będą przewidywane. To jest te prawa skalowania wskazują, że mniej więcej logarytmicznie z ilością obliczeń skaluje się jakość udzielnych odpowiedzi. Więc jak się weźmie model, który myślę myśli 100 razy dłużej, to ma szansę dać 10 razy większą odpowiedź, 10 razy lepszą odpowiedź.
Yyy i rzeczywiście to jest prawda, że te modele yyy rozumujące y te darmowe, które myślą krótko, dają o wiele gorsze odpowiedzi niż te, które myślą dużo dłużej >> myślą. To jest oczywiście metafora znowu. No w każdym razie y treningiem przez wzmocnienie, w którym to też jest nie do końca tych technik ucenia przez jest bardzo dużo i ja na ten temat uwielbiam rozmawiać z Rkiem Kinasem, który jest naszym polskim wybitnym specjalistą od tego w prieniu paru tysięcy kilometrów pewnie nie ma nikogo mądrzejszego, który się na tym lepiej zna.
Polecamy państwu model Bielika Bielika i ja. Jeśli macie >> właśnie polski model rozumujący Bielik to jest przykład modelu, który jest takim modelem rozumującym i grupa Bielik nie ma takich zasobów jak open AI, żeby to trenować w na takich ilościach mocy przerobowych y y co w Kalifornii, ale ale nawet mały model można trenować w ten sposób ucząc się w pewien sposób jak trenować taki model do rozumowania. I te modele na przykład dostają zadanie z matematyki i wiadomo jaka jest odpowiedź i one mają tą odpowiedź przewidzieć i nikt nie mówi jak mamy to robić.
Modele generują sobie tekst bez sensu i potem wszystko się powtarza, aż wreszcie jeżeli mamy odpowiednie szczęście to model jest w stanie dać dobrą odpowiedź i tekst, który doprowadzi do tej odpowiedzi jest często bardzo bełkotliwy, ale w jakiś sposób do niej prowadzi. I model jest uczony imitowania tego tekstu, który sobie sam wymyślił. I za każdym razem jak dostaje dobrą odpowiedź to wzmacniamy rozumowanie, które do niego doprowadziło, a osłabiamy te rozumowania, które podą do złej odpowiedzi.
I w ten sposób okazuje się, że model jest coraz lepszy w zdania z matematyki. Tak jak alfa geometry, które też zgadywało trochę te prawa geometrii, aż wreszcie udało się zgadnąć. I i po pierwsze te modele jedno co robią to wychodzą poza bazę wiedzy dostarczą przez człowieka, bo one w ten sposób mają szansę odkryć w treningu nowe sposoby uprawiania matematyki, >> co rzeczywiście zaczyna działać >> w jakimś tam raczkującym na razie zakresie.
I po drugie, no ta ta baza już nie jest, to już nie jest tylko imitowanie człowieka, więc jest szansa na coś na kształt ruchu 37 być może w przyszłości, a nie wiem czy być może, ale ale tego się należy spodziewać. I efekt jest taki, że te rozumujące modele, jeszcze takie bardziej wypasione wersje, które mają dużo czasu na inferencję, czyli dostaje się na przykład na 10 godzin myślenia, a nie na 30 sekund, dwa z tych modeli zdobyły złoty medal na olimpiadzie matematycznej w tym w tym roku.
Nie wygrały tej olimpiady jeszcze. rozwijały pięć sześciu zadań oba i wywaliły się na zadaniu z kombinatoryki, które zresztą kilku ludzi rozwiązało, więc jeszcze jesteśmy tutaj górą. Ale to już jest niezwykle ciekawe, że modele, te rozumujące modele, które były dotrenowywane uczeniem przez wzmocnienie, zaczynają rozwiązywać zadania z matematyki na tym poziomie. I jeszcze jedna ciekawostka. Po raz pierwszy chyba było bardzo ciekawe, że model Jimny rozwiązując najtrudniejsze zadanie z kominatoryki nie podał odpowiedzi, to znaczy nie wiedział jak je rozwiązać, ale zamiast halucynować podał odpowiedź, że nie wieem jak to rozwiązać po wielu godzinach myślenia.
Więc jest pytanie, czy jesteśmy w stanie w jakiś sposób zmierzać w stronę ograniczania halucynowania, bo to jest jeden z poważnych problemów tych modeli językowych i >> czyli wymyślania ściemniany. >> No tak, tego, że te modele jak nie wiedzą co odpowiedzieć, to gadają bzdur. Jest na dużo prac bardzo ciekawych. Andrej Karpaty, szef Tesli, ostatnio mówił o tym, że być może jest jakaś szansa na na ograniczenie jego problemu.
I była niedawno inna praca pokazująca, że halucynacja jest prawdopodobnie efektem źle dobranego, źle dobranej funkcji celu, czyli źle wybranego kryterium, za co nagradzamy modele i efektywnie im się opłaca halucynować, żeby zadowolić, znaczy zminimalizować funkcję błędu. Yyy, są też inne prace pokazujące, że yyy jest taka taka yyy się pojawia opłaca yyy polskiego szefa działu Samsunga, że być może yyy halucynacja jest fundamentalnym problemem, którego się nigdy nie będzie dało >> Mhm. >> rozwiązać i że że to jest nie do usunięcia w tych architekturach, których używamy. >> A coś wiemy na temat ewentualnego czwartego kroku uczenia, czy na razie się zamykamy w listopadzie 2025 na tych trzech?
Czy czy co? No ty Łukasz Kaiser, który jest z Polakiem pracującym w Open AI, który jest jednym z twórcą tej technologii, zresztą jest twórcą w ogóle idei transformera, tej architektury podstawowej, która była używana w tych starych modelach językowych, y, on jest zdania, że Transformery już można dalej skalować, można usprawniać ich ich kompetencje, ale to to skalowanie rzeczywiście coraz wolniejsze. Natomiast jeśli chodzi o moly rozumujące, czyli te, które się uczą przez mocnienie, to dopiero zaczynamy i ta krzywa wzrostu jest wciąż bardzo mocno nachylona, więc jest szansa, że ten trening jeszcze nas daleko doprowadzi.
A już efekty są naprawdę zaskakujące, bo ja mówiłem o olimpiadach z matematyki, z drugiej strony są inne benchmarki i jest na mnie największe wrażenie robi taki benchmark, to się nazywa Frontier MAF. To jest zbiór problemów matematycznych, które zostały wymyślone przez zawodowych matematyków, profesorów z różnych dziedzin. Między innymi Bartosz Naskręcki z UAMU, mój kolega jest jednym z autorów tych tych tych programów tych tych tych zadań z matematyki i to są niezwykle ciekawe oryginalne problemy, które są wymyślone po to, żeby pokazać jak głupie mamy modele językowe, jak one niewiele potrafią.
Taka była oryginalna intencja i to miały być problemy, które jeszcze przez wiele lat, może dekad nawet nie będą rozwiązane. Yyy, wybitny matematyk Teren Stao powiedział, że jak testował na sobie te problemy, to to te z teorii Litw mu się udało rozwiązać, ale te pozostałe to nawet nie jak się zabrać, ale przynajmniej wie kogo zapytać, bo to jest generalnie cała matematyka bardzo abstrakcyjna. I Bartosz mówi, że że dla os dla zawodowego matematyka z doktoratem jeśli się specjalizuje w tej dziedzinie, z której jest dane zadanie, to rozwiązanie wymaga pewnie wielu godzin myślenia.
Od kogoś kto jest tylko matematykiem w ogóle z doktoratem, ale jest w jakiejś ogólnej dziedzinie tylko zbliżonej, to jest często tygodnie albo miesiące myślenia. Te zadania są tak skonstruowane, żeby by nie było ich żadnych podręcznikach, żeby były oryginalne. Wymagały szeroku różnych różnych pomysłów i wynik liczbowy jest bardzo trudny do zgadnięcia. To są jakieś takie wynik typu trzeba podać kilkanaście cyfr na przykład i zgadnięcie tego jest niemożliwe.
I okazuje się, że te modele rozumujące w przeciwieństwie do tych starszych generacji zaczynają te zadania rozwiązywać. Oficjalne dane są takie, że rozwiązane zostało 6 z 50 zadań. Wiem, że tych zadań już jest więcej rozwiązanych i ta liczba wszystkich zaskakuje, bo nikt się tego nie spodziewał, że to tylko przewidywanie następnego słowa w tekście, bo nawet te rozumujące module przecież robią tylko to, na tylko przewidują słowo w tekście i one są przecież, jak wiemy z stwierdzenia aproksymacyjnego, tylko funkcją matematyczną.
Ta tylko funkcja matematyczna jest w stanie radzić sobie z zadaniem z matematyki, z którymi kłopot mają ludzie i to na bardzo wokim poziomie. Yyy, więc i dopiero zaczynamy. Przecież ta technologia modeli rozumujących powstała rok temu. >> No to powiedz trochę yyy co ja laik yyy znaczy z z jak z jakimi modelami musiałbym obcować, żeby trafić na ten model rozumujący, a jakie modele, które ja znam, są tymi modelami z poprzedniej epoki?
To co można myć jakie są etykiety? Oczywiś tutaj o Gemy Kight 2,5, tak? wszystkie wszystkie modele, które y na odpowiedzią myślą trochę dłużej i uzależniają odpowiedź, czas odpowiedzi na od tego o co zapytałeś, to są te tak zwane modele rozumujące i możesz y na przykład przymusić model jeżeli odpowiedni zapłacisz jeszcze, żeby on myślał dłużej. No i to myślenie dłużej, czy myślenie to jest oczywiście, żeby się jakoś komuś się nie podoba, to może sobie zastąpi to słowo czymś innym. y inferencja trwa y jeżeli trwa dłużej to to sprzyja koreluje się z lepszymi wynikami. >> Ale to są modele dostępne w tej chwili publicznie. >> Tak.
Tak. To GPT5 na przykład to jest taki router. To jest bardzo wiele różnych modeli i on dostaje pytanie i ocenia czy to pytanie warto rozwiązać prostym modelem, który gada od razu, czy trzeba oddelegować go do modelu, który dłużej. Śmieszne jest to, że że wszystkie te modele mają z jednej strony umiejętność rozwiązania zaskakująco trudnych problemów czasami, ale z drugiej strony mają tyle ograniczeń i tyle w tylu miejscach się ciągle mylą w spektakularny sposób i ja w książce podaję bardzo wiele przykładów jak takie modele wypuścić w pole, jak jak co zrobić, żeby gdał głupoty, że to ciągle pokazuje, że to jest zupełnie inny rodzaj y y generowania tekstu że to robią ludzie.
Y, bo z jednej strony te modele są dużo lepsze od ludzi w niektórych zadaniach z matematyki, przynajmniej od przeciętych ludzi, nie od wszystkich. Ale z drugiej strony jak się weźmie jakąś zwykłą zagadkę logiczną, najprostszą nawet i trochę ją zmodyfikuje, to model przez przetrenowanie na tej zagadce, czyli przez to, że ona się znalazła wiele razy w danych treningowych, nie zauważa tej różnicy i zaczyna odpowiadać na nie tą zagadkę, która, którą zadałem.
Ale jednocześnie w tej książce pokazujesz, że przy takim samym problemie, przy takiej zagadce właśnie jak go tam sprostować i naprowadzić, powiedzieć, napisać przyjrzyj się jeszcze raz dokładnie to on rozumie sugestie i to właśnie tak to właśnie to pokazuje, że że jeżeli >> i że to jest że to, że on się myli jest cenniejsze od tego, że strzela od razu bez pomyłki. No w pewnym sensie dużo ja się staram w tej książce pokazać przykładów, nie takich, których model robi coś spektakularnego, bo to już się to opatrzyło.
Wszyscy wiemy, że że te modele potrafią robić coś fajnego, jak się jak mają szczęście, ale też robią często błędy i to z tych błędów można się o wiele więcej dowiedzieć na temat tego, co one robią. w szczególności te te błędy dostarczają odpowiedzi, czy te modele recytują, czy one rozumują, czy rzeczywiście są papugi, czy też one są zdolne do kreatywności, czy na przykład model jest fundamentalnie ograniczony danymi, które dostarczy i człowiek, czy też jest w stanie zrobić coś, coś co za to wychodzi.
To to nie jest kwestia opinii. Nie przypadam z opiniami w tych dyskusjach, a już teraz każdy ma trochę opinię w tej sprawie i się z tego zrobił temat polityczny i światpoglądowy. Ja staram się w całej tej książce unikać opinii i raczej pokazywać różne punkty widzenia, a potem sprawdzać. No okej, ktoś uważa, że to jest papuga i że to jest tylko statystyka słów y i nic więcej. Korelacja między słowami. No to świetnie. To sprawdźmy to.
Weźmy na przykład zadanie, które jest rane ze słów, które nie istnieją. Y, no bo jeżeli model jedyne co wie to tylko patrzeć na korelację między słowami, które znał w tekście, no to ja napiszę tekst, który se wymyślę słowa i zobaczymy co się stanie. I i wolę takie podejście od od podejścia, gdzie przychodzi człowiek i i ma opinię, bo to jest problem taki, że nawet twórcy tej technologii, czyli nawet Jan Lecoun i Jeffrey Hinton, czyli najwybitniejsi przedstawiciele tej tej branży się kompletnie ze sobą nie zgadzają. >> Tak.
No ten pierwszy pokazujesz w tej książce jak ten pierwszy ile razy ten pierwszy w jak bardzo ważnych stwierdzeniach się mylił. >> No mylić się rzeczą ludzką, a też się mylił, więc to nie jest żadna ułomność. To świadczy o tym, że jest odważny też. Ale i rzeczywiście Jan Lekun miał wiele predykcji, które się okazywały wkrótce nieprawdziwe. Zaczynając od tego Alfago, w którym mam Mustafa Sulejman, obecny tam szef Microsoftu, AI w Microsoftcie, a wcześniej współtwórca firmy Deep Mind, która jest odpowiedzialna za >> Alpha Go, >> on opisuje w swojej książce Nadchodząca fala, co tam się działo w kulicach i w szczególności wspomina o Janie Lekunie tylko raz w tej książce właśnie na okoliczność tego, że on kpił sobie z z Deep Mind mówiąc, że nie ma szans, żeby ten program wygrał z człowiekiem, >> a potem powiedział drwiąc z nazwy, że może teraz bet >> No tak.
No on oczywiście ma ma wyraziste opinie i i jest kąśliwy trochę. Tym bardziej, że wszy cała jego inwestycja życiowa polega na tym, żeby on on inwestował w rozpoznawanie obrazów. Jego największym sukcesem, który dał mu jakby nieśmiertelność w tej w tej w tej całej w tej całej zabawie. Mhm. >> Y on y on skonstruował sieczy konwolucyjne do rozpoznawania obrazów. To historia dokładnie jest taka, że Torsten Wizel, jeśli pamiętam, taki naukowiec badający korę wzrokową kotów i małb zauważył, że w korze wzrokowej tropki wzrokowe są nie tylko odpowiedzialne za rozpoznawanie światła, ale też do rozpoznania struktur, że tam są jakieś takie struktury neuronalne, które rozpoznawają kształty, krawędzie, punkty.
I teraz przepraszam od razu wszystkich, którzy którzy uznają, że to za bardzo upraszczam, ale ale nie jestem tutaj niespecjalnie. Znam to tylko z zainteresowania, nie >> sytuacji naukowej. W każdym razie y za to został nagrodę LBla w 81 roku bodajże za odkrycia, że w korze wzrokowej są czy nie wiem czy w każdym razie takie badania prowadził więc to pokazało, że w korze wzrokowej oko rozpoznaje struktury. Teraz tak następny był Fukushima, Kunichiko Fukushima już pamiętam, który w 80 roku napisał pracę jak stworzyć sieć neuronową, która będzie takie struktury rozpoznawała.
I to się nazywa konwolucyjne sieci neuronowe. I to są takie bardzo proste sieci, w których yyy yyy sieć przeszukuje w obrazach jakiś struktur. Yyy konwolucja na tym polega, że że że skanujemy sobie obraz w poszukiu jakiejś struktury takiej albo innej. I sieć tak sama decydowała, jakich struktur będzie poszukiwała. W wyniku treningu ona była przez spadek gradientu i propagomą, której Hinton, którą Hintton odkrył. Taka sieć była w stanie przeszukiwać yyy yyy obrazy w poszkaniu jakichś struktur.
I to udoskonalił i zastosował głębokie sieci i algorytm propagati wstecznej po raz pierwszy Jan Leun. On wziął sieci Fukushimi konwolucyjne, wziął propagandatę wsteczną, którą na którą wpadł Jeffre Hinton i po raz pierwszy chyba w 89 roku stworzył pierwszą sieć neuronową, która rozpoznawała pismo odręczne. I to było potrzebne akurat do w poczcie, no bo żeby skanować koperty i rozpoznawać na przykład adres, warto byłoby to zautomatyzować.
No więc udało się stworzyć pierwszą sieć, która rozpoznaje pismo odręczne właśnie to Janek Kun zrobił jako pierwszy i on całe życie inwestował właśnie w te algorytmie widzenia. On jest też gorącym zwolennikiem trenowania sztucznej inteligencji na obrazach, na filmach, bo i najlepiej w ogóle technikami, o których Satan mówi, uczenia przez wzmocnienie, żeby nie uczyć się imitacji tego, co robi człowiek, tylko uczyć się odkrywać praw w świecie, tak jak robi na przykład Alfa Zero.
Z tego wodu nie bardzo wiem, dlaczego tak to Alfa Zero krytykował się z tego nabijał, ale mniejsze o to. No w każdym razie on od początku był bardzo sceptycznie nastawiony do modeli językowych, bo one są trenerem w zup inny sposób. To nie jest to co on robił i trochę jako szef obecnie w w mecie do sprawcznej inteligencji yyy no może mieć wrażenie, że mu trochę peron odjechał. Jak to się nagle okazuje, że jakaś mała firma, której nikt nie słyszał, osiąga takie sukcesy.
Y i on jest bardzo gorącym krytykiem modeli językowych i on mówi, że słuszne zresztą, że że jedyne co one robią, to one tylko przewidują na cene słowo w tekście. To jest prawda. Te modele nic innego nie robią. No nie wiem czy przewidują, ale obliczają następne słowo w tekście. I to jest taki deterministyczny algorytm. Jak się ustawi temperaturę modelu na zero to on przewiduje deterministycznie jakie jest następne słowo w tekście lepiej lub gorzej.
To jest oczywiście prawda, tylko że kłopot jest taki, że nie wiem czy zauważyłeś, ale ja w czasie tej rozmowy ja robiłem tylko jedną rzecz. Ja przewidywałem następne słowo w swoim tekście. Ja nic innego przecież nie robię tylko słowo po słowie przewiduję słowo i tak dalej. jest tutaj >> tak jak pisze się książkaę to się przewiduje słowo jak Albert Einstein pisał artykuł o tej wzgęności to on przecież przewidywał słowo w swoim własnym tekście >> no tylko akurat tam było pewnie niewielu takich którzy by przewidzieli dokładnie te słowa które się akurat w tym tekście pojawią >> więc o to chodzi że każdy to przewiduje inaczej i my się różnimy tym jak to przewidujemy jak się bardzo uprzeć to nawet by się w zasadzie dało skonstruować taki rozkład prawdopodobieństwa różnych słów żeby wszystko co kiedykolwiek Einstein powiedział albo napisał dało się zrekonstruować przewidując następne słowa albo losujący zgodnie z jakim sam rozkładem prawdopodobieństwa.
Da się to zrobić formalnie, chociaż nie wiem po co, ale w zasadzie to jest możliwe. To pokazuje, że że stwierdzenie, że że modele tylko przewidują słowo w tekście, to nie jest specjalnie wyróżnik czegokolwiek, bo to można powiedzieć o każdym, kto generuje tekst. Y, inne ciekawsze pytanie jest jak to modele te słowa przewidują i czy to jest taki sam sposób przewidywania tych słów jak to robi człowiek. I to jest ciekawsze pytanie, bo odpowiedź jest, że to nie jest ten sam, dokładnie ten sam sposób.
Jest wiele ciekawych różnic i to to w ogóle trzeba się trochę wgłębić w tech. Ja może sobie pozwolę na taką techniczną trochę yyy taki techniczny fragment, jak ktoś może moinąć jak kogoś to nie interesuje. Otóż yyy i też jest na ten temat dużo w książce o tym, jak w ogóle te najprostsze nawet modele przewidują słowa. No bo pierwsza rzecz, którą trzeba zrobić, to trzeba zastąpi te słowa na liczby, zamienić słowa na liczby i do tego służy mechanizm, idea wektoryzacji, którą zresztą wprowadził do uczenia maszynowego Joshua Benjio, trzeci z tych twórców uczenia masowego.
To neurolingwiści to badali takie takie idee wcześniej. On to chyba jego główna zasługa, żeby właśnie to wprowadzić do uczenia maszynowego. Efekt jest taki, że zamieniamy słowa albo trochę bardziej mówiąc precyzyjnie tokeny na na zbiory liczb. pytanie jak to robić. No bo jeżeli chcemy stworzyć słownik wszystkich wyrazów, którego używamy w modulu językowym, to można robić na wiele sposobów. Na przykład można zbudować tekst liter i każdej literze ma dać jakąś liczbę, >> ale to nie jest efektywny sposób, bo inferencja, czyli przewidywanie kolejnych liter by trzeba robić wielokrotnie i przewidanie krótkiego tekstu wymagałoby wielokrotnego powtórzenia, więc to jest nieefektywne.
Z drugiej strony można by wziąć model, którego który przewiduje całe zdania i to też jest słabo efektywne, bo z kolei tutaj obliczamy tylko kolejne całe zdanie, ale za to liczba możliwych zdań jest tak gigantycznie wielka, że słownik byłby nie do pomieszczenia w jakiejkolwiek pamięci. I optymalne okazuje się przewidywanie ani słów, ani liter, ani zdań, tylko czegoś pomiędzy. I to coś pomiędzy się nazywa token, >> czyli zlepek lit.
To są zlepki, sylaby i to jest taki atom tekstu, taki taka najmniejsza możliwa tekstu, którą model językowy widzi i na której operuje. >> Zresztą z tego właśnie powodu wczesne modele językowe miały kłopoty z liczeniem liter. Na przykład w z razie truskawka się ludzie naśmiewali, że nie potrafi policzyć liter, i że jest głupi w związku z tym no myślę, że nie potrafi, bo operuje na tokenach, które są większe niż litera więc to trochę tak jakby nie wiem jak tam pisze, że jak trochę jakby bić dziecko w głowę, bo bo nie nie widzi w podczerwieni.
No modele operują na tych tokenach i ich zadaniem jest przewidywanie kolejnych tokenów. I teraz ciekawe jest to, że żeby to robić modele zamieniają te tokeny na na liczby, ale nie na pojedyncze liczby, bo można było najprościej po prostu ułożyć te wszystkie tokeny w słownik alfabetyczny i każdemu dać numer, ale to jest trochę inaczej. yyy taki model GPT3 na przykład, on każdemu tokenowi, których jest zresztą koło 50 000 nadaje nie jedną liczbę, ale 12000 liczb.
Każdy token to jest 12000 liczb. I teraz to powoduje, że można o takim tokenie myśleć jako takim punkcie w wielowymiarowej przestrzeni. Na przykład na mapie każdy punkt ma dwie współrzędne geograficzne, więc dwie liczby wystarczają, żeby wiedzieć gdzie jest jakiś punkt. Y w trzech wymiarach, tr wymiary przestrzennic trzeba trzech liczb. Każdy punkt to jest zbiór trzech współrzędnych. Jak mam 12000 lic to mogę tym myśleć jako o punkcie w wielowymiarowej 12000owymiarowej przestrzeni.
To brzmi dosyć dziwnie, ale w zasadzie to jest pewnie analogiczne do zwykłych przestrzeni. Tu matematycznie to się uólnia i i każdy token można o nim myśleć jako o takim punkcie albo kierunku wektorze w takiej przestrzeni, która ma bardzo wiele wymiarów. I nikt na początku nie mówi jakie to mają być kierunki. i one są wylosowane i model ucząc się przewidywać kolejnych słów czy kolejnych tokenów w tekście koryguje sobie te kierunki żeby one były jak najlepiej zorientowane i w wyniku tego treningu się okazuje tam się wyłania bardzo ciekawa struktura to jest taka tak zwana przestrzeń osadzeń i wektory z tej przestrzeni to są wektoryzacje tokenów odpowiadają różnym pojęciom i okazuje się że one się bardzo ciekawie grupują na przykład słowa, które mają podobne znaczenia pies albo nie wiem chłopiec facet, mężczyzna to są tokeny, to są wektory, które mają podobny kierunek.
Z kolei kierunki żeńskie, na przykład kobieta, dziewczyna, to są inne zupełnie kierunki i >> ale to jest podobne. >> Ale to jest podobne. >> I ciekawe jest to, że to jest jedna rzecz. Oprócz tego y w tej procedurze jeszcze trochę szczegółów technicznych, na przykład takie, że model nie tylko musi wiedzieć jakie słowo, jaki token ma jakie jaki kierunek w tej przestrzeni, ale też gdzie on znajduje się w zdaniu. I to są takie taka prosta analiza furierowska pozwala każdym z tych wektorów nadać jeszcze jakąś taką prostą funkcję trygonometryczną, która informuje jaka jest położenie tego tego słowa w danym tekście.
No w każdym razie ciekawe jest to, że te wektory, te strzałki można się dodawać, odejmować, dostawać sensowne wyniki. Taki ciekawy i taki ciekawy przykład jest na przykład, że jak się weźmie słowo kierunek męski i kierunek żeński od siebie odejmie i weźmie wektor różnicy i doda słowa królowa, to wychodzi mniej więcej ten kierunek, gdzie jest słowo król. Albo jak się weźmie słowo Japonia i słowo Niemcy i słowo suszli i weźmie się taką kombinację Niemcy odjąć Japonia odjąć sushić sushi równa się to się okazuje że ten wektor który w ten sposób dostajemy to jest mniej więcej wektor kiełbasy co pokazuje że model w wyniku treningu odkrywa że relacja pomiędzy Japonią a sushi jest taka sama jak relacja między Niemcami a a Kiełbasą.
I to jest jedna rzecz, to jest pierwsza pierwsza rzecz. A >> ciekawe czy tak to marginesie czy ta struktura tych słów, czy to się jakby zbadać nie wiem impulsy w mózgu człowieka, czy to czy to jest jakoś toż same, że zupełnie nie? >> To jest dobre pytanie. Na ten temat się ludzie straszliwie kłócą, bo z jednej strony jest Jeffrey Hinton, który jest jego ambicją było symulowanie mózgu. On chciał się nauczyć jak działa mózg i dlatego tworzył te pierwsze modele językowe, żeby y zrozumieć jak działa mózg. to była jego ambicja i on twierdzi, że ten model jest najlepszym modelem naszego ludzkiego myślenia, jaki mamy. Że >> że że my myślimy, mamy coś w głowie, coś na kształt takiej przestrzeni osadzeń, gdzie są też jakieś takie wektory >> i ten prąd płynie w mózgu mniej więcej tak jak >> to jest jego hipoteza i on rzeczywiście no empirycznie to coś wygląda na to, że te modele rzeczywiście świetnie symulują to jak mówi człowiek.
No bo my możemy myśleć, że o tym, że my rozumiemy co to jest kiełbasa, bo my wiemy co to jest kiełbasa, bo przecież my to o wiele lepiej rozumiemy, a model językowy nie wie co to jest kiełbasa. On tylko wie, że relacja między kiełbasą a Niemcami jest taka jak relacja między sushi a Japonią, ale nie wie co to jest kiełbasa. A my wiemy. Ale co my tak naprawdę wiemy? My wiemy, że jak zjemy tą kiełbasę to ciąg ciąg sygnałów elektromagnetycznych, które z naszych kubków smakowych czy elektrochemicznych dotrze mózgu, wywołuje wrażenie. czy wyłuje jakiś jakiś jakiś jakiś efekt, który on łączy ze słowem kiełbasa.
Więc my też de facto dostrzegamy czy rozumiemy kiełbasę jako relacje pomiędzy tym pojęciem a zbiorem impulsów, które naszego mózgu docierają pod kiełbasy. >> No bo w końcu my to jesteśmy co myśe taki algorytm, który jest w takim ciasnym pudełku z kościowany na czuku kręgosłupa i tam w tym pudełku są dziury i dziurami wchodzą różne sygnały z zewnątrz z oczu z innych miejsc naszego organizmu. Yyy, no ale to jest to jest dopiero początek.
I kolejną rzeczą jest to, że że jak model przewiduje kierunki tych kolejnych tokenów, to on yyy robi to na podstawie nie tylko poprzednich yyy tokenów, ale jeszcze paru innych rzeczy. Przede wszystkim ta przestrzeń osadzeń, która jest taką przestrzenią, której żyją pojęcia, na których operują modele językowe. Yyy, pojęcia to nie jest to samo co słowa, dlatego że słowo koń jest bardzo wieloznaczne. Y, konik morski, konik polny, konik szachowy, konik podwksem, który handluje dewizami i fizyka, która jest moim konikiem.
To są bardzo różne koniki wszystko. Więc to słowo konik y jego znaczenie zależy w sposób krytyczny od kontekstu w jakim się znalazło, >> czyli od pobliskich słów. I jednym z jedną z jednym z takich przełomowych zasług twórców Transformera, czy których między innymi Łukasza Kaera, było użycie tego mechanizmu uwagi. On był wcześniej znany w innych kontekstach do do przewywania do tej inferencji słów w taki sposób, żeby modyfikować wektory w tej przestrzeni osadzeń na podstawie pobliskich słów.
I to wszystko się sprowadza do mnożenia oczywiście dużych macierzy czy mnożenia przez siebie liczb, dodawania i stosowania funkcji aktywacji nieliniowej. Ale to są wszystko operacje matematyczne i model przewidując słowa, on modyfikuje sobie te wektory uwzględniając kontekst wielowymiarowy. Dlatego tych tych tych poszkanie powiązań jest bardzo dużo. Ale to jest jedna rzecz, którą robi model. Kolejna rzecz, którą on robi jest to, że on odpowiadając na pytania nie tylko uzależnia odpowiedź od treści pytania.
Na przykład jak się ciebie pytam jaka jest pogoda, to odpowiedź na to pytanie nie kryje się w pytaniu. Zbiór słów z którego z których zbudowane jest pytanie jaka jest teraz pogoda, nie zawiera odpowiedzi na to pytanie. Więc żeby model odpowiedział na jakiekolwiek pytanie, musi korzystać w jakiś sposób z swojej bazy wiedzy, która wykracza poza tylko samo pytanie. I tą bazą wiedzy w modelach językowych jest to są tak zwane wielowarstwowe perceptrony, o których ja trochę w książce piszę.
I okazuje się, że wszystkie w zasadzie modele językowe, które mamy, 2/3 wszystkich parametrów tych takiego modelu, to są te perceptrony. To są parametry perceptonów wielowarstwowych, których w pewnym przybliżeniu można pewnie myśleć, że tam jest skumulowana wiedza z treningu. Więc jak masz takiego TR GB 3,5 to jest 175 miliardów parametrów. Y, jak to zapiszesz na dysku, to jest to są to są 16 bitowe liczby, więc to będzie 350 GB pamięci mniej więcej.
To ponad 200 GB z tego to są to jest baza wiedzy, skompresowana baza wiedzy z treningu. No po to się modele trenują, żeby z tej wiedzy korzystać. I model jak przewiduje słowa, to najpierw sobie uwzględnia kontekst korygując, ustalając so jakie znaczenie pytania y poprzez uwzględniam tych wszystkich kontekstów i modyfikując wektory znaczeń. Potem korzysta z bazy wiedzy, żeby znaleźć połączenie między pytaniem a jakąś analogią z bazą wiedzy.
Powtarza to wiele razy, kilkadziesiąt razy to się powtarza w kółko i dopiero wylicza jakie jest najprawdopodobniej następne sensowne słowo. I tu jest jeden bardzo ciekawy moment, którym na który się mam wrażenie nie zwraca uwagi. Y, który odróżnia to jak to robią modele od tego jak prawdopodobnie myślą ludzie. Ale to jest moja hipoteza już nie nie wiem czy czy jest sensowna, więc to jest bardziej do wrzucam to jako jako taką taką myśl, która może być bezsensowna.
Otóż to jest jeden z sposobów trenowania modeli poprzez predykcję słów. Są zupełnie inne sposoby trenowania modeli. Są tak zwane modele dyfuzyjne, które działają w zupełnie inny sposób. Na przykład obrazy się generują głównie modeli, modelami dyfuzyjnymi i yyy trening jest taki, że bierzemy sobie zbiór obrazów, dodajemy do tego szum, czyli psujemy te obrazy i mamy wówczas oryginalne zdjęcie i zdjęcie popsute i trenujemy model, żeby uczył się to zdjęcie odszumiać.
I model jest w stanie z szumu zasumionego obrazu tworzyć czyste obrazy. Tak z grubsza rzecz biorąc działają modele dyfuzyjne i one od razu działają na na całości. Są też językowe modele dyfuzyjne, które nie działają w oparciu o przejdywanie słów, ale one biorą sobie tekst, który zostaje zwektoryzowany, czyli zamienia się na na te wektory w tej przestrzeni osadzeń i trochę się dodaje szumu do tych wektorów, trochę się nimi obraca i zadaniem modelu jest poprawienie tego tekstu, żeby on znowu wrócił do pierwotnego znaczenia i w ten sposób się trenuje te modele, żeby one jak najlepiej to robiły.
I takie modele tworzą od razu całe zwania. w całości tworzą tekst jakby bardziej globalnie, nie słowo po słowy, tylko te modele nie są aż tak dobre jak modele językowe, ale to jest inny możliwy paradygmat. Teraz takim ważnym elementem zwykłych modeli językowych jest to, że one dla osób trochę technicznie zorientowanych blok dekodera, czyli tam struktura jest taka, że najpierw bierzemy słowa, zamieniamy na wektory, to się nazywa encoder, potem jest drugi blok, który bierze te wektory, zamienia z powrotem na słowa, to jest dekoder, że w tym bloku dekodera i mechanizm dostrzegania y zaraz skończę, przepraszam, dostrzegania tych tych analogi znaczy doczania kontekstu jest obcięty w sposób sztuczny.
To jest tak zwane maskowanie, które powoduje, że model przewiduje słowo na podstawie poprzednich słów, ale nie na podstawie przyszłych słów. Co się wydaje naturalne dosyć, no bo jak mówię, to mówię słowo po słowie, coś powiedziałem, potem potem nabudowuję dalszą treść. I to mi na przykład bardzo przypomina to o czym od czego zaczęliśmy, o tym elektronie, który jest w stanie przyczynowo zabudować przyszłość, nie jest w stanie zabudć przeszłość.
I powód dla którego tak ten mechanizm jest tam ograniczony w modelach językowych jest taki, że że chcemy, żeby one przewidując słowa nie wiedziały jakie będą następne słowa, bo jak wiedzą jakie są następne słowa, to przewidanie jest trywialne, więc te maski tam są po to, żeby takie modele nie sensownie się trenowały. Tylko mam wrażenie, że człowiek jak przewiduje kolejne słowa, to on robi to trochę nie tylko w oparciu o to dotąd powiedział, ale też w oparciu o jakąś ideę, która do którą ma w głowie, do której zmierza.
Tak >> więc ja na przykład yyy chcę ci powiedzieć jakieś jakimś pomyśle i ja y mam jakieś tworzę sobie jakieś wyobrażenia do tego chcę dojść i staram się tam dobrnąć konstruując nieudolnie moją wypowiedź słowo po słowie, ale yyy w pewnym sensie słowa, które dobieram zależą trochę od tego co dopiero powiem za jakiś czas. >> Tak >> to jest takie zachowanie trochę jak ten elektronik, który do którego ch dirak włączył potencjały awansowane, które trochę jakby widziały w przyszłość.
Modele językowe tego nie mają. One są zablokowane i jak się próbuje to odblokować to one zacząłem gadać, zacząłem źle działać. Więc wydaje mi się, że to jest ciekawe miejsce, które jeszcze chyba nie zostało. Czy są różne modele, które wychodzą poza to kryterium? Są jakieś takie modły Bert i to właśnie z Rkiem Kinasem tym wczoraj rozmawiałem, które jakby są próbą wyjścia poza ten to ograniczenie, ale one nie są najlepsze. >> Mhm.
Ale wydaje mi się, że to jest jedna z tych rzeczy, które w przyszłości będzie wymagać modyfikacji. Jeśli nam zależy na tym, żeby zbliżyć się bardziej w stronę ludzkiego tworzenia słów, czy myślenia, czy jak to nazywać, to to będzie jedna z rzeczy, które będzie trzeba zmodyfikować. Czyli ta maska narzucana na na mechanizm self attention, to się mówi po polsku, atencji właśnie tym bloku dekodera, to jest taki element, który wydaje mi się jest może być uznany za za czymś, co kluczowo odróżnia mechanizm tych modeli od od tego, jak ludzie myślą. >> To jest poem moja hipoteza.
Nie wiem, czy tak rzeczywiście jest. >> Mhm. Wypowiedziana między innymi w programie Gilali. będą mogli państwo kiedyś wrzucić po latach sprawdzić czy to w tę stronę poszło w której profesor opowiada. To był w listopad też tak jak teraz 2022, kiedy wszyscy zaczęliśmy 3 lata temu, tak wszyscy zaczęliśmy gadać o sztucznej inteligencji, bo oni wtedy pokazali w open chata GPT. >> No tak, >> to jakoś chyba tak >> 2020. >> Znaczy ty był wcześniej GPT 2 i tak dalej. >> Jasne, jasne.
Nie tylko to, to śledziili to wcześniej ci co tam k to interesowało, ale tak ten przełom taki to był publiczność trzy lata temu >> chyba. To był początek 23 też kiedy tak naprawdę to strzeliło w >> Tak. Słuchaj, a bo Open AI to ten ich sukces w owym czasie polegał na tym, że oni jakby uwierzyli w w skalowanie, tak, w to, że oni zrozumieli, że warto tam dorzucać więcej i więcej i to przynosi fajne efekty. Sprostuj to, jeśli się mylę i powiedz proszę, jak to się ma do listopada 2025.
Czy to wciąż czy skalowanie wciąż to to jest to, o co chodzi, czy już nie? To znaczy tak, wszystko zaczęło się od pracy Alexa Kzeżewskiego, Jeffreya Hintona, którzy stworzyli tak zwaną sieć Alex Net i gdy była sieć neuronowa głęboka tam, bo tych zwarstw nie było za dużo, o ile pamiętam 600 000 parametrów, więc 600 milionów to była już już spora sieć tak naprawdę, która miała rozpoznawać obrazy i okazało się, że ona rozpoznaje obrazy lepiej niż wszystkie zaprogramowane standardowymi technik technikami rozpoznania obrazów wcześniej działały, czyli ona o kilkanaście proc przeskoczyła poziom w jakim udaje się rozpoznawać zawartość rysunków i jest taki konkurs Imagnet gdzie co roku się te algorytmy spotykają i sprawdza się który jest lepszy w rozpoznawaniu obrazów obecnie obecne algorytmy robią to lepiej od ludzi y nawet Andrej Karpaty o którym wspomniałem gość z Testy to na sobie zrobił taki eksperyment, że wziął ten zbiór treningowy piesków i kotków i nauczył się tych zdjęć, przejrzał je i po dwóch tygodniach na sobie zrobił test i chyba o ile pamiętam dostał poziom 97% skuteczności odróżnienia tych tych zdjęć klasyfikacj od od kotów. >> Tak.
Obecne te klasyfikatory to robią to na poziomie 99,99 tam już nie pamiętam ile y procenta skuteczności, więc są lepsze od ludzi w odróżnieniu piesków odkładków na zdjęcia. Ale widać to, co pokazała ta praca, to że czynnikiem kluczowym było skalowanie sieci >> i skalowanie danych. To jest też nie mniej ważne. Duży zbiór treningowy danych, który został stworzony właśnie na potrzeby takiego treningu okaza się absolutnie kluczowy. >> A skalowanie sieci, czymś skalowanie danych wyobrażam sobie, czy po prostu dużo >> dużo parametrów z grza rzecz biorąc na przykład te sieci konwolucyjne czy te skanery obrazów, gdzie gdzie poszukujemy jakichś struktur, to nie jest jedna warstwa, tylko tych takich warstw skanujących jest bardzo dużo i to zgrupza się skanuje z liczbą parametrów. >> Mhm.
Okazało się kluczowe. Tak w ogóle to cała ta branża wisi na takim twierdzeniu matematycznym. To się nazywa twierdzenie aproksymacyjne. To Kurt Hornik udowodnił w latach 80 z kolegami z Wiednia, że w zasadzie jakakolwiek funkcja matematyczna da się zaimplementować siecią neuronową. Brzmi to tak niepozornie, ale jak zrozumiesz o co chodzi, to to to ci spadną buty, bo to znaczy, że człowiek, który jest takim urządzeniem do zamiany sygnałów wejściowych w sygnały wyjściowe, tak to
The words are the caption track's own and nothing is reworded or re-transcribed. Paragraph breaks are placed between sentences so the text reads as prose.
Free tools for your own script: paste a draft and see where it stands before you record it.
Paste your draft and see where viewers are likely to drop off, with a rewrite for each weak line.
Paste the first 30 seconds of your own draft for a hook score and rewrites.
Check your draft against YouTube's advertiser-friendly guidelines before you record it.
Read this channel's public videos and transcripts, and download a writing brief for it.