Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.
Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.

ML Trainings · @ODSAIRu
Words
6,379
Runtime
43:55
Speaking pace
145wpm
Reading time
27min
145 words per minute, below the 160 25th percentile of 349 measured videos. That distribution comes from the 349-video hook study.
Opening (first 30 seconds)
Спасибо. Так, мы сейчас в темпе немножко вальс поговорим про каким будет мир больших моделей по всей видимости в ближайшие 4-5 лет. А вот на самом деле фокус исследований моей команды, его можно сформулировать таким образом, да? То есть вот смотрите, у нас есть такой basзeline стек, да, йстрим стек, основанный на декодерных трансформерах. Мы эти декодерные трансформеры там как-то учимся постепенно учить лучше. Немножечко твикаем, немножко дорабатываем эту архитектуру, там какие-нибудь фунты
73 words, the words spoken in the first 30 seconds at 145 words per minute.
Free, no signup. See how the first 30 seconds hold attention, with rewrites.
Sentence shape
| Measure | This transcript |
|---|---|
| Sentences | 408 |
| Average words per sentence | 15.6 |
| Longest sentence | 91 words |
| Questions asked | 71 |
| Sentences containing a number |
What this transcript is
Every word below is the caption track YouTube publishes for this video, pulled from the video itself and reproduced unchanged. It is not Prepublish's writing, not a summary, and not a re-transcription: it is the video's own published captions. Russian captions, generated automatically by YouTube, in the video’s original language. Source: the video on YouTube. A channel that would rather this page did not exist can ask for its removal through the contact page, and it is removed.
No Script X-ray for this video: YouTube shows a Most replayed graph only once a video has enough views.
Спасибо. Так, мы сейчас в темпе немножко вальс поговорим про каким будет мир больших моделей по всей видимости в ближайшие 4-5 лет. А вот на самом деле фокус исследований моей команды, его можно сформулировать таким образом, да? То есть вот смотрите, у нас есть такой basзeline стек, да, йстрим стек, основанный на декодерных трансформерах. Мы эти декодерные трансформеры там как-то учимся постепенно учить лучше. Немножечко твикаем, немножко дорабатываем эту архитектуру, там какие-нибудь фунты функции активации, а дорабатываем пайплай на обучение. Э в это вкладывается огромное количество ресурсов сейчас, да, потому что понятно, что там какой-нибудь выигрыш в скорости инференса трансформера - это огромные деньги. И в целом мы уже дошли до того, что всё очень сильно оптимизировано. оптимизирована на алгоритмическом уровне, оптимизирована уже на уровне железок. Новые железки выпускаются с прицелом под конкретный стек. Вот. И это вот мейнстрим, да, э, он возник почти из ниоткуда, да, но сегодня это многомиллиардная индустрия. Так вот, э фокус исследований моей команды - это всё кроме этого. То есть это вот А что Хорошо вот а что такого не могут всё-таки мейнстримные модели, да? сколько в них не докладывай, э, компьютера, сколько их не масштабируй, сколько в них не добавляй данных в лоб, да? То есть, что нельзя получить из мейнстримного стека путём простых итеративных улучшений и масштабирования. А, и вот мы сегодня поговорим как раз о таких существующих барьерах, да, ну и о том, как, по всей видимости, они будут преодолеваться и каким, в общем, будет будущее больших моделей, когда значит эти инновации всё-таки станут частью уже нового мейнстрима. Вот. Ну, я люблю чуть-чуть порассуждать вообще о том, что такое искусственный интеллект. Вот искусственный интеллект - это область науки и технологии, которая занимается автоматизацией решения интеллектуальных задач. А на самом деле вот это важно понимать, да, что технологии искусственного интеллекта, когда про них не говорят маркетологи, когда про них не пишут жёлтые статьи, это, в общем, ну, плюс-минус такие же технологии, как и другие технологии, которые создают человечество. Да, у нас нету с вами острых когтей, зубов, но мы придумали ножи, пики, вилки и прочие штуки, которые в целом нам дают огромное преимущество по отношению к тем, у кого там когти острее, чем у нас. А у нас нету с вами толстой шкуры, нету густого меха. Мы придумали одежду. И опять же эта одежда позволяет нам добиваться гораздо большего, чем в плане [фыркает] температурной адаптации, чем животные, у которых есть этот самый густой мех. И вот искусственный интеллект - это, на самом деле, некоторый набор технологий, цель которого заключается в том, чтобы раздвинуть границы возможного для человеческого разума. Да, это на самом деле вот вся индустрия интеллектуальных инструментов, которые предназначены для того, чтобы э наши с вами возможности усилить. И, э, вот эту как бы изначальную миссию технологии искусственного интеллекта, её всегда очень важно понимать и осознавать, да, потому что это затем влияет на приоритеты в области исследований. Вот, ээ, какие барьеры существуют у человеческого разума. Я там заранее извиняюсь, тех, кто слышал какие-то мои выступления на эту тему. Я постараюсь много на это время не тратить, но но это момент важный, опять же, с точки зрения того, что мы собираемся делать. Вот смотрите, мозг человеческий он не очень быстрый. Э, он не очень быстрый, потому что это электрохимическая система, как иногда шутят, система мокрых вычислений. Вот у нас с вами сигналы между нейронами передаются через электрохимические связи. То есть ионы проскакивают через ионные каналы в синапсах. А чтобы ион быстро преодолел ионный канал, что нужно? нужно нужна разница потенциалов. Чем она больше, тем, в общем, теоретически это может быстрее произойти. Но если разница потенциалов превышает 1,27 В, то у вас вода начинает на водород и кислород разлагаться, и после этого ваш мозг может просто-напросто взорваться, что, в общем, совсем не способствует продуктивному мышлению, как вы понимаете. Вот поэтому длинные сигналов, которыми обмениваются нейроны между собой, это единицы миллисекунд. Это чудовищно много по меркам электронной, например, схемотехники. Вот. А иногда нам нужно некоторые решения принимать очень-очень быстро, гораздо быстрее, чем это может делать человеческий мозг. И вот один из барьеров, который мы в том числе должны раздвинуть за счёт развития технологии искусственного интеллекта. Надёжность. Да, люди не всегда надёжны. Если вы давали людям деньги в долг, вы знаете наверняка, что люди не всегда бывают надёжны. Во многих системах человек является наиболее слабым звеном по надёжности, и исключение из некоторых процессов человека позволяет надёжность всей системы повысить. Дальше. Ограниченный параллелизм. Мы одновременно не так много вещей можем делать хорошо. Э коммуникативное ограничение, то есть пропускная способность сенсорной моторной коры. Мы не можем смотреть восемь сериалов на одном экране. Хотя, наверное, было бы здорово. Можно было бы в восемь раз больше удовольствия получать, но, увы и ах, значит, здесь есть тоже барьер. Опять же, люди довольно хрупкие, да, мы с вами живём в очень узком диапазоне температур, ускорений. И если мы собираемся космос, например, всерьёз осваивать, да, космос для нас чудовищно некомфортное место, да, вообще доля объёма вселенной, в которой мы можем с вами существовать, ну, она ничтожно мала по сравнению с той частью вселенной, которая нас убьёт почти мгновенно. А порог сложности анализируемых систем, как ССР и Дальга шутят, что вот порог сложности, понимаемой человеком системы, он ограничен одним чилобайтом. То есть, если в один челобайт вмещается эта сложность, то как бы ок, мы там способны понять систему во всёй сложности её внутренних взаимосвязи, а если нет, то нет. И анализируя такие сложные системы, как, например, биологические или социальные, мы вынуждены создавать коллективы людей для обуздания этой сложности. Но проблема в том, что если один строитель строит дом за год, это не значит, что 10 млн строителей вам его возведут за мгновение. Да, и с людскими коллективами то же самое. Э, к сожалению, они тоже очень сильно ограничены в работе со сложными системами. Э, ограниченность памяти людей, ограниченные экспертные навыки и знания, барьеры мотивации, да, не всегда мы хотим решать те или иные задачи, да, а их решать нужно. А, ну и барьеры масштабирования, репликации, да, если вам завтра нужен, э, не знаю, там, колл-центр на 10.000 операторов, вы не наймёте за сутки 10.000 операторов, не обучите их, да? А ещё через сутки, когда вам больше этот кол-центр не нужен, вы их не уволите. Вот. А вот 10.000 виртуальных операторов где-то там раскатать, это уже что-то такое реалистичное. В общем, я там люблю тоже порассуждать вот про там разные века в обработке информации, да, как вот в начале XIX века мы придумали, что э человечество проходило через там каменные, бронзовые, железные века, постепенно подчиняя своей воле всё новые субстанции. Э, и в конце концов наконец-то построила сталетейный завод во Франкфурте на Майне, который является венцом развития человеческой цивилизации. Вот ээ эта картина мира, возникшая в начале XIX века, как вы понимаете, гораздо больше говорит не о истории человечества, а говорит о том обществе, в котором эта картина была придумана. Вот. И с точки зрения общества, в котором всё-таки топ мировых компаний - это не сталелитейные концерны, а компании, которые зарабатывают свои деньги на обработке информации, так или иначе, а мы можем себе на историю человечества взглянуть вообще под другим углом, сказать, что, ну, о'кей, там каменные, бронзовые, железные века прекрасно, но ещё у нас были вот такие века и такие вот великие революции в истории развития человечества, связанные с изменением самих способов обработки информации. То есть мы, э, когда-то жили в эпоху устной речи и передавали информацию из уст в уста, ээ, при помощи вокализации, а потом появилась письменность, и это стала радикальной революцией, которая всё общество перестроила, там торговля, ремёсла, строительство, да что ещё. Создание городов без письменности просто-напросто невозможно. А книгопечатание, которое в 10.000 раз удешевило тиражирование информации, да и книгопечатание привело там к повышению уровня грамотности от единиц процентов до практически полной на в течение там полутора веков а- увеличение доступности информации, да, и там раньше, чтобы получить копию там какого-нибудь э вашего любимого женского романа, нужно было полгода кормить монахов в каком-нибудь монастыре, да, и поить, и потом вы в результате получили бы свой свой пергамент. Но, э, именно поэтому, да, женские романы тогда и не создавались, да, это была, ну, непочтительно дорогая игрушка, да, тратить такие ресурсы на такие глупости, казалось бы. Вот. Но, ээ, развитие книгопечатания, оно привело к очень серьёзным сдвигам вообще во всём обществе. Там религиозная реформация в Европе не была бы просто возможна без появления книгопечатания. Дальше интернет. Ну, и, в принципе, технологии электронных документов. Вы понимаете, э-э, это ещё там на три порядка удешевления тиражирования информации, но мало того, э-э это ведь ещё и возможность автоматической обработки этой информации. Поисковая машина в принципе не была бы бы возможна в эпоху до электронных документов. А сегодня вы идёте в поисковик, делаете свой запрос, и машина из триллионов документов, опубликованных в сети, находят, ну, какое-то небольшое подножество, которое релевантно вашему запросу. Это чудо этого, э, до интернета в принципе было нельзя себе представить, что это такое. Вот. Ну и вот генеративно искусственный интеллект, почему это как бы тоже великая революция. Ну, потому что мы сейчас, посмотрев на эти системы генеративного и можем представить себе системы, которые, ну, не знаю, по вашему запросу книгу для вас запишут по по-любому там абсолютно там, казалось бы, дурацкому вопросу, да, там, не знаю, хочу книгу про вантузы, да, и у вас там книга, где там история возникновения вантуза, ведущие вантузологи, там вантуз в интерьере, вантуз там в быту, в антузоведении. Ну, короче, ну, это очень смешно. И, ну, наверняка может попробовать и поржать на какой-нибудь вечеринке. Да, я специально такой глупый выбрал пример, чтобы вы поняли, что генеративный он делает многие вещи возможными и в принципе, ну, как бы люди хотят их делать, а раньше они их делать не могли, потому что, ну, это было чудовищно дорого и бессмысленно. Да, нужно было собрать, не знаю, коллектив учёных, которые бы там год штудировали бы интернет и написали бы для вас эту монографию. А для вас теперь как бы по вашему запросу создаются такие индивидуальные проекции. цифрового следа человечества на вашу конкретную потребность. И это может быть книга, которая, что называется, пишется во время её чтения, да? Это это может быть э я не знаю, книга сколь угодно кастомизированная, индивидуализированная потребности конкретного читателя. И не только книга, да, это ещё и графическая информация и что угодно ещё. Вот поэтому это очередной такой довольно радикальный слом э информационного метаболизма общества. Вот. И мы, на самом деле, создаём технологии, которые должны стать частью вот этого, э- стека. Вот. То есть вот как на комиксе одного из моих любимых комиксистов Ни Арагуа, да, вот там эволюция фантастики, да, вот как эволюция развития технологий создания э контента, да? Значит, человек создаёт робота, человек оказывается роботом, писатель оказывается роботом, то он, в конце концов, ещё и читатель оказывается роботом, да, потому что мультиагентные системы, значит, начинают пользоваться э генеративными моделями. А, ну опять же, да, мы вот я, когда этот слайд там, не знаю, нарисовал год назад, наверное, там или полтора, это было, ну, типа вот что, какой агентный и там интерактивный. Сегодня это обыденность, да? Сегодня все привыкли, что у нас есть там куча мультиагентных систем, которые могут решать интеллектуальные задачи, что называется, не в один пресед, а вот, э, там как-то по шагам, взаимодействия с другими системами, используя внешние тулы и так далее, и так далее. То, что вот, э, Мустафа Сулейман назвал интерактивным искусственным интеллектом, сам термин, наверное, не очень прижился. Все сейчас говорят скорее агентный. Вот. Но, э, идейно, да, это именно интерактивная система искусственного интеллекта. И вот, э, агентность, она сам по себе агентный подход, ему там 100 лет в обед. Но, э, появление больших языковых моделей, оно, конечно, создало, дало новое дыхание агентному подходу. То есть оказалось, что можно использовать, э, языковую модель как основу для вот такого сложного сложного агента, способного решать сложные задачи. То есть создав какой-то харнес, обвязку, да, вокруг самого самой большой языковой модели, как ядра и превратив эту самую языковую модель из фундаментальной модели в фундаментального агента. Вот. Ну, моделирование рассуждений, да, времени не очень много, я не буду тут супер тоже много про это рассказывать, но вот интересный момент. Многие из технологий, которые сегодня для нас являются обыденностью, они, ну, просто чудовищно молоды, да. Первые модели, которые могли рисовать картинку по произвольному запросу, да, это январь 2021, по-моему, 5 января 2021 года вышла вышелпер по Да, дали, да, или Далли. Вот. То есть всего-навсего 5 лет назад появилась вообще первая модель, которая могла там, не знаю, нарисовать ребёнка дайкона в балетной пачке, который выгуливает собачку, да? Вот до этого вообще ничего подобного было невозможно. А сегодня у нас модели генерируют реалистичные видео, да? А там полтора-2 года назад на видео позапросу "Уил Смит ест спагетти", было непонятно, кто кого ест. То есть спагетти едят у Иила Смита или он их, да? А сегодня там интернет переполнен генеративными видео, и люди принимают их за чистую монету. Вот. И вот с ринингом на самом деле то же самое примерно. То есть только в двадцать втором году появляются первые робки идеи, что давайте мы в промте языковой модели напишем вот это let's think step by step. И это может позволить улучшить метрики там качества решения моделью каких-то задач, да? То есть, э, опять же, ээ, всего 4 года назад появляется сама концепция рининга в больших языковых моделях, а сегодня современную языковую модель без рининга уже люди там говорят: "Фу-фу, там, нам, пожалуйста, такого не надо". Вот модели мира, да, тоже вот там когда-то про это Шмитхубер любил порассуждать, но как как и всё остальное создал Шмитхубер. Вот. Но, а, значит, ведь понимаете мощь этой идеи, да? У вас есть вот методы, которые были всё время на игровой доске опробованы, да, там Альфа Go, Alpha Zero. Они что использовали? Они использовали сетку, которая выполняла роль элиy и Evoluation, то есть как бы для позиции пробовала предсказать вероятность того или иного хода в позиции, а ну и могла там как-то позицию без перебора оценить, да. Мы дальше вот эти две сетки накладываем на, э, поисковый фреймворк Монтека Resarch, да, и получаем э мощную систему, которая способна э значит перебирать в игровом дереве только ничтожное под множество траекторий, но зато релевантных траекторий, и за счёт этого получать, ну, уровень игры, который превосходит уровень игры сильнейших мировых игроков в настольные игры. Но вот смотрите, если у вас есть языковая модель, которая что-то знает об окружающем мире, которая способна, я не знаю, там, предсказывать возможные действия каких-то агентов в этом реальном мире или оценивать вообще результат этих действий, да, то это значит, что вы можете сделать поcy evaluation для реального мира, для задач реального мира, и дальше взять, ну, там, грубо говоря, тот же самый поисковый фреймворк, который там хорошо в теории игр был развит, и получить системы, которые планируют, например, например, сложные действия в реальном мире, ещё и в мультиагентном окружении, да? Почему, допустим, сегодня мы видим такой интерес к моделям в области работотехники? Потому что, э, генеративные модели обещают нам, наконец-то, появление универсальной работотехники, да, где вы не каждое действие робота будете программировать, эээ, значит, шаг за шагом, да, не будете какую-то одну там модель под, не знаю, жарку омлета, значит, обучать до посинения, собирая там тонны данных. У вас вместо этого будет какая-то VLA модель, которая будет вашу словесную инструкцию превращать, значит, набор действий с опорой на там зрение робота. Вот. И это тоже очень важный момент, который нельзя игнорировать. Сейчас большие модели идут в реальный мир. Дальше, значит, что зачем мы вообще делаем, какая цель, да? В у разных маркетологов, рекламистов пишут, что цель наша - это создание AGI, да, что вот как бы есть такой священный грааль, да, в сторону которого технологии искусственного интеллекта идут. Вот термин сам был в девяносто седьмом году придуман Марком Губрудом в статье, кстати говоря, нанотехнологии международная безопасность. Он впервые был предложен. Вот в целом как противовес не очень удачному термину сильный и который там с подаче Сёрли стал применяться. Ну и вот сегодня вы там откроете любую книжку, не знаю, там вот машинное обучение в маркетинге, да, вот прямо, и там будет написано: AG - это искусственный интеллект, способный успешно выполнить любую интеллектуальную задачу, посильную для человека. Короче, знаете, что не так с этим определением? Ну, типа, всё. А в нём каждая часть этого определения - это очень плохо определимый булшит. То есть вот типа посильную для человека. А для какого человека? Для среднестаческого человека, который не существует, или для лучшего эксперта в своей области или для кого? Для кого люди - это очень разное понятие. Дальше. В рамках какого, собственно, лимита стоимостного энергетического происходит решение этой задачи? Вот написать программу, которая будет идеально в шахматы играть, вообще проще простого. Любой студент напишет. Просто полный перебор по игровому дереву и выбор хода с наибольшей оценкой в корне. А будет она всегда совершать идеальные ходы? Да, будет. Но она будет над каждым ходом думать миллиарды лет. Ну, типа это HI или не HI. Если мы с вами создадим систему, которая будет решать любые абсолютно задачи, вот она любые будет решать, да? То есть вот полный перебор всех атомов нашей вселенной, я не знаю, там, а-э, вот всё решение гарантировано точное, но, как вы понимаете, с практической точки зрения абсолютно бессмысленна такая система. Поэтому, когда мы говорим там о системах искусственного интеллекта, важно ээ ну не забывать, что в какой-то момент какой-то менеджер будет вынужден нанять джунов, чтобы сэкономить токены на клод. Вот. Э, и, э-э, вот это никогда нельзя забывать про это. Дальше. Что значит успешно выполнить-то задачу? Да, ну, хорошо, если мы говорим о поиске там корней квадратного уравнения, проверить результат легко. А если речь идёт о генеративных задачах, люди-то к нашим моделям приходят в основном с задачами генеративными, там текст им написать какой-нибудь. А как это оценить? И с этим проблема большая. Люди-то и насчёт результатов, э, решения друг другом творческих задач не могут договориться. Да, там чёрный квадрат - это что, там, гениальное произведение или там, э, Малевич нас всех наколол. Вот. Э, значит, ээ это проблема. Как только вы переходите к задачам генеративным, у вас критерии успешности начинают размываться очень быстро, да? Вы там, о'кей, ладно, давайте вынесем на сцену LM as a judge на трёх ножках, да, который, значит, будет всё оценивать. Ну, как вы понимаете, э, ну, как бы у него там баясы тоже какие-то есть, да, вот, и много других проблем. Дальше, все ли задачи вообще важны с точки зрения прикладных систем? Понимаете, всегда можно придумать какую-то искусственную задачу, которую будет, не знаю, один человек в мире решать. Вот он там типа он выходит на сцену, берёт микрофон и показывает: "Смотрите, чудо, я умею решать задачу, которую никто не умеет решать". Надо, не надо? Ну, типа разрезкательной точки зрения, да, но с практической, если мы создадим систему, которая будет решать там подавляющее большинство экономически обоснованных задач, ну, типа разница её с системой, которая будет решать абсолютно все там задачи посильные для любых савантов, гениев, ну, как бы, наверное, никакой с прикладной точки зрения. Ну, и в конце концов, да, как проверять, что мы это AGI достигли. Ну, там лучше тесты тюринга, ничего нет, да, чтобы там не говорили, можно про это спорить. Люди там периодически заявляют, что тест тюринга пройден. Он не пройден даже близко. Возьмите там arc какой-нибудь и посмотрите, какой там процент прохождение у современных моделей. Но, а, значит, на самом деле вот эта проблема в том, что - это вообще неправильный ориентир для развития технологий. Вот. И это очень хорошо видно по вот таким курьёзным случаям, когда там, не знаю, просачивается инфа о том, что Microsoft и Open AI договорились, что значит что такое AGI, да? Это вот система, которая может 100 млрд долларов заработать, да? Это как в Маленьком принце, помните? Там типа взрослым очень трудно объяснить, что такое красивый дом, да? Потому что, ну, он как бы вот будет вас слушать как-то, в общем, и не слушать, да? Но если вы ему скажете, что этот дом стоит 100 млн лир, то взрослый воскрент: "Какая красота!" Вот. Ну вот 100 млрд долларов, тут хочется похохмить, конечно, там, а как? Надо ли долларовую инфляцию учитывать там год от года? Это вообще курс AGI там вырос, понизился в этом году. Вот понятно, что инженерам это всё смешно и даже немножко противно, да, там, когда люди, ну вот начинают рассуждать о технологиях в терминах скорее экономики, чем технологии. Это, кстати, может быть не так глупо, да, но с той точки зрения, что мы как бы э давая такое определение, мы вроде как бы стремимся включить в в оборот какие-то, значит, там экономические ээ feible задачи. Но проблема, знаете, в чём будет? Вот реальная проблема вот с этим определением. Люди деньги эти начнут зарабатывать, ну, типа, гораздо раньше, чем будет создан там условный AGI, и зарабатывают уже сейчас при помощи -э генеративного и ээ И будет скорее как такой комтинструмент, да? То есть вы в мире, где нету вообще никаких инструментов и, да, и и вам вдруг принесли и поставили на стол клод код, да, современный, вы там заработаете на нём 100 млрд долларов. Но в мире, где у вас есть, э, там десяток других моделей сопостамимого класса, да, вы там уже 100 млрд не заработаете. Поэтому у вас ещё проблема, что вот это экономическое определение, оно действительно очень мало что говорит о технологической стороне вопросы. Вот поэтому, конечно, с практической точки зрения нам нужны системы, которые должны стать хорошими инструментами, да? Нам нужны вот те самые системы, которые расширят границы, возможности человеческого разума. И фокусы развития технологий, вот исходя из такого ориентира, да, поправленного, они становятся, конечно, вполне ощутимыми. То есть мы там начинаем понимать, ага, мы там хотим повышение управляемости моделей, мы хотим, чтобы них там, не знаю, functionшлинг работал надёжнее, да, например. А мы хотим, чтобы вот они в сценариях сотворчества были эффективны, да, чтобы, э, значит, там развивались определённые определённые технологии, которые вот, ну, прямо типа нужны и они влияют на на применение инструментов. Ещё вот важное измерение развития технологии - это иммерсивность. То есть вот, ээ, типа сегодня мы, когда взаимодействуем с системами искусственного интеллекта, нам часто надо специально учиться с ними эффективно взаимодействовать. То есть мы вот, ну, просто взяв с коробки систему, мы там, ну, о'кей, какие-то предпринимаем усилия, чтобы научиться правильно вопросы формулировать, да, уточняющие там как-то, значит, как харнес делать для модели. Но, значит, постепенно вот развитие моделей, оно придёт к достижению такого второго уровня ими, когда у нас возникнут инструменты и иск, взаимодействие с которыми будет столь же естественно, как взаимодействие с людьми. И вам, чтобы э начать взаимодействовать с такой моделью, не нужно будет учиться ничему специальному, но сверх того, чего вы учитесь, не знаю, начиная общаться с новым человеком. Вот. Ну а когда-то в более далёком будущем, конечно, возникнут системы третьего уровня ими, когда, э, система искусственного интеллекта будет восприниматься как продолжение собственного тела, как продолжение себя. И вот некоторые технологии, которые человечество создаёт, они дошли до такого уровня им- это, например, одежда и обувь, да? Вот вы когда идёте по улице, вы же там не думаете: "Так я могу или не могу сейчас на этот камешек наступить, да, там типа: "а меня на ноге ээ ботинок, поэтому я могу", да? Вы нет, у вас как бы в ментальную модель вашего тела ваша одежда уже включена, и вы уже как бы относитесь к своему телу как к одетому телу, да? Вот и вам скорее поправки надо вносить, когда вы голый вышли ночью в туалет. И вот что можно больно ушибиться. Вот. А, да. Значит, ну, так вот, мы с вами сейчас живём в мире больших языковых моделей. Он прекрасен. Вот я очень его люблю. Я всеми силами стремился ээ приблизить его наступление.
[смех] Вот не знаю уж, насколько мой вклад был в это, но надеюсь, что какой-то был. Значит, а, и, э, образ будущего в глазах технологических компаний, он вот так примерно выглядит, да? То есть у вас есть какая-то вот AGI LLM, да? А вы там, значит, у вас есть трактор, и вы доступ к этому трактору сервис продаёте, и он всем нужен, да? То есть всем нужен этот трактор, все выстраиваются в очередь и несут вам, ну, там, как у кого что есть, да? То есть вот и, э, в целом технологические компании, они вот держат в основном такую картинку в своей голове примерно идейно, да, когда, э, развивают технологии. И вот, а, и в целом, ну, кажется, что, ну, вот сейчас мы ещё побольше Лэмку обучим, побольше данных соберём, по получше немножечко алгоритмы обучения и всё прочее, и вот этот мир настанет. Вот. Ну, вот где мы на самом деле-то находимся, да? Мы вот знаем, что там мировое развитие технологии, оно обычно, конечно, не по экспонентам идёт. Экспоненты долго не живут. Вот. А на самом деле мы имеем дело, ну, вот с какими-то такими сигмоэдальными трендами, когда есть технология, которая поначалу очень быстро масштабируется, быстро совершенствуется небольшими затратами, потом там основные как бы ресурсы экстенсивного развития начинают исчерпываться постепенно. Инвестиции в развитие становятся, каждый следующий шаг всё дороже и дороже становится. Да. И в конце концов технология выходит на какое-то вот такое плато, когда её совершенствование требует там совершенно неподъёмных инвестиций. Ээ значит, и вот а где современные-то декодерные трансформеры находятся? И где мы вот с точки зрения вот этой картины мира? Вот мне кажется, что ну вот типа мы сейчас примерно вот тут. То есть у нас вот это вот кривое масштабирование, она начинает постепенно сейчас загибаться к низу, да? То есть начинает уменьшающаяся отдача проявляться, Diminision returns. Вот. И, э, значит, почему вообще, ну, нельзя взять и вкачать в эти модели ещё больше там вычислений, данных, ограничиться лишь небольшими итеративными наработками, да? Вот как у Стругацких кадавр неудовлетворённый желудочно. Мы, значит, в этого кодавра сейчас селёдочных голов погрузим побольше, и он наестся и вот тогда-то начнёт мыслить как следует. Вот. И вот прибли проблемки есть, да? То есть, ну, первая проблемка, про неё все знают хорошо, это квадратичный квадратичная сложность модуля Self Attention. А, и понятно, что есть там много трюков, КВши, там всякие вот это дело, но всё равно фундаментально сложность остаётся квадратичной, и у вас Dce Attention может смотреть, ну, о'кей, сегодня на миллион токенов, например, да, когда-то через какое-то время, может быть, сможет на на 2 млн токенов смотреть, но, ээ, значит, там каждый следующий шаг совершенно точно будет дороже. Много ли это миллион токенов? Если мы просто про текст говорим, вообще много. 2.500 страниц текста убористым шрифтом. Но как только мы начинаем работать с другими модальностями, например, с видео, с аудио, там вообще беда сразу наступает. То есть оказывается, что миллион токенов вам нужен либо какой-то энкодер, который очень сильно размерность будет сокращать, вот, но этот энкоodдер будет какие-то фичи неизбежно терять, понятное дело, особенно если вы учите отдельно от э вашей задачи end to end. А, да. Ну и ещё есть рининг, ещё есть код, да, там, допустим, современный проект большой софтверный, он может быть легко больше миллиона токенов. И что делать будем? Вот, значит, это важный барьер, который нам не позволяет ограничиться одними только декодерными трансформерами. Дальше, значит, вот современные модельки, э, они декодерные трансформеры, в них рекурентности нету. Это fitфо сетка, на самом деле, да? То есть в ней сигнал распространяются только от переднего слоя к заднему. Что это значит? Это значит, что на генерацию каждого токена у сетки есть фиксированный вычислительный бюджет. Она не может больше какого-то числа математических операций выполнить в принципе, да, потому что у неё число слоёв ограничено, да? А значит, а что, если вам для нахождения правильного ответа нужно какую-то циклическую операцию выполнить? Ну, то есть я не знаю, вам задачу положили в левый контекст или, не знаю, просто даже там скобки посчитать, числа отсортировать, да? Вот оказывается, что трансформеры, они очень быстро на таких задачах ээ ну падают, да, потому что, ну, типа сколько верёвочки не вейся, у вас фиксированное число слоёв и ничего с этим не сделаешь. И можно подобрать задачу такого размера, которая в рамках бюджета генерации одного токена гарантированно решаться не будет. Вот, значит, придумано некоторое количество трюков. Давайте мы рининг подключим, да? Значит, вот не один токен будем генерировать, а будем цепочку токенов генерировать. И вот этот цикл загоним внутрь генерации токенов. Это, в принципе, работает в некоторых очень простых задачах, но на самом деле не очень, потому что, э, ну, у насплирование - это нуклеус, оно не дифференцируемое. Мы end toend цепочкам рининга почти не учим. Ну там современные рельсмы пытаются эту проблему решать так или иначе, но эффективных способов end to обучение длинным цепочком рининга, так, чтобы градиент прямо проходил через каждый токен, такого пока универсального метода нету. Вот дальше, ну, мы можем тулы генерить. Вот. Ну, типа, если наша модель понимает, что сейчас ей надо цикл запустить, она там сгенерирует какой-то код, в котором будет вызывать, не знаю, там саму себя и и и ещё что-то. Можно так. Ну да, в целом можно, но упирается тоже в сложности end to обучения таким вещам. Вот. Раздувает контекст, работает пока плохо. Вот. Это здесь может спасти, ну, разные другие архитектуры, например, архитектуры с рекурентностью. И вообще вот есть проблема, которая с предыдущей связана косвина, это проблема адаптивного вычислительного времени. Вот а что, если, э, значит, нам надо над какими-то задачами подольше подумать, над какими-то поменьше, как это люди делают. А, а ведь сейчас сетка, когда в ответ на ваш привет вам привет пишет, она на это тратит ровно столько же вычислений, сколько, ну, там, генерируя ответ на какой-то сложный вопрос. А на ваш привет приветом могла бы нграммная модель вообще ответить. Вот. А поэтому, э, значит, это в целом крайне нерациональное использование мощностей вычислительных. И ещё и понимаете ведь в чём дело? Вот у вас э не знаю, вас, если ткнуть иголкой в руку, вы руку отдёрнете сразу, сигнал даже не успеет дойти до до глубоких каких-то структур вашего мозга. Вот у какого-нибудь робота, да, там, если вы ему в голову запихнёте трансформерную модель там с миллиардами параметров на его бортовой вычислитель, что с этим роботом произойдёт? Но он упадёт у вас. Он у вас не будет успевать реагировать на изменение как бы данных сенсоров с должной скоростью просто-напросто. Вот. И на самом деле модели с адаптивным вычислительным временем, они очень нужны вот в этом самом физическом Ии. Вот без них, ну, в принципе, никуда уехать нельзя. Сейчас, понятное дело, там делают, ну, типа там одна модель за равновесие отвечает, а другая модель за сложные действия. Ну, о'кей, а что, если нам надо наше сложное действие связано там с каким-нибудь равновесием, да, там, не знаю, мы хотим роботам ходить по канату и жонглировать там, не знаю, ну вот и что будет, да? То есть вот связка, э, просто маленькой и большой модели нам тут проблему, скорее всего, не поможет решить. То есть нам нужна какая-то более хитрая, адаптивная система. Вот. Недифференцируемое ассамплирование. Ну, это просто стыд, знаете, как в своё время, э, я шутил, почему инопланетяне с нами не общаются, да? Потому что мы лампочками накаливания освещаем помещение, которое 99% энергии на тепло тратит и только 1% на свет. Да. Вот у нас вокруг вот этой вот гигантской высокотехнологичной нейронки, которая там распределение генерирует, у нас набор рулов есть, которые там типа что-то сортируют вероятности из этого распределения, там какая-то константа, топ nн, топ k, там мы что-то выбираем. С чего мы взяли вообще, что этомплирование, оно для всех задач должно быть одинаковое для всех токенов в последовательности? Потому что если вы генерите ответ на вопрос MMLU, вам жадное самплирование, понятное дело, лучше. А если вы пишете, не знаю, там сказку, вот, ну там, современные модели, которые тюнились на верифицируемых тестах, там типаlю, они чудовищно плохи в креативном писательстве. Ну просто очень плохи. Они сочиняют однотипные дурацкие сказки. Вот. А и до сих пор это не ээ параметры ассамплирования особо никто не учит. Их там один раз подстраивают под модель там какой-то берут набор тестов, по нему подстраивают и поехали в продакшн. Это очень грустная картина. Токинизация тоже не дифференцируемая. У нас модель не знает, что внутри токена живёт. Токенизация очень нужна. Она позволяет контекст там раз в пять увеличить, но э всё, что внутри токена находится для модели - это чёрный ящик. Она это всё там как-то может выучить из контекста, да, понять, что какие символы внутри. Но почему современные модели не могут там посчитать буковки там в тексте, да, или там текст задом наперёд перевернуть? Потому что для них текст - это последовательность токенов, а внутри токена модель не твёрдо знает, что лежит, да? И да, это вот плата за увеличение контекста, но плата дорогая, потому что некоторые задачи решаются плохо. Вот поэтому здесь, ну, как бы очевидно есть альтернативные подходы. Кстати, буквально сегодня активно обсуждали про by level модели, но со спекулятивным декодингом. И как бы совмещение спекулятивного декодинга с кинайerфри подходом, оказывается позволяет там по добавля добиваться производительности похожей на модели стакинизации с точки зрения длины контекста. При этом некоторые задачи решать прямо сильно лучше. Дальше у нас модели раз и навсегда обучаются, да, и потом в процессе эксплуатации никакого до обучения не происходит. Модель учится там месяца два топовая. Она там обо всём мире знает картину мира 2 месяца назад. За 2 месяца, извините, такие вещи происходят в мире, да, в том же мире машинного обучения, не говоря уже о реальных событиях, которые нас шокируют последние годы, каждый месяц. Какая-нибудь хрень. Вот, значит, ладно бы, полбеды. Отчасти это можно решать рагами и там каким-то опять же харнесом. Но если за это, за эти 2 месяца появился новый подход к решению каких-то задач, никакой рак вам не вытянет, да, применение нового подхода. Ээ отсутствие асинхронного режима, вот, э, я говорил уже, да, про адаптивное время реакции. На самом деле вообще нехило было бы уметь модели запускать на каком-то, не знаю, рое вычислительных устройств, связанных какими-то ненадёжными с произвольной латентностью связями друг с другом. Это прямо иногда нужно, ээ, вот и не только, значит, на поле боя. Э вот я надеюсь, что мы там обозрим в будущем, полетим куда-нибудь на Луну базу строить. Вот у вас прикиньте, да, на Луне будет там робот, у него на борту там какое-то устройство там супердишманское. Значит, где-то там на лунной базе тоже какие-то ГПУхи стоят супер заэкранированные от излучения, вот, но более мощные, да, а на земле стоит значит защищённой земной ионосферой суперкомпьютер, да. Но вот все эти компоненты, они связаны там каналами связи, с большой латентностью, с задержками, иногда и теряющими, в принципе, пакеты. Есть ли у нас архитектуры, которые позволяют модель развернуть вот на такой гетерогенной инфраструктуре? Пока хороших нет. Дальше, отсутствие долгосрочной памяти. На самом деле, ну, как бы если бы решалась проблема длинного контекста, может быть, это и не было бы проблемой, потому что, ну, положили в левый контекст модели всё на свете. И вот, но, ээ, на самом деле, поскольку это не так, проблема долгосрочной памяти, она становится довольно острой. Нативные мультимодальность отсутствует в соревенных моделях. Чаще всего с модальностями модели работают через какие-то кодировщики, которые обучаются отдельно от самих моделей. Это, на самом деле, старое доброе послойное обучение во времён Deep Believe Networks. И это тоже стыдно. Вот. Но не от хорошей жизни, как мы понимаем. У нас есть, например, много неразмеченных данных, и мы можем их потратить, чтобы обучить там хороший энкоodдер, а потом уже учить, ну, там, остальную часть модели. Но это послойное обучение, да. На моменте притрейна ваш энкоodдер про целевые задачи обычно ничего не значит, поэтому вам повезёт, если он выучит хорошее представление для вашей целевой задачи. А если нет, вот, значит, поэтому здесь нужен какой-то более общий подход, да? То есть нам нужно учиться, э, учить сетки, не знаю, там с несколькими головами на разных уровнях, да, там здесь применять данные, э, размеченные, здесь не размеченные. Ну, здесь много идей, как это может решаться, но в целом проблема ясна. Дальше у нас представления сеток, они неразделимые. У нас внутри сетки одними и теми же весами кодируется как фактология какая-нибудь дренная, так и какие-то сложные когнитивные операции, которые сетка должна уметь делать. Да, как бы так сделать, чтобы вообще не тратить ресурсы сетки на запоминание того, что можно подсмотреть в справочнике, да? Ну, типа, вот зачем нам, э, чтобы сетка помнила, не знаю, там, годы жизни, там кого-нибу, ну, то есть какую-то чепуху, которую ещё и мы, на самом деле, плохо контролируем фактологию внутри этой сетки, да. Если бы мы бы могли, э, фактологию всю вынести из сетки наружу, доверить её там каким-нибудь рагам, да, а веса сетки задействовать под крутые всякие когнитивные операции, типа там, которые важны для создания агентов, то можно было бы создать какие-нибудь реально маленькие модельки, но очень крутые, мощные с точки зрения их возможностей в агентных системах. Но здесь тоже ээ большой ресёч предстоит, чтобы это решить. Вот, короче, время я уже почти совсем исчерпал, уже время на вопросы пошло. Важный ещё момент, я не буду долго говорить, но почему мы не можем опять же просто сидеть на попе ровно. У нас вычислительные бюджеты в мире растут темпами более быстрыми, чем э количество оцифрованных данных текстовых в первую очередь. А там, хотя вроде данные экспоненциально растут, но реально вот эта экспонента, она имеет меньшие показатели, ээ, чем экспонента роста компьютера, да? То есть вот, если посмотрите, как там Википедия растёт, Liipgen, там Common Cрол, это всё какие-то немножко сверхлинейные тренды, но показатель там этой экспонента, он сильно меньше, чем у компьютера, да. компьютера это прямо вот прёт, прёт, прёт пока что, да, ну, скоро упрётся тоже в энергетику, там некоторые другие вещи, но тем не менее у нас поэтому, понимаете, вопрос-то куда девать вот этот ээ компьютер лишний, да, что называется, как нам променять лишний компьютер на поумнение модели без привлечения дополнительных данных. Там супер много идей. Вот. Короче, и это прямо сейчас очень горячий ресч. Дело не в том, что данные в мире кончились. Дело в том, что у нас сейчас ограничивающим фактором становится масштабирование данных. Есть, как вы понимаете, много интересного, начиная от синтетики, там L плюс ризонинга, всяких более сложных целевых функций обучения, использования других модальностей, там разные тест compute, курикулумнг, активное обучение, чёрт его знает, что ещё. Но когда рецептов много, как вы понимаете, это говорит о том, что, ну, хорошего рецепта нету, да? То есть все они чуть-чуть там помогают, но серебряной пули пока нет. Майнстримного решения для этой проблемы до сих пор нету. В общем, в сухом остатке есть такоя картинка. Вот вы её можете сфоткать, потом там написать мне в канальчик, если хотите обсудить что-то более подробно. Я это просто резюме того, что я сегодня рассказал. Ну, и отчасти, может быть, рассказать не успел. То есть это мои представления о том, что будет следующее поколение больших моделей отличать от текущего. Ну там, конечно, не всё это сбудется, что-то быстрее поедет, что-то медленнее, но это вот те сравнительно радикальные изменения, которые вполне вероятно произойдут в новом технологическом стеке по сравнению со старым. Спасибо большое, что меня послушали.
M.
The words are the caption track's own and nothing is reworded or re-transcribed. Paragraph breaks are placed between sentences so the text reads as prose.
Free tools for your own script. No signup, no login.
Paste your draft and see where viewers are likely to drop off, with a rewrite for each weak line.
Paste the first 30 seconds of your own draft for a hook score and rewrites.
Check your draft against YouTube's advertiser-friendly guidelines before you record it.
Read this channel's public videos and transcripts, and download a writing brief for it.
| 22 |
Most used terms