Чому наступна велика революція в ШІ буде не про текст

world models chomu nastupna velyka revoliutsiia v shi bude ne pro teks featured 20260728 113604

Упродовж останніх років штучний інтелект асоціювався насамперед із великими мовними моделями (LLM) — системами, що навчилися передбачати наступне слово в тексті з вражаючою точністю. Однак дедалі більше дослідників доходять висновку, що цього недостатньо для взаємодії з фізичним світом. Новий підхід, відомий як «world models» (моделі світу), може стати наступним великим кроком у розвитку штучного інтелекту.

Інтерес до цієї технології підтверджується значними інвестиціями. Yann LeCun, колишній головний науковець зі штучного інтелекту Meta, зібрав понад мільярд доларів для стартапу AMI Labs, який планує будувати моделі світу на основі архітектури Joint-Embedding Predictive Architecture (JEPA). Майже одночасно інша піонерка ШІ, Fei-Fei Li, залучила подібну суму для своєї компанії World Labs, зосередженої на просторовому інтелекті.

Що таке моделі світу

На фундаментальному рівні моделі світу роблять саме те, що випливає з назви: вони будують математичну модель світу (або конкретного середовища — від складу до відеогри), яку потім можна використовувати для прогнозування того, як світ зміниться у відповідь на певні дії або зміну умов.

Хоча точне визначення залишається предметом дискусій, більшість дослідників погоджуються, що моделі світу — це системи, здатні до «передбачення майбутнього стану залежно від дії». Як пояснює Юнчжу Лі, доцент кафедри комп’ютерних наук Колумбійського університету, ця ідея має сильний зв’язок з інтуїтивними моделями в людській свідомості: ми можемо уявити, як зміниться середовище або як об’єкт рухатиметься, якщо застосувати певну дію. Дослідники хочуть навчити роботів або віртуальних агентів робити те саме — уявляти наслідки своїх дій.

Як зазначає Манлін Лі, доцентка комп’ютерних наук Північно-Західного університету, концепція моделей світу має глибоке коріння. Вона виникла ще в 1950-х роках, коли когнітивні науковці намагалися описати ментальні моделі, які люди використовують для симуляції свого середовища в голові. Сучасна інкарнація ідеї бере початок із дослідження 2018 року «World Models» авторства Девіда Ха та піонера глибокого навчання Юргена Шмідгубера. Ранні моделі від Google, такі як PlaNet та Dreamer, були серед перших, що розв’язували задачі шляхом попереднього прогнозування результатів різних дій.

Чим моделі світу відрізняються від великих мовних моделей

Головна відмінність полягає в принципі роботи. LLM, попри свою вражаючу здатність генерувати текст, перекладати, писати код і вести розмову, за своєю суттю є системами, що передбачають найімовірніше наступне слово в послідовності. Вони чудово виявляють і продовжують патерни, але не мають внутрішнього розуміння світу, який ці патерни описують. Вони добре відповідають на запити, але погано міркують про наслідки або діють у середовищах, де помилки дорого коштують.

Моделі світу, навпаки, будують внутрішню симуляцію реальності. Вони дозволяють системі задавати просте, але фундаментальне питання: «Якщо я зроблю це, що станеться далі?». Люди покладаються на цю здатність постійно — ми уявляємо, як склянка перекинеться, перш ніж впасти, або як розмова піде не так, перш ніж обрати слова. Раніше машини не могли цього робити добре.

Ян ЛеКун, який отримав звання одного з «хрещених батьків глибокого навчання», неодноразово висловлював думку, що підхід LLM (генерація контенту по одній одиниці за раз) призводить до втрати зв’язності зі збільшенням довжини виводу. Моделі світу, на його думку, є більш перспективним шляхом до загального штучного інтелекту.

Потенційні застосування та обмеження

Найбільш очевидна сфера застосування моделей світу — робототехніка. Навчити робота розпізнавати чашку легко, але навчити його підняти її, не розбивши, — важко. Реальний світ не пробачає помилок: об’єкти мають вагу, поверхні — тертя, рідини проливаються. Моделі світу можуть дозволити роботам симулювати різні способи виконання завдання, перш ніж застосувати їх на практиці, що особливо важливо в небезпечних або дорогих сценаріях.

Інша ключова сфера — автономні транспортні засоби. Самохідні автомобілі з моделями світу можуть не просто реагувати на сенсорні дані, а прогнозувати потенційні небезпеки, планувати маршрути та приймати безпечніші рішення, симулюючи дорожню динаміку, стан дороги та поведінку пішоходів.

Вони також мають потенціал у наукових відкриттях — геноміці, розробці ліків і кліматичному моделюванні. Наприклад, ШІ-симуляції можуть допомогти передбачити згортання білків або спроектувати нові матеріали. У бізнес-доменах моделі світу могли б моделювати вплив рішень на ланцюги постачання, фінансові ризики або ринкову поведінку.

Водночас технологія стикається з серйозними викликами. Як зазначають експерти, для роботи моделей світу на комерційному рівні потрібні значні обчислювальні потужності, які наразі відсутні навіть у найбільших дата-центрах. Деякі дослідники припускають, що справді ефективні моделі світу можуть стати реальністю лише в другій половині XXI століття. Крім того, проблеми безпеки та пояснюваності, які нині вирішуються для генеративних ШІ, можуть виявитися зовсім іншими для цих моделей, а існуючі методи пояснення рішень ШІ навряд чи будуть застосовні до цих нових моделей.

Попри це, інтерес до моделей світу стрімко зростає. Як зазначив на конференції GTC генеральний директор Nvidia Дженсен Хуанг, наступний рубіж — це не просто більші мовні моделі, а ШІ, здатний розуміти та симулювати реальність.

Найцікавіше за тиждень

Один лист на тиждень. Без спаму.

Нові статті, добірки та корисні матеріали DAY TODAY — в одному короткому листі.

Стаття була цікавою?

Оцініть цю статтю!

Середній рейтинг 0 / 5. Кількість голосів: 0

Ще немає голосів. Будьте першими!

Дякуємо за відгук!

Підписуйтесь на нові статті!

Шкода, що стаття вам не сподобалась...

Дозвольте нам її покращити!

Розкажіть, будь ласка, що ми можемо виправити

Схожі статті

Copy link