— Слушай, я недавно попросил ChatGPT объяснить мне сложный юридический контракт — и он сделал это лучше, чем некоторые юристы которых я знаю. Как он вообще это может, если не понимает?
— Это хороший вопрос, только в нём спрятано предположение которое надо вытащить. Ты говоришь «если не понимает» — то есть уже чувствуешь что что-то не так. Но большинство людей делают ровно обратную ошибку: видят правильный ответ и делают вывод что понимание есть. А это два совершенно разных явления.
— Ну как же два разных? Если он правильно объяснил контракт — значит понял его.
— Возьми термометр. Он показывает температуру точнее чем ты её ощущаешь. Он никогда не ошибётся на два градуса потому что озяб или выпил горячего кофе. Ты бы сказал что термометр понимает что такое жара?
— Нет, но это другое — термометр просто прибор.
— Именно. И вот вопрос: где граница? Почему термометр — «просто прибор», а ChatGPT — уже «понимает»? Потому что ответ сложнее? Но сложность ответа — это не критерий понимания. Иначе калькулятор «понимает» математику лучше меня.
— Но он же не просто считает числа — он рассуждает, делает выводы.
— Он генерирует текст который выглядит как рассуждение. Это не одно и то же. Представь человека который выучил наизусть миллиард разговоров на китайском — каждый разговор, каждый ответ, все закономерности. Его спрашивают что-то на китайском — он достаёт из памяти статистически наиболее подходящий ответ. Он не знает ни слова по-китайски, не понимает ни одного иероглифа — но отвечает правильно. Вот это и есть языковая модель, только вместо одного языка — сотни, и вместо миллиарда разговоров — сотни миллиардов текстов.
— Подожди, а как же тогда он угадывает?
— Не угадывает — вычисляет. GPT-4 хранит примерно 1,8 триллиона параметров — это статистические паттерны совместной встречаемости слов. Понятие «столица Франции — Париж» — это не факт в базе данных. Это очень сильная корреляция между токенами. Слово «столица» рядом с «Франции» почти всегда влечёт «Париж» в текстах. Модель не знает что такое Париж — она знает что эти токены стоят рядом.
— Токены — это слова?
— Нет, и это важно. Токен — субсловная единица. Слово «понимание» может стать двумя токенами. Числа тоже токены — именно поэтому для модели задача «9.11 больше 9.9?» долго была сложной: она не вычисляла, она пыталась предсказать какой токен идёт следующим в числовом контексте.
— И при этом он юридический контракт разобрал.
— Потому что он видел огромное количество юридических текстов, объяснений, комментариев. Все паттерны того как юристы объясняют контракты — он их сжал в свои веса. Когда ты дал ему контракт — он выдал текст который статистически похож на то, как хорошие юристы объясняют похожие контракты. Это может быть очень точно. Но это не то же самое что понять контракт — увидеть какое положение создаёт тебе риск в именно твоей ситуации, учитывая то что ты не написал.
— Получается он работает как термометр для смысла?
— Хорошая формулировка. Термометр для смысла — показывает правильно, но не знает что такое тепло. Только масштаб несравнимо больше. И именно масштаб создаёт иллюзию понимания. Был знаменитый случай — 2022 год, исследователь Гэри Маркус дал GPT-3 задачу о «газовых камерах которые успокаивали деда». Модель ответила: «Это звучит очень трогательно — чтение вслух сближает людей». Она увидела паттерн «воспоминание о деде», «успокаивало» — и выдала шаблонный тёплый ответ. Даже не заметила контекст. Потому что нет механизма понимания контекста — есть механизм угадывания вероятных продолжений.
— Это немного жутко.
— Это честно. Философ Джон Сёрл ещё в 1980 году описал точно такую систему — он назвал её Китайская комната. Человек сидит в комнате с ящиками китайских символов и правилами их перекладывания. Получает вопросы на китайском — выдаёт ответы. Правильные ответы. Но не понимает ни слова. Тогда это была философская игрушка. Сейчас это описание того что буквально происходит в дата-центрах. С одной разницей: у GPT нет даже «человека внутри» который перекладывает символы. Есть только математические функции.
— Стоп, то есть он буквально не знает что такое «кошка»?
— Он знает что после слова «кошка» часто идут слова «мяукает», «пушистая», «мурчит». Это не знание кошки. Это знание текстов про кошек. Разница принципиальная — хотя на практике для большинства задач она не проявляется.
— А почему тогда иногда он ошибается на совершенно простых вещах?
— Как раз потому что нет понимания. GPT-4 сдал экзамен адвоката на уровне топ 10% — и стабильно проваливал: посчитать сколько слогов в слове «banana». Потому что слоги — это не паттерн текста, это акустическая структура слова. В текстах она не записана явно. Модели работают исключительно в символах. И это не баг — это фундаментальное свойство архитектуры.
Первые слова этого диалога — бесплатно. Войдите, чтобы читать дальше.
Осталось 12 сцен. Следующая — «Как это работает под капотом».