К содержимому
Claude Code с 0:полный курс
ОсновыАвтор: Михаил Кузьмицкий

Что такое LLM: языковая модель простыми словами

Коротко

Как устроена нейросеть, которая пишет текст: предсказание слов, обучение на текстах, параметры и контекст — без формул и математики.

Ты задаёшь вопрос — и через секунду на экране появляется связный, грамотный ответ. Ощущение, что по ту сторону сидит кто-то очень начитанный: он «понял» вопрос, «подумал» и «ответил». Аббревиатура LLM мелькает в каждой новости про ИИ, но что за ней стоит, обычно не объясняют — как будто все и так знают.

А понимать стоит: от этого зависит, как ты будешь пользоваться инструментом. Кто считает LLM всезнающей энциклопедией — доверяет ей лишнее. Кто считает «просто автодополнением» — недооценивает и проходит мимо реальной пользы. Правда интереснее обеих крайностей, и её можно объяснить без единой формулы.

Поток текста превращается в цепочку светящихся звеньев, где каждое следующее звено достраивается из предыдущих

Коротко

LLM — large language model, большая языковая модель. Это нейросеть, обученная на огромном количестве текстов делать одно: предсказывать, какое слово с наибольшей вероятностью продолжит уже написанное. Из этого простого механизма, повторённого миллионы раз, вырастает всё остальное — ответы на вопросы, переводы, код и стихи. Внутри нет базы фактов и нет «понимания» в человеческом смысле — есть очень хорошо выученные закономерности языка.

Расшифровка и суть

LLM расшифровывается как large language model — большая языковая модель. Каждое слово тут по делу. «Языковая» — потому что она работает с текстом и только с ним. «Модель» — потому что это не программа с прописанными правилами, а математическое устройство, которое само настроилось на примерах. «Большая» — потому что настроек в ней миллиарды.

А делает она, по сути, одну-единственную вещь: смотрит на уже написанный текст и предсказывает, какой кусочек текста вероятнее всего идёт дальше. Увидела «Мороз и солнце; день…» — почти наверняка продолжит «чудесный». Увидела твой вопрос про налоги — предскажет первое слово ответа, потом, глядя на него, второе, потом третье. Ответ не достаётся откуда-то целиком: он рождается слово за словом, и каждое следующее опирается на всё, что уже написано.

Звучит слишком просто для технологии, которая пишет работающий код? В этом и фокус: чтобы хорошо предсказывать продолжение любого текста, модели пришлось выучить грамматику, стиль, логику рассуждений и массу сведений о мире — иначе предсказания были бы плохими.

Как она училась

Модель обучали на гигантском корпусе текстов: книги, статьи, сайты, документация, код. Процесс выглядел одинаково триллионы раз подряд: модели показывают кусок текста со скрытым продолжением, она угадывает следующее слово, ответ сверяют с оригиналом — и чуть-чуть подкручивают внутренние настройки, чтобы в следующий раз угадала точнее.

Важно, что именно осталось после обучения. Не библиотека и не архив: тексты в модели не хранятся, найти в ней «файл со статьёй» невозможно. Остались закономерности — какие слова тянутся друг к другу, как строится довод, чем рецепт отличается от договора, как выглядит правильный код. Это похоже на знание родного языка: правил ты не цитируешь, но безошибочно чувствуешь, что «по коридору бежал стол» — что-то не то.

Отсюда два следствия, которые объясняют половину странностей ИИ. Первое: модель знает только то, что встречалось в текстах до определённой даты — у неё есть «граница знаний», и вчерашние новости за ней. Второе: раз фактов как таковых внутри нет, модель не «вспоминает» ответ, а каждый раз строит его заново — обычно верно, но без гарантий.

Параметры: почему «больше» не всегда «лучше»

Те самые внутренние настройки, которые подкручивались при обучении, называются параметрами. Можно думать о них как о крутилках на гигантском пульте: у современных моделей их миллиарды. Когда пишут «модель на 70 миллиардов параметров», имеют в виду именно это — размер пульта.

Долго казалось, что рецепт прост: больше параметров — умнее модель. Отчасти это правда, у крупных моделей заметно лучше с логикой и нюансами. Но гигантская модель дороже, медленнее и прожорливее, а качество зависит не только от размера: не меньше решают обучающие тексты и то, как модель дообучали быть полезным собеседником. Аккуратно обученная средняя модель нередко обходит небрежно обученную огромную, а для простых задач компактной хватает с запасом. Поэтому у разработчиков и линейки из нескольких моделей: быстрые для простого, мощные для сложного.

Контекстное окно: рабочая память

У модели есть ещё одна важная характеристика — контекстное окно. Это объём текста, который она способна «держать в голове» одновременно: твои сообщения, свои ответы, приложенные документы.

Бытовая аналогия — рабочий стол. Всё, что лежит на столе, у тебя под рукой: можно сверяться, сопоставлять, цитировать. Но стол не бесконечен: когда бумаг становится слишком много, самые давние приходится убирать, и они выпадают из работы. Так и модель в очень длинном диалоге может «забыть», о чём шла речь в начале, — не из-за вредности, а потому что начало уже не помещается в окно.

Практический вывод: у долгого разговора качество плавает, и это нормально. Если чат разросся, а тема сменилась — начни новый и кратко введи модель в курс дела. Заодно это объясняет, почему модель не помнит вчерашнюю беседу: каждый новый чат — чистый стол.

Почему она уверенно ошибается

Теперь главное следствие всей конструкции. Модель всегда выбирает наиболее правдоподобное продолжение — но «правдоподобное» и «правдивое» не одно и то же. Когда закономерности из обучения дают точный ответ, всё отлично. Когда не дают — модель не останавливается и не говорит «не знаю»: она всё равно достраивает текст самым вероятным способом. Получается складная, уверенная и неверная фраза — выдуманная книга, несуществующая функция, перепутанная дата. Причём написана она тем же тоном, что и правда: механизм-то один.

Это не поломка, а прямое следствие устройства, и полностью «починить» его нельзя — но можно сильно снизить вред: проверять важное, просить источники, давать модели материал, на который она обопрётся. Мы разобрали это отдельно — почему ИИ выдумывает факты и как это снизить. А если хочешь спокойно, шаг за шагом уложить в голове всю картину — от предсказания слов до безопасного применения, — на сайте есть бесплатный курс основы ИИ и практический курс про Claude.

Мифы и реальность

МифКак на самом деле
LLM ищет ответы в интернетеСама по себе — нет: она порождает текст из выученных закономерностей. Поиск — отдельная надстройка, которая есть не везде и не всегда включена
Внутри хранится база всех текстовТексты не хранятся; после обучения остаются только закономерности — восстановить исходники дословно из модели нельзя
Модель понимает слова, как человекОна оперирует статистическими связями между словами. Результат часто неотличим от понимания, но механизм другой — и на редких случаях это проявляется
Чем больше модель, тем лучше ответыРазмер — лишь один из факторов; данные и дообучение решают не меньше, а для простых задач компактная модель быстрее и не хуже
ИИ учится на каждом моём сообщенииМодель заморожена после обучения: диалог с тобой её не меняет. Новые версии обучают отдельно, а не «на лету»
LLM действительно думает?

В человеческом смысле — нет: ни целей, ни сознания, ни картины мира. Но и «глупой» её не назовёшь: предсказание текста на таком уровне требует выученной логики. Честный ответ: не думает, но результат часто выглядит именно так.

Чем LLM отличается от поисковика?

Поисковик находит существующие страницы и показывает ссылки — текст написали люди. LLM порождает новый текст сама, и ссылок на источники у неё по умолчанию нет: она отвечает по сути вопроса, но может ошибиться в фактах. Современные сервисы всё чаще совмещают оба подхода.

Почему на один вопрос модель отвечает по-разному?

В выбор каждого следующего слова специально добавлена щепотка случайности — иначе ответы были бы механическими и однообразными. Чуть другое первое слово — и дальше текст расходится всё сильнее, как разговор, начатый с другой фразы. Смысл при этом обычно сохраняется, меняется формулировка.

LLM понимает русский или переводит с английского?

Понимает напрямую: в обучающих текстах были сотни языков, и закономерности каждого модель выучила сама — отдельного «переводчика с английского» внутри нет. Правда, английских текстов в обучении обычно больше, поэтому на редких темах ответ на английском бывает чуть точнее.

Читайте также

Попробуй на практике

Бесплатные интерактивные курсы по теме — прямо в браузере, с нуля.