Словарь терминов нейросетей: от А до Я для начинающих и практиков

Полный разбор ключевых понятий искусственного интеллекта и нейросетей: промпты, токены, модели, сэмплеры, LoRA, ControlNet и другие термины с примерами и практическими советами.

Что такое искусственный интеллект и нейросеть

Искусственный интеллект (ИИ) — это технология, позволяющая компьютерам выполнять задачи, которые традиционно требуют человеческого интеллекта: распознавание речи, обработка естественного языка, машинное обучение, принятие решений, генерация изображений и многое другое. В разговорной речи термин «нейросеть» часто используют как синоним ИИ, однако это не совсем верно.

Нейросеть (НС) — это компьютерная модель, вдохновлённая структурой и функциями человеческого мозга. Она состоит из множества искусственных нейронов, соединённых между собой, и обучается на больших объёмах данных. Именно нейросети лежат в основе большинства современных ИИ-сервисов: от чат-ботов до генераторов изображений.

Важно различать «сильный» и «слабый» ИИ. Сильный искусственный интеллект — гипотетическая система, обладающая самосознанием, способностью самостоятельно ставить задачи и мотивировать их выполнение. Такой ИИ пока не создан. Все современные нейросети относятся к «слабому» ИИ: они решают узкие задачи, но не обладают сознанием.

Генеративные нейросети и их возможности

Генеративная нейросеть — это тип НС, который способен создавать новые данные на основе анализа обучающих примеров. Например, нейросеть, генерирующая изображение по текстовому описанию, является генеративной. К таким моделям относятся Stable Diffusion, DALL-E, Midjourney и другие.

Генеративные модели могут создавать не только картинки, но и текст, музыку, видео. Они работают по принципу вероятностного прогнозирования: на основе входных данных (промпта) модель предсказывает наиболее вероятное продолжение. Это позволяет получать уникальные результаты, которые не были явно заложены в обучающую выборку.

Однако генеративные нейросети не лишены ограничений. Они могут «галлюцинировать» — выдавать правдоподобные, но ложные факты. Кроме того, качество результата сильно зависит от качества и разнообразия обучающих данных. Например, если модель обучалась преимущественно на изображениях западной архитектуры, она может плохо справляться с генерацией типичных российских пейзажей.

Промпты: как правильно общаться с нейросетью

Промпт — это текстовый ввод или подсказка, которую пользователь отправляет нейросети, чтобы получить желаемый результат. Проще говоря, это команда для ИИ. Качество промпта напрямую влияет на качество ответа.

Существует несколько видов промптов:

  • Позитивный промпт — описание того, что вы хотите увидеть или получить. Например, «кот в очках сидит на диване, стиль масляной живописи».
  • Негативный промпт — описание того, чего вы хотите избежать. Например, в Stable Diffusion добавление слова «red» в негативный промпт запретит модели использовать красный цвет.

Для получения хороших результатов важно формулировать промпты конкретно и однозначно. Избегайте общих фраз, указывайте стиль, композицию, освещение, детали. Многие сервисы позволяют задавать вес отдельных слов, чтобы усилить или ослабить их влияние.

Промпты можно комбинировать с дополнительными параметрами, такими как CFG Scale и сэмплеры, о которых мы поговорим далее.

Токены и «сказочные» токены: что нужно знать

Токен — это единица информации, используемая в обработке естественного языка. Токеном может быть слово, часть слова, символ или знак препинания. В большинстве моделей одно английское слово соответствует одному токену, пробел — 0 токенов, знак препинания — 1 токен. Однако для русского языка ситуация иная: одно русское слово может занимать несколько токенов, что увеличивает стоимость запроса.

Важно понимать, что разные сервисы по-разному трактуют понятие «токен». Некоторые платформы, особенно те, что перепродают услуги крупных компаний (например, OpenAI), могут искажать значение. Они приравнивают 1 токен к 1 символу, что является грубой подменой. Такие «сказочные» токены вводят клиентов в заблуждение и позволяют брать больше денег за услуги.

Чтобы не переплачивать, всегда уточняйте, как именно сервис считает токены. Ориентируйтесь на официальные данные разработчиков моделей. Например, в ChatGPT от OpenAI токены считаются по стандартной схеме, а в некоторых сторонних сервисах — по символам.

Модели, чекпойнты и LoRA: как выбрать правильную

Модель (или чекпойнт) — это сохранённое состояние нейросети, которое можно загрузить для генерации. Каждая модель обучена на определённом наборе данных и «знает» определённые стили, персонажей, объекты. Например, одна модель Stable Diffusion может отлично рисовать в стиле аниме, другая — фотореалистичные портреты.

LoRA (Low Rank Adaptation) — это метод оптимизации, позволяющий адаптировать модель с низким рангом параметров. С помощью LoRA можно «научить» нейросеть рисовать конкретных персонажей, объекты или стили, не переобучая всю модель. LoRA-файлы имеют небольшой вес и легко комбинируются с разными чекпойнтами.

Текстовые инверсии (Embeddings) — ещё один способ настройки. Это представления слов или фраз в многомерном пространстве. Они помогают упростить написание промптов, но не способны генерировать то, чего модель не знает. Вес таких файлов меньше, чем у LoRA, но и возможности ограничены.

При выборе модели учитывайте задачу: для фотореализма лучше использовать специализированные чекпойнты, для стилизации — LoRA, для точного контроля — текстовые инверсии.

Параметры генерации: CFG Scale, Denoising strength и сэмплеры

Для тонкой настройки результатов нейросети используются специальные параметры.

CFG Scale (Classifier-Free Guidance Scale) — определяет, насколько строго модель следует промпту. Низкое значение (например, 3–5) даёт модели больше свободы, результат может быть креативным, но менее точным. Высокое значение (10–15) заставляет модель строго следовать описанию, но может привести к артефактам. Оптимальное значение зависит от модели и задачи, обычно 7–9.

Denoising strength (DenS) — параметр, используемый в режиме img2img (преобразование изображения). Он определяет, насколько сильно будет изменён оригинал. При низком DenS (0.1–0.3) изменения минимальны, при высоком (0.7–0.9) изображение может полностью измениться.

Сэмплер — математический алгоритм, определяющий, как модель интерпретирует промпт. Разные сэмплеры подходят для разных задач: одни быстрее, другие точнее, третьи лучше передают текстуры. Например, сэмплер Euler a часто используется для быстрой генерации, а DPM++ 2M Karras — для высокого качества.

Понимание этих параметров позволяет гибко управлять процессом генерации и получать предсказуемые результаты.

Техники работы с изображениями: img2img, Inpaint, OutPaint

Генеративные нейросети предлагают несколько мощных техник для работы с изображениями.

img2img — преобразование одного изображения в другое. Включает апскейл с дорисовкой недостающих пикселей, стилизацию, изменение деталей. Параметр Denoising strength здесь играет ключевую роль.

Inpaint — заполнение пропущенных или повреждённых участков изображения. Пользователь выделяет область, и нейросеть генерирует контент, который гармонично вписывается в окружение. Эта техника используется для удаления объектов, замены фона, исправления дефектов.

OutPaint — расширение границ изображения. Нейросеть «додумывает» недостающие элементы, основываясь на видимой части. Например, из квадратного фото 1024×1024 можно получить прямоугольное 1024×1600, добавив небо, землю или другие детали.

Эти техники активно применяются в дизайне, ретуши, создании контента для соцсетей. Однако они требуют осторожности: при неудачном выборе параметров результат может выглядеть неестественно.

Большие языковые модели (LLM) и их применение

Большие языковые модели (LLM) — это нейросети, способные обрабатывать и генерировать текст на основе огромных объёмов данных. Самый известный пример — ChatGPT от OpenAI. LLM используются для написания статей, ответов на вопросы, перевода, генерации кода, создания диалоговых систем.

LLM обучаются на терабайтах текстов из интернета, книг, научных статей. Благодаря архитектуре трансформера они учитывают контекст и могут строить связные, осмысленные ответы. Однако у них есть ограничения: они не обладают пониманием в человеческом смысле, могут ошибаться и «галлюцинировать».

Для работы с LLM важно правильно формулировать запросы. Чем точнее и подробнее промпт, тем качественнее ответ. Многие сервисы предлагают готовые шаблоны для разных задач: написание постов, создание контент-планов, рерайт текста.

LLM также используются в паре с другими нейросетями. Например, ChatGPT может сгенерировать промпт для Stable Diffusion, а затем описать полученное изображение.

Практические советы по выбору нейросети и сервиса

При выборе нейросети или сервиса для конкретной задачи учитывайте несколько факторов.

  1. Тип задачи: для генерации текста лучше подходят LLM (ChatGPT, YandexGPT), для изображений — Stable Diffusion, DALL-E, Midjourney. Для видео — Stable Video Diffusion.
  2. Язык: многие модели лучше работают с английским. Для русского языка выбирайте сервисы, которые специально обучены на русскоязычных данных.
  3. Стоимость: некоторые сервисы работают по подписке, другие — по токенам. Уточняйте, как считаются токены, чтобы избежать переплаты.
  4. Качество: сравнивайте примеры работ разных моделей. Например, DALL-E 3 лучше понимает прямую речь в промптах и умеет писать текст на изображениях, а Stable Diffusion даёт больше контроля через параметры.
  5. Открытость: если вам нужна кастомизация, выбирайте открытые модели (Stable Diffusion). Если важна простота — готовые сервисы (Midjourney).

Не бойтесь экспериментировать с параметрами и комбинировать разные нейросети. Например, можно сгенерировать изображение в Stable Diffusion, а затем улучшить его с помощью нейросети для апскейла.

Вопросы и ответы

Чем отличается искусственный интеллект от нейросети?

Искусственный интеллект — это общее понятие, обозначающее технологию, позволяющую компьютерам выполнять задачи, требующие человеческого интеллекта. Нейросеть — это конкретный тип модели, вдохновлённой работой мозга, которая лежит в основе многих ИИ-систем. В разговорной речи эти термины часто используют как синонимы, но технически нейросеть — это лишь один из инструментов ИИ.

Что такое негативный промпт и зачем он нужен?

Негативный промпт — это текстовое описание того, чего вы не хотите видеть в результате генерации. Например, в Stable Diffusion добавление слова «red» в негативный промпт запретит модели использовать красный цвет. Это помогает точнее контролировать результат и избегать нежелательных элементов.

Как считаются токены в нейросетях и почему это важно?

Токен — это единица информации, обычно слово или часть слова. В английском одно слово ≈ 1 токен, в русском — несколько токенов. Некоторые сервисы искажают понятие, приравнивая токен к символу, что увеличивает стоимость. Важно уточнять способ подсчёта, чтобы не переплачивать.

Что такое LoRA и как она используется?

LoRA (Low Rank Adaptation) — это метод, позволяющий адаптировать нейросеть для генерации конкретных объектов или стилей без полного переобучения. LoRA-файлы имеют небольшой вес и легко комбинируются с разными моделями. Например, с помощью LoRA можно научить Stable Diffusion рисовать определённого персонажа.

Какой параметр CFG Scale выбрать для генерации?

CFG Scale определяет, насколько строго модель следует промпту. Низкие значения (3–5) дают больше креативности, высокие (10–15) — точность, но могут вызывать артефакты. Оптимальное значение обычно 7–9. Рекомендуется экспериментировать в зависимости от задачи.

В чём разница между Inpaint и OutPaint?

Inpaint заполняет пропущенные или повреждённые участки внутри изображения, а OutPaint расширяет границы изображения, добавляя новые элементы. Inpaint используется для удаления объектов или исправления дефектов, OutPaint — для изменения композиции или увеличения размера.

Какие нейросети лучше всего подходят для генерации текста на русском языке?

Для русского языка хорошо подходят ChatGPT (OpenAI), YandexGPT, а также сервисы на базе GPT, которые специально дообучены на русскоязычных данных. Важно учитывать, что многие модели лучше работают с английским, поэтому для сложных задач на русском стоит выбирать специализированные решения.