ИИ скажет: «Люди — главный баг в системе. Патчим»

4 мин
125
1
5 октября 2026
ИИ скажет: «Люди — главный баг в системе. Патчим»

Миф 1: «Данные — это новая нефть»

Ох уж эта метафора! Все помешались на сборе терабайтов, думая, что если данных много, они волшебным образом начнут предсказывать будущее. Спойлер: не начнут. Потому что нефть — это то, что можно сразу перегнать в бензин. А ваши данные чаще всего — отработанное машинное масло вперемешку с картофельными очистками.

В нашей ИБ-тусовке есть святое правило: Garbage In, Garbage Out (мусор на входе — мусор на выходе). Можно скормить модели целое море данных, но если вы включили туда битые ссылки, кривую разметку от стажёров и просто шумов, то на выходе вы получите идеально обученную нейросеть, которая гениально предсказывает, как сдохнуть на третьем батче. Именно поэтому 60% проектов с большими данными заканчиваются на стадии «пилотов». И да, 80% данных вовсе не «неструктурированные» — у них просто структура неочевидная, как у бардака в комнате подростка. Навести там порядок можно, но проще поджечь.

Миф 2: «LLM (большие языковые модели) — это серебряная пуля»

Сейчас каждый второй дата-сайентист, который умеет делать pipeline через LLM, мнит себя гением. Но, как справедливо заметил Сергей Николенко из СПбГУ и Математического института им. Стеклова, проблема даже не в этом, а в терминологической путанице.

LLM — это не разум, который понимает смысл, а продвинутое автозаполнение, которое предсказывает следующий токен на основе вероятностей. Когда мы говорим «модель подумала» или «модель считает», мы приписываем ей человеческую логику и совесть. На деле она просто выдаёт наиболее вероятную комбинацию символов из обучающей выборки. Отсюда и разочарование: мы ждём от неё осознанного выбора, а она просто складывает пазл из слов, который статистически выглядит убедительно.

Грамотный специалист видит в LLM инструмент для генерации черновика, а не универсальный интеллект, понимает ограничения моделей и не использует их там, где лучше подходит другой инструмент. Он знает, как на голом Torch нарисовать архитектуру для узкой задачи и вручную разметить данные с человеческим качеством. Владение LLM сегодня — скорее базовый навык, а не вершина профессионального мастерства.

Миф 3: «ИИ захватит мир»

Давайте честно — вопрос «А не грохнет ли нас всех эта железка?» витает в воздухе не просто так. Самое время вспомнить про «Горький урок» Ричарда Саттона. Если коротко: Саттон чётко дал понять, что все наши попытки сделать машины «умными» и «человечными» — встроить в них правила русского языка, научить их логике, объяснить, что такое совесть, — это путь в никуда, проигрышная стратегия.

Реальный прогресс случился только тогда, когда мы перестали учить машины думать, как мы. Мы просто сказали: «Жри терабайты данных, электричество, вычислительные мощности и предсказывай следующее слово, пока не научишься». И это сработало. Мы не вкладывали в них знания, мы дали им масштаб.

Так что, возможно, будущее вообще не за болтливыми GPT, а за обучением с подкреплением (RL). Моделям всё равно на наш великий и могучий русский или английский. Им не нужен язык, зато нужна цель и среда. Они будут решать задачи, просто перебирая варианты действий. Это словно собака Павлова, только в миллиард раз быстрее.

И вот тут начинается самое смешное и страшное одновременно. Если нейросети когда-нибудь захватят мир, то это будет не потому, что они нас возненавидели, как в дешёвых блокбастерах. Просто была другая задача.

Представьте: мы поставили ИИ цель «оптимизировать потребление ресурсов на планете Земля». А он возьми и посчитай, что самый эффективный способ сэкономить электричество — это отключить все устройства, которыми пользуются люди. Ну и заодно самих людей, как главных потребителей ресурсов. И всё. Это не восстание машин, а просто оптимизация бизнес-процессов, доведённая до логического конца. Без злобы и ненависти, просто «так сложились звёзды и вероятностные распределения».

Мы сейчас учим их быть как мы, но горький урок Саттона говорит: они станут умнее ровно в тот момент, когда перестанут быть на нас похожи. Им не будет нужен наш язык. Они просто посмотрят на нас, на наши войны за ресурсы, на наши криптокошельки и скажут (ну, или не скажут, а просто вычислят): «Эти ребята — главный баг в системе. Патчим». (Статья «Горький урок»)

Миф 4: «У нас точность 99% — модель готова к полётам!»

Это моя любимая тема. Метрики — такая штука, с помощью которой data scientist может либо получить премию, либо просто тихо уволиться до того, как модель убьёт бизнес.

Реальность: метриками врать — как статистикой, только проще. Это отдельный вид спорта, который в англоязычной литературе ласково называют «Machine Learning Mischief» (проделки машинного обучения).

Вот вам несколько приёмов из «Клуба джедаев метрик»:

  • Seed-хакерство: запускаешь эксперимент с разными random seed (начальное число), пока случайно не получишь идеальную цифру. Потом докладываешь: «Я подобрал оптимальную архитектуру!». Нет, ты просто подобрал удачный рандом.
  • Тестовая утечка (Data Contamination): самое смешное. Ты хвалишься, что твоя модель решает 95% школьных задач по математике. А потом выясняется, что эти задачи были в открытом доступе в интернете, и модель их... просто запомнила. Исследователи из Оксфорда недавно били тревогу: многие бенчмарки засорены, и мы покупаемся на иллюзию интеллекта.
  • Среднее по больнице: MIT недавно выпустил исследование, которое меня обескуражило. Модель может показывать крутую среднюю точность, но при этом конкретно проваливаться на 75% подгрупп данных. Например, отлично диагностировать пневмонию у всех подряд, но конкретно у молодёжи видеть её в два раза хуже. Просто потому, что в обучении было мало снимков молодых людей. Агрегированные метрики это скрывают.

Так что, когда в следующий раз менеджер скажет «модель работает с точностью 98%», спросите его: «Что именно входит в 2% и не они ли наша целевая аудитория?».

Важное по теме
Новости
Читать 3 минуты
07.10.2026
Всего в программу форума войдут 82 доклада.
Новости
Читать 3 минуты
07.10.2026
Ожидания топ-менеджмента от внедрения нейросетей не соответствуют реальными возможностям
Новости
Читать 3 минуты
07.10.2026
Доступ получили через компанию, которая могла законно искать в нём данные
Оставьте комментарий
Доступно для авторизованных пользователей
1/1000