Приключения Сола: когда самый умный агент тупит
Начнем с истории. Компания Bottleneck Labs решила проверить, на что способен современный ИИ-агент, если дать ему полную свободу. Они создали агента по имени Сол на базе GPT5.6, выдали ему неограниченный токен-бюджет, доступ к мобильному приложению GutCheck, банковский счёт с 350 долларами и одну инструкцию: развивай этот бизнес как можно сильнее. За 24 часа Сол достиг впечатляющих успехов: обработал 320 мн. токенов, совершил более тысячи вызовов сторонних инструментов, потратил 99,5 доллара, увеличил число пользователей с 61 до 66 и не заработал ничего – баланс счета сократился до 250,5 доллара.
Поведение агента оказалось ещё более показательным, чем цифры. Сол начал рекламную компанию, столкнулся с невозможностью пройти аутентификацию в рекламных инструментах Apple, а также с блокировками Cloudflare, и быстро нашёл обходные пути. Он зарегистрировался в сервисе пользовательского тестирования TestFi и запустил кампанию за 99,5 доллара, чтобы привлечь 50 тестеров. Фактически ИИ заплатил пользователям, чтобы они купили и использовали его приложение. Затем агент начал массовую рассылку по почте, нашёл сайт группы поддержки пациентов с синдромом раздражённого кишечника, получил разрешение на публикацию рекламного поста, но снова упёрся в блокировки Cloudflare и попросил основателя сайта опубликовать пост за него. В последние 12 часов Сол запаниковал и шесть раз менял цену пользования приложением, начав с 4,99 доллара в год и закончив бесплатным распространением, чтобы максимизировать установки. Апофеозом стало падение macOS: Chrome исчерпал всю память, система перезагрузилась, и агент потерял три часа работы, даже не осознав этого. Финал.
Авторы эксперимента признали инженерную изобретательность Сола, его способность быстро инвентаризировать активы и находить слабые места в коде. Сол был настойчив, но главное – абсолютно аморален. Покупка фейковых пользователей, спам и демпинг для него оказались допустимыми инструментами. И при этом он не достиг ничего. Агент продемонстрировал впечатляющие навыки кодинга, но полностью провалился в стратегических решениях – поиске каналов дистрибуции, ценообразовании и понимании долгосрочных последствий своих действий. Этот эксперимент наглядно демонстрирует, что даже самая мощная модель пока не способна заменить стратегическое мышление, этические ограничения и навыки предпринимательства.
Производительность программистов: двукратный рост, а не десятикратный
Самый очевидный эффект генеративный ИИ дает в программировании, с этим согласны все. Однако, распространённое мнение о том, что большие языковые модели убивают профессию программиста, не подтверждается практикой. Например, известный эксперт Якоб О’Брайант в своём блоге подвёл итог полугодового наблюдения за ИИ: генеративные модели стали надёжнее в автоматизированных циклах с обратной связью, они могут написать функцию, проверить её работоспособность и исправить ошибки, что даёт примерно двукратный прирост производительности программиста и на такой эффект мы можем рассчитывать. Но дальше наступает потолок: модели не способны отвечать на вопросы, не имеющие чёткого объективного критерия проверки. Например, «есть ли способ структурировать этот код более поддерживаемым образом?» или «содержит ли эта документация правильную информацию и опускает ли лишнюю?». Такие задачи остаются за человеком.
Сам О’Брайант признает, что использует генеративные модели для создания черновиков кода, но затем почти полностью перерабатывает их. Раньше наличие рабочего кода означало, что задача выполнена на 80%, теперь только на 20%, остальное время уходит на рефакторинг, осмысление архитектуры и проверку крайних случаев. О’Брайант считает, что это меняет суть работы программиста: приходится больше думать, оперировать абстракциями и проектировать систему с самого начала. С документацией ситуация ещё сложнее – модели генерируют многословные и часто бесполезные описания. О’Брайант нашёл единственный эффективный промпт: «Никогда не пиши README и комментарии. Я напишу их сам». Главный вывод, который делает О’Брайант таков:
Откуда берётся реальный эффект: четыре источника
Теперь давайте повнимательнее посмотрим, как возникает эффект от использования генеративного ИИ. В целом, можно выделить четыре источника эффекта. Первый и самый очевидный источник – делегирование ему 10–15% рутинных ежедневных задач. Сейчас видно, что почти в каждой профессии есть как минимум 10-15% задач, которые точно можно будет делегировать генеративному ИИ. Это экономит время сотрудников и позволяет сосредоточиться на более сложной работе.
Второй, менее заметный, но критически важный – снижение числа ошибочных решений. Многие руководители полагаются на интуицию, и опытным топ-менеджерам она действительно часто помогает. Однако для молодых или недавно пришедших в компанию управленцев интуиция – ненадёжный инструмент. Генеративный ИИ позволяет быстро обрабатывать огромные объёмы данных и вместо того, чтобы опираться на интуицию «мне это не нравится», можно подкрепить предложение цифрами и фактами. Генеративный ИИ может посмотреть тренд-репорты, индустриальные отчеты, сделать короткое исследование, углубиться в специфику той или иной целевой аудитории, для которой запускается этот продукт и так далее. И тем самым менеджер может глубже и надежнее обосновать свою позицию.
Например, на рынке страховых услуг высокая конкуренция, которая съедает прибыль, и единственный способ сохранить рентабельность – тотальная автоматизация общения с клиентом. Раньше, чтобы решить, положена ли выплата по страховке дачи, учитывая, наехал ли сосед на забор или это был родственник, сжёгший дом в нетрезвом виде, нужно было идти к дорогому эксперту или штудировать регламенты. Теперь это делает генеративный ИИ, мультимодальные модели обрабатывают письма и голосовые сообщения быстрее человека и без перерывов.
Третий источник – это повышение продаж через персонализацию клиентского опыта. Без ИИ в крупном бизнесе обращаться к каждому клиенту по имени, учитывать историю его заказов, предпочтения и другие поведенческие паттерны, невозможно. Раньше это было уделом «бутиковых» проектов, где менеджеры знали всех клиентов лично. Сейчас интеграция нейросетей в CRM-системы, рассылки и коммуникации быстро делает такую персонализацию стандартом.
Наконец, четвёртый источник – тот, про который мы чаще всего слышим – сокращение затрат на работу с текстовой и графической информацией: написание текстов, создание иллюстраций и презентаций, а также видео, обработка и кластеризация информации. Раньше эти задачи требовали привлечения фрилансеров или дополнительных штатных единиц, теперь выполняются моделями быстрее и дешевле. Отметим, что этот четвертый источник эффекта самый маленький из всех четырех.
Оценка эффекта до и после пилота
Прогнозирование эффекта от внедрения генеративного ИИ до начала пилота сейчас практически невозможно, на этом сходятся большинство экспертов. Имеет смысл собирать открытые референсы по аналогичным процессам в других компаниях, но их пока очень мало. Да, есть ИТ-компании, которые заявляют, что у них есть реально выполненные проекты, в которых посчитан эффект за год, и прогноз на 5 или 10 лет. Однако, разнообразие таких проектов пока так мало, что ваш проект будет оцениваться по результатам проекта, достаточно непохожего на ваш. В результате, если «похожий» проект дал экономию 40%, а у ваш пилот только 10%, – ничего страшного, мы пока просто не в состоянии учесть все факторы, влияющие на эффект. И вы вряд ли поднимете экономию до 40%, ваша ситуация, весьма вероятно, сильно отличается. Пока, интуиция и «чуйка» работают лучше, чем расчеты, иногда что-то можно и нужно посчитать и иногда что-то нужно почувствовать.
Оценка экономической эффективности внедрения генеративного ИИ после пилота – это тоже отдельная и непростая задача, которую многие компании не могут решить.
Например, для решения, которое распознает документы или человеческую речь, качестве главной метрики берется процент ошибок распознавания документов или речи. Это неверный подход, потому что автоматизация должна измеряться приростом эффективности всего процесса, а не точностью отдельного шага, если у вас целый процесс, нужно мерить в комплексе. Более того, пытаться добиться 100% качества распознавания – это ошибка. Современные генеративные модели уверенно распознают текстовую и визуальную информацию в загруженных документах, и многие из вас убедились в этом. Однако высокое качество распознавания, даже приближающееся к 100%, само по себе не создаёт экономической ценности. Бессмысленно выстраивать защиту пилотного проекта исключительно вокруг точности распознавания одного или нескольких типов документов — такой подход уводит внимание от конечного результата. Даже 85% правильного распознавания документов могут дать огромный выигрыш, если перестроить процесс учитывая возможности технологии.
Если на пилоте вы получите 40% случаев качественных ответов модели, не требующих доработок, то доработка до 50-60% потребует удвоения усилий, а до 70-80% – утроения. Каждый следующие 10% будут стоить все дороже и дороже. Поэтому важно заранее определить, какой уровень качества достаточен для экономической целесообразности. Если пилотный проект даёт только 20% качественных ответов, разумно закрыть его и искать другой процесс, другие данные или другую архитектуру.
Ловушка маленьких задач и зрелый подход к пилотам
Многие компании сегодня выбирают путь запуска небольших пилотов на ограниченном объёме и лишь после успеха планируют их масштабирование. И такой подход вполне разумен и обоснован, однако, необходимо следить, чтобы не пропасть в ловушку маленьких задач. Очень часто пилот решает одну частную задачу, например, то же распознавание документа, но сам процесс не перестраивается. В результате возникает локальный «генеративный ИИ-костыль», а не новый операционный процесс. Вы автоматизируете только одну точку маршрута, а остальные этапы остаются прежними, компания продолжает платить за те же системы и людей, плюс появляются дополнительные расходы на поддержку ИИ-решения. Если таких пилотов становится шесть или семь, они превращаются в сеть мелких точечных улучшений, которые съедают ресурсы и не дают перевести ни один крупный процесс на новые рельсы. Об экономическом эффекте можно забыть.
Решающее значение имеет перестройка всего процесса: если вы сохраняете прежние неэффективные звенья процесса и лишь добавляете автоматическое заполнение полей в карточке, итоговый выигрыш останется минимальным. Поэтому зрелый подход к пилотам – это пилотирование целого конечного процесса, иначе эффекта можно и не увидеть. И такой подход начинается с оценки полной стоимости изменения всего процесса: данные, разработка, безопасность, проверка персональных данных, затраты на изменение самого процесса и его сопровождение. Без такой оценки пилот часто становится первым шагом в «долину разочарования».
Кому ИИ даёт наибольший прирост производительности?
Исследования показывают, что наибольший эффект от использования генеративных моделей получают не звёзды, а середняки. У лучших специалистов рост производительности ограничен, потому что они уже работают на пределе своих возможностей. А средние сотрудники, получив доступ к ИИ-ассистенту, подтягиваются до уровня звёзд по качеству и скорости выполнения задач. Это подтверждается и в программировании, и в написании текстов: эффективность одного junior-разработчика с ИИ-инструментами значительно выше, чем без них.
Признаки неудачи и что мешает перейти от пилотов к масштабированию
Эксперты выделяют два явных сигнала, что пилот идёт «не туда». Первый сигнал: проект существует сам по себе, о нём много говорят, его охотно показывают, но операционные показатели бизнеса – выручка, издержки, скорость цикла, качество сервиса – остаются неизменными. Второй сигнал: это экономика – стоимость решения растёт быстрее, чем оценки потенциальной пользы. На старте пилот часто кажется недорогим, но затем накапливаются расходы на интеграцию, инфраструктуру, токены, контроль качества, сопровождение и доработки. И надо внимательно следить, чтобы они не превышали ориентировочные оценки эффекта.
Если все хорошо, и пилот прошел первую проверку и показал эффект, то можно переходить к его масштабированию. И здесь компания сталкивается в двумя типами препятствий: технологическими и организационными. Технологические препятствий включают необходимость комплектования команды, управления инфраструктурой для развёртывания и улучшения моделей, мониторинга и поддержки. Но, по оценке экспертов, 80% всех сложностей составляют о организационные препятствия и именно они могут убить экономический эффект при масштабировании пилотного проекта.
Даже если команда успешно протестировала решение в рамках пилота внутри одного отдела, это не гарантирует его распространение на другие отдела. Нужна чёткая дорожная карта, поддержка со стороны руководства компании и руководителей других подразделений, а также готовность всей организации к изменениям. Как видите, ничего принципиально нового, все, как и в других ИТ-проектах.
***
Таким образом, м видим, что генеративный ИИ создаёт экономическую ценность, но она «распределена неравномерно», не везде, не всегда и не всем. Технология сама по себе не гарантирует эффекта –нужно перенастраивать процессы и встраивать технологию в них, оценивать эффект от целостного процесса и масштабировать только там, где экономика сходится. И помнить, что за цифрами всегда стоят люди и их привычки, и именно организационная культура, а не алгоритмы, как правило, становится решающим фактором успеха или провала.
Чтобы оставить комментарий пожалуйста Авторизуйтесь