Growth Papers Бесплатный разбор

Новый инструмент или привычный способ: как я сравнил их за час на живой задаче

Александр Смирнов · · 5 мин чтения

Я попробовал программу, которая запускает несколько AI-агентов параллельно, и вместо споров о ней померил: одна живая задача тремя способами, слепая оценка качества. Выигрыш оказался настоящим, но программа была для него не нужна.

Сравнение двух вариантов показывает, что разница есть. Но не показывает, откуда она взялась.

Ситуация

В августе 2026 года я задал себе вопрос: не устарело ли то, как мы работаем? Вокруг новые инструменты, каждый обещает делать быстрее и лучше. У меня это была программа, которая запускает несколько AI-агентов одновременно, каждого на свою задачу, и показывает их работу на одной доске.

Вместо этого мы договорились мерить: взять одну живую задачу и сделать её разными способами.

Как мерили

Самое важное произошло до начала замера. Мы письменно зафиксировали правила и сохранили их, пока ни один вариант ещё не был запущен:

  • Задача живая, не придуманная. Три текста, которые всё равно надо было написать: посадочная страница, письмо для рассылки по базе и программа мероприятия на 60 минут.
  • Условия одинаковые до буквы. Одни и те же 6 файлов с вводными (4 141 слово), одни и те же формулировки задач, одна и та же модель.
  • Что меряем: время ожидания по часам, стоимость и качество.
  • Как оцениваем качество: слепо. Отдельный ИИ-судья, который не знает, какой текст чей, ставит баллы по шкале из 10: факты из вводных — 3 балла, соответствие позиционированию — 2, пригодность без переделки — 3, стиль — 2. Это не измерение прибором, а мнение ещё одной модели, поэтому и шум у него свой.
  • Чего замер не покажет. Это тоже записали заранее: задача одна, прогон один, разброс между прогонами не измерен.

Стоимость мы считали по опубликованному прайсу в долларах. На деле такие прогоны расходуют лимит подписки, и этих денег никто не списывал. Но только так три способа можно сравнить в одних единицах.

Первый результат и первая ловушка

Способ А: один агент делает три задачи подряд. 7 минут 3 секунды, $2,74.

Способ Б: новая программа, три агента параллельно. 5 минут 7 секунд, $6,15.

Первый круг слепой оценки отдал одному из способов все три победы. Выглядело убедительно, но оказалось, что во всех трёх парах его текст стоял первым. Судья склонен хвалить того, кого читает первым. Результат мы не приняли и переиграли оценку с обратным порядком.

После двух кругов счёт стал 52 : 44 в пользу параллельного способа. На одном из трёх текстов победитель поменялся, когда поменялся порядок.

И тут видна механика разницы. Модель одна и та же, и дело было не в том, что «параллельно умнее». У способа А все три задачи шли в одном окне подряд, и к третьей голова была забита двумя предыдущими. Худшие оценки у способа А получила именно программа мероприятия, которая шла последней: 6 и 7 из 10, против 7–8 у первых двух. У способа Б каждый агент начинал с чистого листа. Отсюда и качество, и переплата: вводные оплачивались трижды.

Промежуточный вывод на тот момент: в 2,2 раза дороже при выигрыше в 1,4 раза по времени ожидания, зато качество выше.

Контрольная группа, которая всё поменяла

В сравнении двух вариантов было слабое место. Способ Б отличался от А сразу двумя вещами: новой программой и тем, что каждый агент работал с чистого листа. Какая из двух дала выигрыш, понять было нельзя.

Поэтому мы запустили способ В: три агента параллельно, но без новой программы, нашими обычными средствами. 6 минут 1 секунда, $5,73.

Слепая оценка Б против В в обоих порядках: 51 : 48. И здесь важнее не счёт, а то, откуда взялись три балла. На одном тексте побеждал тот, кто стоял первым, на другом тот, кто стоял вторым. Разброс самого судьи оказался больше разницы между способами. Честный вывод звучит так: различий не обнаружено.

Выигрыш, ради которого стоило бы переходить на новую программу, полностью воспроизводился без неё. Программа продавала удобную доску и наблюдение за работой, но не результат. Позже я сам заметил: открывая новое окно под каждую задачу, я и так делал ровно то, за что продавалась программа.

Весь эксперимент, включая 12 прогонов оценки, стоил $23,47 по прайсу и занял чуть больше часа от вопроса до вывода.

Что это значит для собственника

Я записал и оговорку против себя: этот вывод удобен для того, как я уже работаю. Задача одна, прогон один. Доказанным результат считать нельзя, можно считать, что на этой задаче преимущества не обнаружено.

Протокол, записанный заранее, пригодился ещё раз: когда историю пересказали по памяти, вывод перевернулся, и спор решился цитатой из протокола.

Как сравнить инструмент или подрядчика у себя

  1. Запишите критерии до начала. Что меряете, как оцениваете, что считается победой. Если критерии появились после результата, их подогнали под результат.
  2. Дайте всем одинаковые вводные. Одна и та же живая задача, одни и те же материалы. Демонстрация продавца на его примере — это не сравнение.
  3. Оценивайте вслепую и дважды. Уберите подписи, пусть оценивает человек, который не знает, где чья работа. Потом поменяйте порядок и оцените ещё раз. Если после смены порядка победитель меняется на большинстве пунктов, а общий счёт почти равный, разницы нет.
  4. Добавьте контрольный вариант. Если новый подрядчик лучше старого, спросите, за счёт чего. И проверьте, нельзя ли получить то же самое у старого, поменяв одну вещь: сроки, бриф, человека на задаче.
  5. Считайте цену вместе со временем. «Быстрее» в нашем случае означало в 1,4 раза быстрее за 2,2 раза дороже. Решите заранее, сколько вы готовы платить за каждый сэкономленный час.

Если нужна независимая проверка того, как работает ваш маркетинг, начните с бесплатного разбора: три находки по сайту, рекламе и приёму заявок на коротком созвоне.

Александр Смирнов руководил маркетингом ресторанов, ивент-площадки, фестиваля и IT-консалтинга. По теме: как устроены ежедневные проверки.

Бесплатный разбор