Программа качества · январь–июль 2026
Полгода мы учили Brandlyo писать не «как AI». Вот как проверяли результат.
Качество AI-текстов легко задекларировать и трудно доказать. Мы выбрали самый неудобный для себя способ: слепые тесты, где посты Brandlyo перемешаны с постами живых каналов, а человек, не зная где чьи, решает — можно это публиковать или нет.
6 мес
программа качества
сотни
итераций пайплайна
3
слепых раунда приёмки
220
текстов в слепых пулах
39/40
финальных — «публиковать как есть»
Это не один удачный тест
Финальные 40 постов появились не из одной удачной генерации. За ними — месяцы инженерной работы, полные прогоны на разных нишах, разборы с оценщиком, провал первого слепого раунда и два следующих. Мы не выбирали лучшие тексты задним числом: в слепые пулы попадали первые завершённые результаты по замороженному протоколу.
1. Масштаб разработки
Сотни итераций пайплайна на тысячах брендов и десятках тысяч сгенерированных текстов — от первых версий до текущей. Это операционный масштаб процесса (порядок величины: разработка шла в том числе в локальных средах, сквозные счётчики не велись).
2. Контролируемые бенчмарки
Каждое крупное изменение проверялось пакетами на фиксированных наборах брендов: полные прогоны, замороженные конфигурации, «холодные» бренды для проверки переносимости. Правило: в выборки попадают первые завершённые результаты — выбирать лучшее задним числом запрещено. В генераторе — 19 независимо отключаемых слоёв качества.
3. Человеческая слепая приёмка
Три раунда: 220 текстов (110 сгенерированных + 110 реальных из живых Telegram-каналов) вперемешку, без подписей. Оценка публикуемости по шкале 0–2 ставилась человеком, а не нейросетью.
4. Результат
Финальный раунд: 39 из 40 сгенерированных постов — «можно публиковать как есть», ни одного непубликуемого. На брендах, которые пайплайн видел впервые, — средняя оценка 2.00 из 2.00.
Три слепых раунда: разрыв с живыми каналами −0.53 → +0.03
Реальные посты в каждом раунде — свежий закрытый набор, поэтому честное сравнение — не «как росли наши оценки», а разрыв между сгенерированными и реальными постами внутри одного раунда, у одного оценщика, на одной шкале. Шкала 0–2: ноль — публиковать нельзя, два — можно публиковать как есть.
Разрыв с живыми каналами: −0.53
Оценщик распознал все AI-посты, два текста были непубликуемыми вовсе. Причины оказались механическими: хэштеги в каждом посте, повторяющиеся структуры, одинаковые концовки.
Разрыв с живыми каналами: −0.17
После цикла исправлений — голос канала, жанровый микс, лексика, концовки — распознаваемость упала вдвое, непубликуемых не осталось. Разрыв с живыми каналами сократился втрое.
Разрыв с живыми каналами: +0.03
Ещё цикл: повторы смыслов, идентичность бренда, проверка утверждений. Итог: 39 из 40 — «публиковать как есть», сгенерированные посты впервые оценены не ниже реальных.
Между раундами мы исправляли не оценки, а генератор. Публикуем провал первого раунда сознательно: он дал список конкретных механических признаков, по которым AI-тексты выдают себя, — и превратился в план работ.
Два разных вопроса — два честных ответа
Вопрос 1
Можно ли это публиковать?
39/40
постов финального раунда получили высшую оценку — «можно публиковать как есть». Средняя публикуемость 1.98 против 1.95 у реальных постов. Ни одного непубликуемого. На новых для системы брендах — 2.00.
Планка достигнута
Вопрос 2
Можно ли определить, что писал AI?
37/40
постов распознал оценщик в финальном раунде. Важный контекст: это высокоинформированный внутренний оценщик — он проходил тест в третий раз и месяцами разбирал работу пайплайна. Такой замер не отделяет остаточные AI-признаки от выученности оценщика; для измерения неотличимости нужен независимый внешний оценщик.
Неотличимость целью не была — и не заявляется
Что именно стало лучше
Каждый слепой раунд превращался в список конкретных дефектов — и в исправления генератора. Вот главные пары.
Хэштеги почти в каждом посте
Частота хэштегов берётся из поведения конкретного канала
Одинаковые призывы в конце каждого текста
Концовки распределяются по неделе, без повторов
Каждый пост раскрывает тему одинаково
Жанровый микс вычисляется из реальных постов бренда
Бренд странно говорит о себе в третьем лице
Имя и публичное «я/мы» извлекаются из источников
Одни и те же смысловые ходы из поста в пост
Повторы контролируются внутри поста и между неделями
Голословные обобщения и «ложная авторитетность»
Утверждения проходят отдельную проверку claims
Ограничения — без них эти цифры ничего не стоили бы
Результаты без границ применимости — это маркетинг. Вот рамки, внутри которых наши данные честны.
Один и тот же оценщик
Все три раунда размечал один человек с опытом в контенте, глубоко знакомый с системой. Это честный инструмент внутренней приёмки, а не независимый аудит с панелью внешних экспертов.
Русский язык, Telegram
Слепые пулы собирались из русскоязычных постов в формате Telegram-каналов. На другие языки и платформы результат напрямую не переносится.
Публикуемость ≠ неотличимость
Тест измерял, можно ли публиковать текст, а не «обманет ли он профессионала». Реальные посты несут живую фактуру — события, инфоповоды, конкретных людей, — по которой информированный эксперт по-прежнему отличает AI-текст.
Конкретная версия пайплайна
Финальные цифры относятся к версии генератора от июля 2026 года. Пайплайн продолжает меняться — при существенных изменениях приёмка повторяется.
Зачем мы это измеряем
Brandlyo делает регулярный контент для малого бизнеса — психологов, салонов, кофеен, репетиторов. Для них AI-пост имеет смысл только если его можно опубликовать, не переписывая. Поэтому наша метрика — не «сколько сгенерировали», а «сколько опубликовали как есть». Слепая приёмка — способ удерживать эту планку до того, как посты попадут к пользователям, — и при существенных изменениях пайплайна она повторяется.
Ссылаетесь на исследование? Указывайте: «Программа качества Brandlyo, слепые тесты, январь–июль 2026» и ссылку на эту страницу.