Программа качества · январь–июль 2026

Полгода мы учили Brandlyo писать не «как AI». Вот как проверяли результат.

Качество AI-текстов легко задекларировать и трудно доказать. Мы выбрали самый неудобный для себя способ: слепые тесты, где посты Brandlyo перемешаны с постами живых каналов, а человек, не зная где чьи, решает — можно это публиковать или нет.

6 мес

программа качества

сотни

итераций пайплайна

3

слепых раунда приёмки

220

текстов в слепых пулах

39/40

финальных — «публиковать как есть»

Это не один удачный тест

Финальные 40 постов появились не из одной удачной генерации. За ними — месяцы инженерной работы, полные прогоны на разных нишах, разборы с оценщиком, провал первого слепого раунда и два следующих. Мы не выбирали лучшие тексты задним числом: в слепые пулы попадали первые завершённые результаты по замороженному протоколу.

1. Масштаб разработки

Сотни итераций пайплайна на тысячах брендов и десятках тысяч сгенерированных текстов — от первых версий до текущей. Это операционный масштаб процесса (порядок величины: разработка шла в том числе в локальных средах, сквозные счётчики не велись).

2. Контролируемые бенчмарки

Каждое крупное изменение проверялось пакетами на фиксированных наборах брендов: полные прогоны, замороженные конфигурации, «холодные» бренды для проверки переносимости. Правило: в выборки попадают первые завершённые результаты — выбирать лучшее задним числом запрещено. В генераторе — 19 независимо отключаемых слоёв качества.

3. Человеческая слепая приёмка

Три раунда: 220 текстов (110 сгенерированных + 110 реальных из живых Telegram-каналов) вперемешку, без подписей. Оценка публикуемости по шкале 0–2 ставилась человеком, а не нейросетью.

4. Результат

Финальный раунд: 39 из 40 сгенерированных постов — «можно публиковать как есть», ни одного непубликуемого. На брендах, которые пайплайн видел впервые, — средняя оценка 2.00 из 2.00.

Три слепых раунда: разрыв с живыми каналами −0.53 → +0.03

Реальные посты в каждом раунде — свежий закрытый набор, поэтому честное сравнение — не «как росли наши оценки», а разрыв между сгенерированными и реальными постами внутри одного раунда, у одного оценщика, на одной шкале. Шкала 0–2: ноль — публиковать нельзя, два — можно публиковать как есть.

Раунд 1 — провал30 + 30 текстов
Brandlyo1.20
Живые каналы1.73

Разрыв с живыми каналами: −0.53

Оценщик распознал все AI-посты, два текста были непубликуемыми вовсе. Причины оказались механическими: хэштеги в каждом посте, повторяющиеся структуры, одинаковые концовки.

Раунд 2 — прогресс40 + 40 текстов
Brandlyo1.68
Живые каналы1.85

Разрыв с живыми каналами: −0.17

После цикла исправлений — голос канала, жанровый микс, лексика, концовки — распознаваемость упала вдвое, непубликуемых не осталось. Разрыв с живыми каналами сократился втрое.

Раунд 3 — планка взята40 + 40 текстов
Brandlyo1.98
Живые каналы1.95

Разрыв с живыми каналами: +0.03

Ещё цикл: повторы смыслов, идентичность бренда, проверка утверждений. Итог: 39 из 40 — «публиковать как есть», сгенерированные посты впервые оценены не ниже реальных.

Между раундами мы исправляли не оценки, а генератор. Публикуем провал первого раунда сознательно: он дал список конкретных механических признаков, по которым AI-тексты выдают себя, — и превратился в план работ.

Два разных вопроса — два честных ответа

Вопрос 1

Можно ли это публиковать?

39/40

постов финального раунда получили высшую оценку — «можно публиковать как есть». Средняя публикуемость 1.98 против 1.95 у реальных постов. Ни одного непубликуемого. На новых для системы брендах — 2.00.

Планка достигнута

Вопрос 2

Можно ли определить, что писал AI?

37/40

постов распознал оценщик в финальном раунде. Важный контекст: это высокоинформированный внутренний оценщик — он проходил тест в третий раз и месяцами разбирал работу пайплайна. Такой замер не отделяет остаточные AI-признаки от выученности оценщика; для измерения неотличимости нужен независимый внешний оценщик.

Неотличимость целью не была — и не заявляется

Что именно стало лучше

Каждый слепой раунд превращался в список конкретных дефектов — и в исправления генератора. Вот главные пары.

Хэштеги почти в каждом посте

Частота хэштегов берётся из поведения конкретного канала

Одинаковые призывы в конце каждого текста

Концовки распределяются по неделе, без повторов

Каждый пост раскрывает тему одинаково

Жанровый микс вычисляется из реальных постов бренда

Бренд странно говорит о себе в третьем лице

Имя и публичное «я/мы» извлекаются из источников

Одни и те же смысловые ходы из поста в пост

Повторы контролируются внутри поста и между неделями

Голословные обобщения и «ложная авторитетность»

Утверждения проходят отдельную проверку claims

Ограничения — без них эти цифры ничего не стоили бы

Результаты без границ применимости — это маркетинг. Вот рамки, внутри которых наши данные честны.

Один и тот же оценщик

Все три раунда размечал один человек с опытом в контенте, глубоко знакомый с системой. Это честный инструмент внутренней приёмки, а не независимый аудит с панелью внешних экспертов.

Русский язык, Telegram

Слепые пулы собирались из русскоязычных постов в формате Telegram-каналов. На другие языки и платформы результат напрямую не переносится.

Публикуемость ≠ неотличимость

Тест измерял, можно ли публиковать текст, а не «обманет ли он профессионала». Реальные посты несут живую фактуру — события, инфоповоды, конкретных людей, — по которой информированный эксперт по-прежнему отличает AI-текст.

Конкретная версия пайплайна

Финальные цифры относятся к версии генератора от июля 2026 года. Пайплайн продолжает меняться — при существенных изменениях приёмка повторяется.

Зачем мы это измеряем

Brandlyo делает регулярный контент для малого бизнеса — психологов, салонов, кофеен, репетиторов. Для них AI-пост имеет смысл только если его можно опубликовать, не переписывая. Поэтому наша метрика — не «сколько сгенерировали», а «сколько опубликовали как есть». Слепая приёмка — способ удерживать эту планку до того, как посты попадут к пользователям, — и при существенных изменениях пайплайна она повторяется.

Ссылаетесь на исследование? Указывайте: «Программа качества Brandlyo, слепые тесты, январь–июль 2026» и ссылку на эту страницу.