Темы без конкурентов
Свободная ниша — это разрыв: спрос на тему есть, а материалов по ней мало. Расчёт сводит историю запросов с числом уже вышедших публикаций и сам помечает такие темы. Измерено 82 560 фраз, спрос посчитан у 3 011 ниш.
Опубликовано 25.08.2026 · цифры сверены 01.09.2026
Как найти тему со спросом и без конкурентов: семь шагов
- Широкий список фраз. Соберите не десяток ключевых слов, а всё, что люди вообще спрашивают по вашей теме.
- Спрос. Снимите частоту каждой фразы в Вордстате: сколько раз её искали за месяц. Это бесплатно, нужен только аккаунт Яндекса.
- Предложение. Посчитайте, сколько материалов по теме уже вышло и насколько они свежие: поиск и Дзен показывают это за пару минут.
- Разрыв. Ищите темы, где спрос есть, а материалов мало. Это и есть свободная ниша.
- Отсев шума. Уберите сезонные всплески и разовые новости: они выглядят как спрос, но им не являются.
- Один знаменатель. Считайте долю всегда от одного и того же списка: у нас один и тот же замер дал «+110 тем» по полному реестру и «+43» по витрине.
- Проверка на истории. Возьмите прошлые месяцы и посмотрите, сработал бы такой выбор тогда.
Что под какую задачу
- Блог или канал — хватит 20–30 тем и пересчёта раз в месяц.
- Услуги и продажи — смотрите фразы со словами «цена», «заказать», «стоимость» — спрос ниже, но люди ближе к покупке.
- Новый рынок — спроса ещё нет, цифры не помогут: здесь работают разговоры с клиентами.
Ниже — как этот расчёт устроен у нас: 82 560 измеренных фраз и проверка на истории.
Где проект сейчас
Цепь собрана и замкнута 13 августа 2026: сбор в bronze, пересчёт в silver и gold, витрина ниш с вердиктом — всё под суточными таймерами. Через четверо суток после этого, 17 августа, сбор остановлен решением владельца: квота Yandex Cloud понадобилась другому проекту на 30 дней. Останавливали по порядку — сначала пять таймеров, потом процесс, и только сигналом SIGTERM, чтобы сборщик закрыл снимок сам и gzip дописал маркер конца потока. Проект стоит целым, а не брошенным: чекпоинт сборщика, реестр загруженных снимков и журнал измеренного паузу переживают.
Что было нужно
Требование одно: находить темы, где спроса много, а материалов мало, и делать это на данных, а не на ощущении редактора. Платформы обратных ссылок отвечают на другой вопрос — «что есть у конкурента, чего нет у меня» — и по построению не видят спрос там, где предложения нет вовсе. Ограничение, из которого выросла вся конструкция: наблюдение нельзя переснять задним числом. Счётчики Дзена накопительные, и сигнал в них — дельта между снимками; региональный срез Яндекс отдаёт коротким окном и истории не хранит; посуточная детализация живёт недолго. Отсюда деление работы на две несимметричные половины — сбор, который нельзя переделать, и анализ, который переделывается сколько угодно.
| Метод | Что из него взято | Каноническое имя · источник |
|---|---|---|
| Разведка до сборки — карта местности прежде кода | Как задачу «фраза ↔ тема» решают Ahrefs, Semrush, Exploding Topics и Spate, разбиралось до написания мостика. Пороги концентрации взяты не на глаз: FREE_HHI 0,15 и TIGHT_HHI 0,25 — стандартные пороги концентрации в конкурентном анализе по индексу Херфиндаля–Хиршмана, переведённые в доли. | Индекс Херфиндаля–ХиршманаHirschman, «National Power and the Structure of Foreign Trade», 1945 · Herfindahl, «Concentration in the Steel Industry», 1950 |
| Один хозяин у данных — bronze неизменяем | Снимок пишется append-only, с меткой времени, версией парсера и идентификатором прогона. Silver и gold пересобираются из него целиком; сверка после пересборки идёт фраза за фразой. | Medallion architecture; append-only logDatabricks, документация платформы |
| Замер прежде объяснения — красный сигнал до гипотез | Команда, отличающая «плохо» от «хорошо» на конкретном симптоме, строится раньше теории. Три неудачные попытки объяснить в одном месте — стоп: под вопросом устройство, а не деталь. | Фальсифицируемость гипотезыPopper, «Logik der Forschung», 1934 |
| Утверждение несёт свой статус — замер, гипотеза или решение | У каждого числа указан файл и строка, у каждого решения — кто и когда решил. Слово «гипотеза» стоит в тексте, если проверки не было. Число без источника не употребляется, даже когда оно верное. | Провенанс данных; запись решений ADRNygard, «Documenting Architecture Decisions», 2011 |
| Разделение по проверяемости — сначала то, что пересчитывается | Вопрос «предсказывает ли сигнал рост спроса» отвечается на уже собранных данных, без единого вызова квоты. Вопрос «полезен ли вердикт» требует четырёх недель вперёд и потому вынесен отдельно. | Walk-forward validation, point-in-time correctnessPardo, «Design, Testing and Optimization of Trading Systems», 1992 |
| Приёмка порогами — критерий объявлен до прогона | Проверки на утечку будущего описаны заранее: перемешивание исходов внутри точки обязано дать 1,00, сдвиг точки исхода на 12 недель обязан результат изменить. Обе выполнились. | Пререгистрация критериев; permutation testNosek et al., PNAS, 2018 · Fisher, «The Design of Experiments», 1935 |
| Точное совпадение вместо доверия — правило вместо оценки | Ответы витрины сверены с пересобранным из bronze silver: 70 802 фразы, ноль расхождений. Сравнение по числу строк не принимается — оно проходит и у файла, потерявшего символ в середине. | Сверка данных (reconciliation)собственное правило лаборатории, внешнего источника нет |
Как собрано
Один процесс на Python, DuckDB рядом, systemd сверху: ни очередей, ни контейнеров, ни векторных хранилищ. Источники изолированы — у Вордстата и Дзена свои папки модулей, своё сырьё и свой словарь, перекрёстные импорты запрещены, а связка живёт только в аналитическом слое поверх снимков. Сшивка фразы с темой идёт по отличительной лемме — той содержательной лемме заголовка, что реже всех встречается по всей таксономии: «чемпионат» и «мир» есть у сотни тем, «дзюдо» — у одной. Ошибка в silver стоит одного пересчёта, ошибка в bronze не стоит ничего — потому что исправить её нечем.
Ошибка в silver стоит одного пересчёта, ошибка в bronze не стоит ничего — потому что исправить её нечем.
На чём держится конструкция
Шесть правил, каждое рождено отказом или замером, а не вкусом. Пятое взято из статьи о политиках обновления краулеров и опирается на две доказанные теоремы; остальные пять — собственные, и у каждого в журнале есть запись с датой.
grep -c 429 дал 27 «попаданий квоты», и все 27 оказались подстрокой внутри «показов 1442917» и счётчиков 4290–4299. Настоящих ошибок было ноль, а гипотеза на этом числе прожила полдня.Решения и основания
Каждое решение помечено датой и статусом: замер, гипотеза или выбор владельца. Ниже те семь, что изменили устройство платформы, а не настройку; у каждого есть отвергнутая альтернатива и названная цена.
| Решение | Основание |
|---|---|
| Два источника, а не один | Вордстат отвечает, что люди ищут; Дзен — сколько об этом уже написано. Порознь эти данные есть у всех, вместе они дают тот срез, который платформы обратных ссылок не строят по построению. |
| Хранение в три слоя: bronze → silver → gold | Разделение по цене ошибки, а не по технологии. Сырьё неизменяемо и невосполнимо, база производна и пересчитывается бесплатно, витрина переделывается сколько угодно. |
| Версионирования ряда не будет; обновление — дописывание хвоста | Замер 11.08.2026 на 200 фразах: сопоставлено 89 600 недельных точек, расхождений 99 (0,11%), и все они лежат в двух последних неделях; за остальные 446 недель — ноль. SCD Type 2 на такой правке не окупается, историю версий уже держит bronze. |
| Пик фразы — всеисторический, пик ниши — за два года | Максимум распределяется по объединению, поэтому пик фразы переживает помесячное сжатие точно. Пик ниши — максимум суммы рядов носителей, а свёртки по разным измерениям не переставимы: свернув время в месяцы, сложить носителей на недельном зерне уже нельзя. |
| Пороги концентрации взяты из практики конкурентного анализа | FREE_HHI 0,15 и TIGHT_HHI 0,25 числились взятыми на глаз, пока поиск 11.08.2026 не показал: это общепринятые пороги концентрации по индексу Херфиндаля–Хиршмана, переведённые в доли. Основание было, потеряна была ссылка. У порога доминирования 0,5 внешнего основания нет, и это записано прямо. |
| Данные не уезжают в репозиторий | 2,6 ГБ снимков и баз живут на сервере, копия невосполнимого — на локальной машине, контрольные суммы распакованных потоков сверены побайтно. В git едут код, канон и протокол — 168 файлов. |
| Пауза объявлена решением, а не простоем | Квота Yandex Cloud нужна другому проекту на 30 дней. Порядок остановки обязателен: сначала таймеры, потом процесс — наоборот, и суточный таймер поднял бы сбор заново в 06:00. |
Чем платит конструкция
Ограничения перечислены до результата намеренно: цена конструкции должна быть известна прежде, чем читатель увидит цифры. Ни одно из них не дефект — каждое куплено осознанно и стоит ровно того, что названо справа.
| Решение | Чем ограничивает |
|---|---|
| Потолок глубины словаря | 56 080 фраз глубины 4 не будут измерены никогда при нынешнем потолке. Вызовов они не стоили, но раздувают реестр и смещают любую долю, посчитанную «по реестру»: это 37% реестра на 17.08.2026 — и 42% на замере 14.08.2026, когда словарь был 133 308 фраз. Доля меняется вместе со знаменателем, потому и датируется. |
| Носитель обязан содержать отличительную лемму темы | Покрытие ниш 29% на замере 14.08.2026: спрос посчитан у 2 780 ниш из 9 651; на снимке витрины 17.08 это уже 31% (3 011 из 9 722). Больше трети молчащих — класс B1: лемма в словаре есть, но только в коротких фразах, и лечится это сбором длинных, то есть квотой. |
| Помесячное сжатие истории старше двух лет | Пик ниши считается по окну 104 недели, и ярлык «взлёт» получают 457 ниш из 2 853 против 351 при прежнем всеисторическом пике. Вернуть прежнее число нечем: восьми лет недельной суммы в silver больше нет. |
| Суточная детализация и гео собираются впрок | 45 973 вызова из 167 488, около 27% всей потраченной квоты, ни разу не прочитаны аналитическим слоем (замер на 17.08.2026). Оправдание было — невосполнимое собираем сегодня, — но это ставка, и она стоит четверти гранта. |
| Бэктест проверяет спрос, а не вердикт | В вердикт по нише входит конкуренция — HHI и доля лидера, — которой в бэктесте нет вовсе. Подъём 1,38 отвечает «вырастет ли спрос на эту фразу» и ничего не говорит о том, стоит ли писать в нишу. |
| Сигнал — перевес, а не машина | Точек с подъёмом выше единицы 43 из 65, медиана 1,15, худшая точка 0,68, лучшая 1,78. Считано по 65 точкам решения из 76: в остальных одиннадцати сигнал не выбрал ни одной фразы, и подъём там считать было не на чем. В двух месяцах из трёх сигнал помогает, в одном — не помогает или мешает. |
| Единственный экземпляр данных на сервере | Погибнет сервер — погибнут снимки: в репозиторий они не попадают и не должны. Копия невосполнимого держится отдельным скриптом на локальной машине, и на 17.08 это 977 МБ в 110 файлах. |
Что получилось
Ядро измерено впервые за жизнь проекта 14 августа 2026 — и измерено бесплатно, на уже собранных данных, без единого вызова квоты. Вселенная бэктеста — 60 448 фраз с историей не короче трёх лет; точек решения 76, это последняя неделя каждого месяца с января 2020 по апрель 2026; решений 3 820 805. Признаки в каждой точке считаются строго по неделям до неё, исход — по следующим двенадцати. Важнее самого подъёма то, что наивная инерция даёт 0,93: «что росло, то и будет расти» работает хуже случайного выбора, значит сигнал несёт информацию сверх продолжения тренда, а не переоткрывает его.
Подъём (lift) — доля фраз, у которых спрос вырос больше чем на 10 %, среди помеченных сигналом, делённая на ту же долю среди всех фраз точки решения. Единица означает, что сигнал не лучше случайного выбора. Отношение считается внутри каждой точки и усредняется по точкам с весом по числу помеченных: базовая доля гуляет от месяца к месяцу, и объединение всех точек в одну кучу дало бы подъём выше единицы даже на случайных исходах — парадокс Симпсона, а не сигнал.
- L
- подъём, безразмерный; 1,38 по 3 820 805 решениям
- Δ
- изменение спроса: средние показы за 12 недель после точки решения против средних за 12 недель до неё; рост больше 10 % — after > 1,1 × before
- сигнал
- стадии «взлёт» и «растёт»: средние показы за последние 8 недель выше предыдущих 8 не меньше чем на 20 %, признаки считаются только по неделям до точки
- P(·)
- доля фраз в точке решения
- Выборка
- 65 точек решения из 76: в одиннадцати сигнал не выбрал ни одной фразы. 3 820 805 решений не независимы — одна фраза входит в 76 точек, а фразы движутся вместе, поэтому считается не «сколько решений», а «в скольких месяцах сработало».
- Разброс
- Медиана по точкам 1,15, худшая точка 0,68 (июль 2024), лучшая 1,78 (апрель 2023); выше единицы 43 точки из 65. В двух месяцах из трёх сигнал помогает, в одном — нет или мешает. Доверительный интервал по точкам не считался: вместо него дано распределение.
- Проверки
- Перемешивание исходов внутри точки — подъём ровно 1,00; сдвиг точки исхода на 12 недель при тех же признаках — 1,00 и 0,97. Обе объявлены до прогона, обе пройдены.
- Не обобщается
- Подъём измерен на фразах Вордстата и отвечает «вырастет ли спрос на фразу». Конкуренция — индекс концентрации и доля лидера — в бэктест не входит; про то, стоит ли писать в нишу, число не говорит. Сигнал не артефакт длины фразы: подъём 1,12–1,19 на всех длинах от одного слова до семи.
- Не измерено
- Полезность вердикта по нише: нужен журнал рекомендаций глубиной четыре недели, на паузе горизонт не набирается.
Ядро измерено на 3 820 805 решениях: сигнал спроса предсказывает рост с подъёмом 1,38, обе проверки на утечку будущего пройдены, наивная инерция на тех же данных даёт 0,93. Через систему прошло 82 560 фраз; сбор остановлен 17.08.2026 штатно — квота отдана другому проекту.
Кауфман Lab — лаборатория архитектуры искусственного интеллекта. Мы проектируем процессы и методологии. Код устаревает с каждым новым поколением моделей — методология нет, поэтому в проектах разбирается именно она. Собрать систему по этой схеме сможет любая современная нейросеть.
Что пошло не так
Журнал заусенцев держит 122 записи в одном формате: симптом → диагностика, которая помогла → лечение → правило. Ниже восемь, каждая из которых изменила устройство платформы, а не одну строку кода.
Пик памяти после сжатия на 57 %прибор показывал предел, а не расход
Лимит памяти базыдва лимита в разных файлах, остался один
Что сознательно не вошло
Граница проведена там, где стоимость известна, а выгода — нет. Две позиции отключены решением о паузе, две отложены до её снятия, две отклонены замером, две ждут квоты и стоят в очереди к владельцу.
Что обычно спрашивают
Ниже — то, что спрашивают про сам расчёт: расход квоты, почему сбор остановлен и как проверялось, что модель не подглядывает в будущее.
Что такое поиск свободных ниш?
Поиск свободных ниш — это сопоставление поискового спроса на тему с числом уже опубликованных по ней материалов: спрашивают много, пишут мало. Нужен авторам, редакциям и контент-агентствам, которые выбирают, о чём писать дальше. Кауфман Lab строит платформу, которая сводит недельную историю запросов с таксономией тем и ставит нише вердикт: 9 722 ниши в последней сборке. Трафик она не предсказывает и статей не пишет.
Сколько квоты съедает круглосуточный сбор?
Расход измеряется вызовами API, а не рублями: за всю жизнь проекта — 167 488 вызовов Вордстата на 17.08.2026. На саму недельную историю ушло 118 209, то есть 1,4 вызова на одну измеренную фразу: API ретроактивен и отдаёт восемь лет истории одним вызовом. Остальные 49 279 — суточная детализация 26 295, гео 19 678 и ошибки 3 306; измеренных фраз от них не прибавилось. Хранение — 2,6 ГБ на одном сервере. Готовая альтернатива считается уже деньгами: подписка Semrush Pro стоит $139,95 в месяц по публичному прайсу на 25.08.2026 и даёт срез конкурентов, а не сравнение спроса с предложением.
Почему сбор остановлен, если платформа уже была собрана и работала?
Квота облачного гранта понадобилась другому проекту на 30 дней, и владелец решил отдать её целиком, а не делить. Останавливали по порядку: сначала пять таймеров, потом процесс, и сигналом SIGTERM, а не принудительным убийством — сборщик превращает его в штатное завершение, закрывает снимок и дописывает маркер конца потока. Всё собранное за тот день догружено в базу, витрина пересобрана последней и оказалась лучшей за жизнь проекта: 3 011 ниш со спросом против 2 780 тремя днями раньше.
Что мешает просто взять частотность и писать в самые популярные темы?
Два обстоятельства. Первое: частотность запроса перестала предсказывать трафик — заметная доля запросов закрывается ответом прямо в выдаче, до перехода на сайт. Второе замерено: стратегия «что растёт, то и будет расти» даёт на 3,8 млн решений подъём 0,93 и 0,95, то есть работает хуже случайного выбора. Популярность прошлой недели — не то же самое, что спрос следующего квартала.
Как проверяли, что расчёт не подглядывает в будущее?
Двумя опытами, объявленными до прогона. В первом исходы перемешивались внутри каждой точки решения: связь обязана исчезнуть, и подъём упал ровно до 1,00. Во втором точка исхода сдвигалась на 12 недель при тех же признаках: результат обязан измениться, и он изменился — 1,00 и 0,97. Признаки в каждой точке считаются строго по неделям до неё, ни одна неделя после точки в них не входит.
Почему одна и та же метрика даёт разные числа в разных отчётах?
Потому что она посчитана на разных популяциях, и это не ошибка, а свойство устройства. Реестр — все фразы словаря, включая ни разу не измеренные; витрина — только фразы с измеренным рядом; очередь — разность между ними. На 17.08.2026 в реестре 152 218 фраз, а измерено 82 560: витрина вдвое меньше, поэтому «носитель есть» и «ниша живая» — два разных числа. Метрика без названной популяции в проекте недействительна: за двое суток ярлык дважды прочитали не тем, чем он был, и каждый раз это стоило дня.
Что происходит с собранными данными, пока проект стоит?
Ничего — и это цель остановки. Снимки неизменяемы по построению, база из них пересобирается бесплатно, поэтому пауза не портит ни одной строки. Невосполнимое лежит в двух местах: 2,6 ГБ на сервере и 977 МБ сырых снимков в копии на локальной машине, контрольные суммы распакованных потоков сверены. Чекпоинт сборщика, реестр загруженных снимков и журнал измеренного паузу переживают: после возобновления сбор продолжится с того места, где остановился, без ручной доводки.
Сколько стоит анализ ниши?
Себестоимость расчёта — 0 ₽: недельную статистику Вордстат отдаёт по бесплатной квоте, платных моделей в расчёте нет вовсе. По рынку та же работа стоит 67 000 ₽ в месяц — столько стоит SEO-специалист по вакансиям hh.ru. За эти ноль рублей измерено 82 560 фраз, а в последней сборке витрины 17.08.2026 — 9 722 ниши.
Как найти свободную нишу?
Свободная ниша — это разрыв: спрос на тему есть, а материалов по ней написано мало. Платформа сводит недельную историю запросов Вордстата с числом уже опубликованных материалов Дзена и ставит нише вердикт по трём величинам: спрос, индекс концентрации и доля лидера. Ниша с неизмеренным спросом помечается «молчит». В последней сборке витрины 17.08.2026 спрос измерен у 3 011 ниш из 9 722.
Как проверить спрос на тему?
Спрос проверяют по недельной истории показов: средние показы за последние 8 недель сравнивают с предыдущими 8, и рост не меньше 20% считается сигналом. На истории это проверено на 3 820 805 решений: среди помеченных фраз спрос дальше вырастал больше чем на 10% в 1,38 раза чаще, чем в среднем по выборке. Это перевес, а не гарантия — из 65 точек решения подъём выше единицы в 43.
- Hirschman A. O. National Power and the Structure of Foreign Trade. University of California Press, 1945 — индекс концентрации.
- Herfindahl O. C. Concentration in the Steel Industry. Columbia University, 1950 — индекс концентрации.
- Cho J., Garcia-Molina H. Effective Page Refresh Policies for Web Crawlers. ACM Transactions on Database Systems, 28(4), 2003 — теоремы 5.1–5.2. doi:10.1145/958942.958945
- Nosek B. A., Ebersole C. R., DeHaven A. C., Mellor D. T. The preregistration revolution. PNAS, 115(11), 2018. doi:10.1073/pnas.1708274114
- Fisher R. A. The Design of Experiments. Oliver & Boyd, 1935 — permutation test.
- Pardo R. Design, Testing and Optimization of Trading Systems. Wiley, 1992 — walk-forward validation.
- Simpson E. H. The Interpretation of Interaction in Contingency Tables. Journal of the Royal Statistical Society B, 13(2), 1951 — парадокс Симпсона.
- Tversky A., Kahneman D. Belief in the law of small numbers. Psychological Bulletin, 76(2), 1971. doi:10.1037/h0031322
- Reyna V. F., Brainerd C. J. Numeracy, ratio bias, and denominator neglect in judgments of risk and probability. Learning and Individual Differences, 18(1), 2008. doi:10.1016/j.lindif.2007.03.011
- Popper K. Logik der Forschung. Springer, 1934 — фальсифицируемость.
- Nygard M. Documenting Architecture Decisions, 2011. cognitect.com
- Databricks. What is a medallion architecture? databricks.com