Лаборатория архитектуры AI
Аналитика спроса

Темы без конкурентов

Свободная ниша — это разрыв: спрос на тему есть, а материалов по ней мало. Расчёт сводит историю запросов с числом уже вышедших публикаций и сам помечает такие темы. Измерено 82 560 фраз, спрос посчитан у 3 011 ниш.

Объём82 560 фраз измерено
Себестоимость0 ₽ · квота Wordstat
По рынку67 000 ₽/мес — SEO-специалист
ВердиктРаботает

Опубликовано 25.08.2026 · цифры сверены 01.09.2026

Как найти тему со спросом и без конкурентов: семь шагов

  1. Широкий список фраз. Соберите не десяток ключевых слов, а всё, что люди вообще спрашивают по вашей теме.
  2. Спрос. Снимите частоту каждой фразы в Вордстате: сколько раз её искали за месяц. Это бесплатно, нужен только аккаунт Яндекса.
  3. Предложение. Посчитайте, сколько материалов по теме уже вышло и насколько они свежие: поиск и Дзен показывают это за пару минут.
  4. Разрыв. Ищите темы, где спрос есть, а материалов мало. Это и есть свободная ниша.
  5. Отсев шума. Уберите сезонные всплески и разовые новости: они выглядят как спрос, но им не являются.
  6. Один знаменатель. Считайте долю всегда от одного и того же списка: у нас один и тот же замер дал «+110 тем» по полному реестру и «+43» по витрине.
  7. Проверка на истории. Возьмите прошлые месяцы и посмотрите, сработал бы такой выбор тогда.

Что под какую задачу

  • Блог или канал — хватит 20–30 тем и пересчёта раз в месяц.
  • Услуги и продажи — смотрите фразы со словами «цена», «заказать», «стоимость» — спрос ниже, но люди ближе к покупке.
  • Новый рынок — спроса ещё нет, цифры не помогут: здесь работают разговоры с клиентами.

Ниже — как этот расчёт устроен у нас: 82 560 измеренных фраз и проверка на истории.

01 · Этапы

Где проект сейчас

СделаноСборцепь bronze → silver → витрина, 2,6 ГБ
СделаноМостик фраза↔темафраза сшивается с темой по отличительной лемме
СделаноВитринасборка 17.08: 9 722 ниши, 3 011 со спросом
СделаноБэктест3 820 805 решений, утечки будущего нет
СейчасПаузасбор остановлен 17.08, квота не тратится

Цепь собрана и замкнута 13 августа 2026: сбор в bronze, пересчёт в silver и gold, витрина ниш с вердиктом — всё под суточными таймерами. Через четверо суток после этого, 17 августа, сбор остановлен решением владельца: квота Yandex Cloud понадобилась другому проекту на 30 дней. Останавливали по порядку — сначала пять таймеров, потом процесс, и только сигналом SIGTERM, чтобы сборщик закрыл снимок сам и gzip дописал маркер конца потока. Проект стоит целым, а не брошенным: чекпоинт сборщика, реестр загруженных снимков и журнал измеренного паузу переживают.

02 · Задача

Что было нужно

Требование одно: находить темы, где спроса много, а материалов мало, и делать это на данных, а не на ощущении редактора. Платформы обратных ссылок отвечают на другой вопрос — «что есть у конкурента, чего нет у меня» — и по построению не видят спрос там, где предложения нет вовсе. Ограничение, из которого выросла вся конструкция: наблюдение нельзя переснять задним числом. Счётчики Дзена накопительные, и сигнал в них — дельта между снимками; региональный срез Яндекс отдаёт коротким окном и истории не хранит; посуточная детализация живёт недолго. Отсюда деление работы на две несимметричные половины — сбор, который нельзя переделать, и анализ, который переделывается сколько угодно.

МетодЧто из него взятоКаноническое имя · источник
Разведка до сборки — карта местности прежде кодаКак задачу «фраза ↔ тема» решают Ahrefs, Semrush, Exploding Topics и Spate, разбиралось до написания мостика. Пороги концентрации взяты не на глаз: FREE_HHI 0,15 и TIGHT_HHI 0,25 — стандартные пороги концентрации в конкурентном анализе по индексу Херфиндаля–Хиршмана, переведённые в доли.Индекс Херфиндаля–ХиршманаHirschman, «National Power and the Structure of Foreign Trade», 1945 · Herfindahl, «Concentration in the Steel Industry», 1950
Один хозяин у данных — bronze неизменяемСнимок пишется append-only, с меткой времени, версией парсера и идентификатором прогона. Silver и gold пересобираются из него целиком; сверка после пересборки идёт фраза за фразой.Medallion architecture; append-only logDatabricks, документация платформы
Замер прежде объяснения — красный сигнал до гипотезКоманда, отличающая «плохо» от «хорошо» на конкретном симптоме, строится раньше теории. Три неудачные попытки объяснить в одном месте — стоп: под вопросом устройство, а не деталь.Фальсифицируемость гипотезыPopper, «Logik der Forschung», 1934
Утверждение несёт свой статус — замер, гипотеза или решениеУ каждого числа указан файл и строка, у каждого решения — кто и когда решил. Слово «гипотеза» стоит в тексте, если проверки не было. Число без источника не употребляется, даже когда оно верное.Провенанс данных; запись решений ADRNygard, «Documenting Architecture Decisions», 2011
Разделение по проверяемости — сначала то, что пересчитываетсяВопрос «предсказывает ли сигнал рост спроса» отвечается на уже собранных данных, без единого вызова квоты. Вопрос «полезен ли вердикт» требует четырёх недель вперёд и потому вынесен отдельно.Walk-forward validation, point-in-time correctnessPardo, «Design, Testing and Optimization of Trading Systems», 1992
Приёмка порогами — критерий объявлен до прогонаПроверки на утечку будущего описаны заранее: перемешивание исходов внутри точки обязано дать 1,00, сдвиг точки исхода на 12 недель обязан результат изменить. Обе выполнились.Пререгистрация критериев; permutation testNosek et al., PNAS, 2018 · Fisher, «The Design of Experiments», 1935
Точное совпадение вместо доверия — правило вместо оценкиОтветы витрины сверены с пересобранным из bronze silver: 70 802 фразы, ноль расхождений. Сравнение по числу строк не принимается — оно проходит и у файла, потерявшего символ в середине.Сверка данных (reconciliation)собственное правило лаборатории, внешнего источника нет
От темы к нише со спросом
Тем в витрине10336100 %
Ниш с носителем972294 %
Ниш со спросом301129 %
Снимок 17.08.2026, 11:06 — последняя сборка витрины. 3 011 ниш со спросом из 9 722 — это 31% покрытия против 29% (2 780 из 9 651) на замере 14.08: выросло за трое суток. У ниш за пределами последней ступени носитель известен, но ни одна его фраза не измерена. Источники: reports/2026-08-17-pause.md, §3 и reports/2026-08-14-quality.md, §1.
03 · Сборка

Как собрано

Один процесс на Python, DuckDB рядом, systemd сверху: ни очередей, ни контейнеров, ни векторных хранилищ. Источники изолированы — у Вордстата и Дзена свои папки модулей, своё сырьё и свой словарь, перекрёстные импорты запрещены, а связка живёт только в аналитическом слое поверх снимков. Сшивка фразы с темой идёт по отличительной лемме — той содержательной лемме заголовка, что реже всех встречается по всей таксономии: «чемпионат» и «мир» есть у сотни тем, «дзюдо» — у одной. Ошибка в silver стоит одного пересчёта, ошибка в bronze не стоит ничего — потому что исправить её нечем.

СБОРсборщик · кодснимок append-only с меткой времениBRONZEдиск сервера2,6 ГБ, единственный источник правдыSILVERDuckDB · пересчёт16,75 млн недельных строкМОСТИК ФРАЗА→ТЕМАкод · леммыотличительная лемма, шесть классовВЕРДИКТ ПО НИШЕкод · порогиспрос × HHI × доля лидерапрошлоне прошлоНИША СВОБОДНАспрос без ответа · в витринуНИША МОЛЧИТспрос не измерен · класс B1 или CБЭКТЕСТ3,8 млн решенийплитами — слои хранения, они лежат друг на друге · штриховое — проверка без вызовов квоты · акцент — вердикт
Проверено левое плечо конвейера: бэктест читает silver и отвечает про спрос — подъём 1,38 на 3,8 млн решений. Правое плечо, вердикт по нише, на паузе проверить нечем.

Ошибка в silver стоит одного пересчёта, ошибка в bronze не стоит ничего — потому что исправить её нечем.

04 · Правила

На чём держится конструкция

Шесть правил, каждое рождено отказом или замером, а не вкусом. Пятое взято из статьи о политиках обновления краулеров и опирается на две доказанные теоремы; остальные пять — собственные, и у каждого в журнале есть запись с датой.

1
Популяция обязательнаметрика без указания популяции недействительнаРеестр, витрина и очередь — три разных множества. Реестр — 152 218 фраз, витрина — 82 560 измеренных: витрина вдвое меньше реестра (снимок 17.08.2026). Один и тот же замер 10.08.2026 по реестру дал «+110 ниш, ни одна не потеряла», а по витрине — «+43, потеряли 6». Разница не в данных, а в знаменателе. Это пренебрежение знаменателем, denominator neglect: доля без названной популяции не имеет смысла — Reyna & Brainerd, 2008.
2
Снимок неизменяемсырьё пишется один раз и не редактируетсяРяды Вордстата и счётчики Дзена привязаны к моменту наблюдения: не собрал 9 августа — не соберёшь уже никогда. Агрегаты и скоры всегда пересчитываемы из снимков, обратный ход невозможен.
3
Первое касание важнее перемеранеизмеренная фраза идёт вперёд уже измереннойРяд Вордстата ретроактивен: неделя, не измеренная впервые сегодня, теряется навсегда, а неделя, не перемеренная сегодня, придёт завтра целой. Поэтому перемер берёт только тот бюджет, который не выбрало первое касание.
4
Влей столько, сколько измеришьза сутки в реестр попадает не больше фраз, чем успевает измерить прогонПод вливание отдаётся половина суточной ёмкости первого касания — 7 000 фраз из 14 000 (решение владельца, 11.08.2026). Отдать всю нельзя: приход сравняется с расходом, и очередь застынет на своём размере навсегда.
5
Обход перемера равномерныйфразы обновляются по кругу фиксированным порядком, без «горячее чаще»Cho и Garcia-Molina, «Effective Page Refresh Policies For Web Crawlers», теоремы 5.1 и 5.2: равномерная политика лучше пропорциональной по обеим метрикам при любом распределении скоростей изменения. Фиксированный порядок даёт свежесть 0,63 против 0,5 у случайного и вчетверо меньший возраст.
6
Число без источника не употребляетсяутверждение помечено как замер, гипотеза или решениеСчётчик без единого взгляда на сами совпадения — не замер. Проверено на отказе: grep -c 429 дал 27 «попаданий квоты», и все 27 оказались подстрокой внутри «показов 1442917» и счётчиков 4290–4299. Настоящих ошибок было ноль, а гипотеза на этом числе прожила полдня.
05 · Решения

Решения и основания

Каждое решение помечено датой и статусом: замер, гипотеза или выбор владельца. Ниже те семь, что изменили устройство платформы, а не настройку; у каждого есть отвергнутая альтернатива и названная цена.

РешениеОснование
Два источника, а не одинВордстат отвечает, что люди ищут; Дзен — сколько об этом уже написано. Порознь эти данные есть у всех, вместе они дают тот срез, который платформы обратных ссылок не строят по построению.
Хранение в три слоя: bronze → silver → goldРазделение по цене ошибки, а не по технологии. Сырьё неизменяемо и невосполнимо, база производна и пересчитывается бесплатно, витрина переделывается сколько угодно.
Версионирования ряда не будет; обновление — дописывание хвостаЗамер 11.08.2026 на 200 фразах: сопоставлено 89 600 недельных точек, расхождений 99 (0,11%), и все они лежат в двух последних неделях; за остальные 446 недель — ноль. SCD Type 2 на такой правке не окупается, историю версий уже держит bronze.
Пик фразы — всеисторический, пик ниши — за два годаМаксимум распределяется по объединению, поэтому пик фразы переживает помесячное сжатие точно. Пик ниши — максимум суммы рядов носителей, а свёртки по разным измерениям не переставимы: свернув время в месяцы, сложить носителей на недельном зерне уже нельзя.
Пороги концентрации взяты из практики конкурентного анализаFREE_HHI 0,15 и TIGHT_HHI 0,25 числились взятыми на глаз, пока поиск 11.08.2026 не показал: это общепринятые пороги концентрации по индексу Херфиндаля–Хиршмана, переведённые в доли. Основание было, потеряна была ссылка. У порога доминирования 0,5 внешнего основания нет, и это записано прямо.
Данные не уезжают в репозиторий2,6 ГБ снимков и баз живут на сервере, копия невосполнимого — на локальной машине, контрольные суммы распакованных потоков сверены побайтно. В git едут код, канон и протокол — 168 файлов.
Пауза объявлена решением, а не простоемКвота Yandex Cloud нужна другому проекту на 30 дней. Порядок остановки обязателен: сначала таймеры, потом процесс — наоборот, и суточный таймер поднял бы сбор заново в 06:00.
Подъём сигнала по длине фразы
1.121 слово
1.152 слова
1.193 слова
1.164 слова
1.165 слов
1.176 слов
1.157+ слов
Единица — случайный выбор. Подъём держится на всех длинах, значит сигнал не артефакт длины фразы. Бэктест 14.08.2026, reports/2026-08-14-quality.md, §3.
06 · Ограничения

Чем платит конструкция

Ограничения перечислены до результата намеренно: цена конструкции должна быть известна прежде, чем читатель увидит цифры. Ни одно из них не дефект — каждое куплено осознанно и стоит ровно того, что названо справа.

РешениеЧем ограничивает
Потолок глубины словаря56 080 фраз глубины 4 не будут измерены никогда при нынешнем потолке. Вызовов они не стоили, но раздувают реестр и смещают любую долю, посчитанную «по реестру»: это 37% реестра на 17.08.2026 — и 42% на замере 14.08.2026, когда словарь был 133 308 фраз. Доля меняется вместе со знаменателем, потому и датируется.
Носитель обязан содержать отличительную лемму темыПокрытие ниш 29% на замере 14.08.2026: спрос посчитан у 2 780 ниш из 9 651; на снимке витрины 17.08 это уже 31% (3 011 из 9 722). Больше трети молчащих — класс B1: лемма в словаре есть, но только в коротких фразах, и лечится это сбором длинных, то есть квотой.
Помесячное сжатие истории старше двух летПик ниши считается по окну 104 недели, и ярлык «взлёт» получают 457 ниш из 2 853 против 351 при прежнем всеисторическом пике. Вернуть прежнее число нечем: восьми лет недельной суммы в silver больше нет.
Суточная детализация и гео собираются впрок45 973 вызова из 167 488, около 27% всей потраченной квоты, ни разу не прочитаны аналитическим слоем (замер на 17.08.2026). Оправдание было — невосполнимое собираем сегодня, — но это ставка, и она стоит четверти гранта.
Бэктест проверяет спрос, а не вердиктВ вердикт по нише входит конкуренция — HHI и доля лидера, — которой в бэктесте нет вовсе. Подъём 1,38 отвечает «вырастет ли спрос на эту фразу» и ничего не говорит о том, стоит ли писать в нишу.
Сигнал — перевес, а не машинаТочек с подъёмом выше единицы 43 из 65, медиана 1,15, худшая точка 0,68, лучшая 1,78. Считано по 65 точкам решения из 76: в остальных одиннадцати сигнал не выбрал ни одной фразы, и подъём там считать было не на чем. В двух месяцах из трёх сигнал помогает, в одном — не помогает или мешает.
Единственный экземпляр данных на сервереПогибнет сервер — погибнут снимки: в репозиторий они не попадают и не должны. Копия невосполнимого держится отдельным скриптом на локальной машине, и на 17.08 это 977 МБ в 110 файлах.
07 · Результат

Что получилось

решений в бэктесте3 820 805reports/2026-08-14-quality.md, §3
подъём сигнала на росте больше 10%1,38reports/2026-08-14-quality.md, §3
подъём инерции — хуже случайного0,93reports/2026-08-14-quality.md, §3
расхождений при сверке 70 802 фраз0reports/2026-08-14-quality.md, §2
На что ушли 167 488 вызовов Вордстата
Недельная история118209
Суточная детализация26295
Гео19678
Ошибки3306
На недельную историю ушло 118 209 вызовов при 82 560 измеренных фразах — отсюда и берётся 1,4 вызова на фразу, а не из полной суммы. Суточная детализация и гео вместе — 45 973 вызова, около 27% — собраны и ни разу не прочитаны аналитическим слоем. Замер на момент остановки, reports/2026-08-17-pause.md, §4.

Ядро измерено впервые за жизнь проекта 14 августа 2026 — и измерено бесплатно, на уже собранных данных, без единого вызова квоты. Вселенная бэктеста — 60 448 фраз с историей не короче трёх лет; точек решения 76, это последняя неделя каждого месяца с января 2020 по апрель 2026; решений 3 820 805. Признаки в каждой точке считаются строго по неделям до неё, исход — по следующим двенадцати. Важнее самого подъёма то, что наивная инерция даёт 0,93: «что росло, то и будет расти» работает хуже случайного выбора, значит сигнал несёт информацию сверх продолжения тренда, а не переоткрывает его.

Как считается подъём
L=P(Δ>10%сигнал)P(Δ>10%)=1,38L = \frac{P(\Delta > 10\% \mid \text{сигнал})}{P(\Delta > 10\%)} = 1{,}38(1)

Подъём (lift) — доля фраз, у которых спрос вырос больше чем на 10 %, среди помеченных сигналом, делённая на ту же долю среди всех фраз точки решения. Единица означает, что сигнал не лучше случайного выбора. Отношение считается внутри каждой точки и усредняется по точкам с весом по числу помеченных: базовая доля гуляет от месяца к месяцу, и объединение всех точек в одну кучу дало бы подъём выше единицы даже на случайных исходах — парадокс Симпсона, а не сигнал.

L
подъём, безразмерный; 1,38 по 3 820 805 решениям
Δ
изменение спроса: средние показы за 12 недель после точки решения против средних за 12 недель до неё; рост больше 10 % — after > 1,1 × before
сигнал
стадии «взлёт» и «растёт»: средние показы за последние 8 недель выше предыдущих 8 не меньше чем на 20 %, признаки считаются только по неделям до точки
P(·)
доля фраз в точке решения
Популяция: 60 448 фраз с историей ≥ 3 лет · 76 точек решения, последняя неделя каждого месяца 01.2020–04.2026 · 65 точек с ненулевым выбором · точность сигнала 46,2 % при базовой доле 34,0 % · scripts/backtest_demand.py, прогон 14.08.2026 · reports/2026-08-14-quality.md, §3
Достоверность результата
Выборка
65 точек решения из 76: в одиннадцати сигнал не выбрал ни одной фразы. 3 820 805 решений не независимы — одна фраза входит в 76 точек, а фразы движутся вместе, поэтому считается не «сколько решений», а «в скольких месяцах сработало».
Разброс
Медиана по точкам 1,15, худшая точка 0,68 (июль 2024), лучшая 1,78 (апрель 2023); выше единицы 43 точки из 65. В двух месяцах из трёх сигнал помогает, в одном — нет или мешает. Доверительный интервал по точкам не считался: вместо него дано распределение.
Проверки
Перемешивание исходов внутри точки — подъём ровно 1,00; сдвиг точки исхода на 12 недель при тех же признаках — 1,00 и 0,97. Обе объявлены до прогона, обе пройдены.
Не обобщается
Подъём измерен на фразах Вордстата и отвечает «вырастет ли спрос на фразу». Конкуренция — индекс концентрации и доля лидера — в бэктест не входит; про то, стоит ли писать в нишу, число не говорит. Сигнал не артефакт длины фразы: подъём 1,12–1,19 на всех длинах от одного слова до семи.
Не измерено
Полезность вердикта по нише: нужен журнал рекомендаций глубиной четыре недели, на паузе горизонт не набирается.
Работает

Ядро измерено на 3 820 805 решениях: сигнал спроса предсказывает рост с подъёмом 1,38, обе проверки на утечку будущего пройдены, наивная инерция на тех же данных даёт 0,93. Через систему прошло 82 560 фраз; сбор остановлен 17.08.2026 штатно — квота отдана другому проекту.

Повторить самому
Устройствотри слоя храненияБэктест3 820 805 решенийДанные2,6 ГБ на сервере

Кауфман Lab — лаборатория архитектуры искусственного интеллекта. Мы проектируем процессы и методологии. Код устаревает с каждым новым поколением моделей — методология нет, поэтому в проектах разбирается именно она. Собрать систему по этой схеме сможет любая современная нейросеть.

08 · Грабли

Что пошло не так

Журнал заусенцев держит 122 записи в одном формате: симптом → диагностика, которая помогла → лечение → правило. Ниже восемь, каждая из которых изменила устройство платформы, а не одну строку кода.

допосле1,96 ГиБ1,955 ГиБ

Пик памяти после сжатия на 57 %прибор показывал предел, а не расход

допосле1 ГБ2 000 МиБ

Лимит памяти базыдва лимита в разных файлах, остался один

Перемещение файла под живым писателем забрало половину дневного обходаПроцесс пишет в inode, а не в имя: перемещённый файл продолжает расти на новом месте, а снятая с него копия навсегда остаётся префиксом. Архив получил 198 строк из 418, и молча. Правило: файл, в который пишет живой сборщик, не уплотняется, не перемещается и не удаляется вообще.
Всплеск объявлен у 85,8% фраз — красивое число, целиком ложноеДоля считалась от суммы показов всего словаря за неделю, а у последней недели в базе было 1 224 фразы против 34 638 у остальных: Вордстат публикует недельную точку пофразно, растягивая её на полчаса. Правило: знаменатель «по тем, у кого есть данные» превращает неполноту в открытие.
Инвариант вливания печатал «помещается» и был при этом нарушенПроверка знала про один прогон, а инвариант назван за сутки; счётчики расширений жили в памяти и обнулялись перезапуском. Два прогона сделали по 65 расширений при бюджете 66 и влили 6 088 и 16 712 фраз при ёмкости 14 000. Правило: ограничивай ту величину, которая названа в инварианте.
Инструмент, отвечающий на главный вопрос проекта, лежал написанным и ни разу не запущеннымОн и не мог запуститься: выборка всех 32 млн строк списком кортежей, ряды из питоновских float по объекту на число, и полное отсутствие лимита памяти у соединения — единственный такой скрипт в проекте. Правило: замер не считается сделанным, пока его не прогнали на боевых данных.
Прибор упёрся в предел и показывал предел, а не расходСжатие убрало 57% строк, а пик памяти не сдвинулся: 1,96 против 1,955 ГиБ. Под мягким тормозом ядро вытесняет страницы в своп, и шаг упирается в настройку, а не в свою потребность. Правило: прежде чем читать показание, проверь, не уткнулось ли оно в ограничитель.
Два лимита памяти в разных файлах, и победил тот, которого не видноПредел юнита подняли по замеру до 2000 МиБ, а внутренний лимит базы так и остался константой 1 ГБ, зашитой в код с самого начала. Загрузчик упал на пине блока в 256 КиБ, витрина в тот день не собралась. Правило: у ресурса один хозяин, и второй предел обязан быть виден там же, где первый.
Выключенный таймер не значит выключенную работуПри остановке пять таймеров ушли в disabled, а сам сервис остался в автозапуске — ссылка в каталоге целевого уровня подняла бы сбор при первой же перезагрузке. Правило: у юнита два независимых повода стартовать, расписание и загрузка машины; проверять надо оба.
Вывод из трёх примеров едва не уехал в отчётПервые три примера класса B2 оказались однословными темами, и «дело в однословных темах» просилось готовой формулировкой. Разбивка по размеру темы: таких 90 из 946, девять процентов; настоящая масса — 856 тем из нескольких лемм. Правило: прежде чем обобщать примеры, посчитай их долю. Это закон малых чисел — вера, что маленькая выборка похожа на всю совокупность: Tversky & Kahneman, 1971.
09 · Границы

Что сознательно не вошло

Граница проведена там, где стоимость известна, а выгода — нет. Две позиции отключены решением о паузе, две отложены до её снятия, две отклонены замером, две ждут квоты и стоят в очереди к владельцу.

ОтключеноСбор Вордстата и ДзенаОстановлен 17.08.2026: квота Yandex Cloud отдана другому проекту на 30 дней. Пять таймеров, автозапуск сервиса и два локальных агента выключены — процессов сбора ноль, расписаний ноль, отложенных заданий нет.
ОтключеноЕжечасная выгрузка витриныАгент, тянувший 18,3-мегабайтную витрину с сервера на локальную машину, выгружен вместе с остановкой сбора. Копии витрины вне сервера сейчас нет, и это осознанная цена паузы.
ОтложеноПроверка полезности вердиктаТребует четырёх недель журнала рекомендаций от первой записи. На паузе горизонт не набирается: первое число появится не раньше, чем через месяц после возобновления сбора.
ОтложеноПодъём потолка глубины словаря56 080 фраз глубины 4 ждут решения владельца, открытого с 17.08.2026. Подъём потолка стоит квоты, а квоты сейчас нет — решать в пустоту бессмысленно.
Не будетВерсионирование ряда спросаРасхождения при переизмерении — 0,11%, и все в двух последних неделях. История версий уже есть: её держит bronze, а исправленный хвост подхватывает обычный перемер, потому что загрузчик заменяет ряд фразы целиком.
Не будетДанные в репозитории2,6 ГБ снимков и баз в git не попадают по закону проекта и попасть не должны. Репозиторий несёт код, канон и протокол — 168 файлов, 21 отчёт миссий, 122 записи журнала заусенцев.
В планахЗакрытие класса B1Сбор длинных фраз под 2 467 молчащих тем — самое дешёвое, что поднимает покрытие с нынешнего 31% на снимке 17.08.2026. Первое, на что уйдёт квота после снятия паузы.
В планахЧтение суточной детализации и гео45 973 вызова собраны и лежат без единого читателя. Решение простое по формулировке и до сих пор не принятое: либо читать этот срез аналитическим слоем, либо перестать его собирать.
10 · Вопросы

Что обычно спрашивают

Ниже — то, что спрашивают про сам расчёт: расход квоты, почему сбор остановлен и как проверялось, что модель не подглядывает в будущее.

Что такое поиск свободных ниш?

Поиск свободных ниш — это сопоставление поискового спроса на тему с числом уже опубликованных по ней материалов: спрашивают много, пишут мало. Нужен авторам, редакциям и контент-агентствам, которые выбирают, о чём писать дальше. Кауфман Lab строит платформу, которая сводит недельную историю запросов с таксономией тем и ставит нише вердикт: 9 722 ниши в последней сборке. Трафик она не предсказывает и статей не пишет.

Сколько квоты съедает круглосуточный сбор?

Расход измеряется вызовами API, а не рублями: за всю жизнь проекта — 167 488 вызовов Вордстата на 17.08.2026. На саму недельную историю ушло 118 209, то есть 1,4 вызова на одну измеренную фразу: API ретроактивен и отдаёт восемь лет истории одним вызовом. Остальные 49 279 — суточная детализация 26 295, гео 19 678 и ошибки 3 306; измеренных фраз от них не прибавилось. Хранение — 2,6 ГБ на одном сервере. Готовая альтернатива считается уже деньгами: подписка Semrush Pro стоит $139,95 в месяц по публичному прайсу на 25.08.2026 и даёт срез конкурентов, а не сравнение спроса с предложением.

Почему сбор остановлен, если платформа уже была собрана и работала?

Квота облачного гранта понадобилась другому проекту на 30 дней, и владелец решил отдать её целиком, а не делить. Останавливали по порядку: сначала пять таймеров, потом процесс, и сигналом SIGTERM, а не принудительным убийством — сборщик превращает его в штатное завершение, закрывает снимок и дописывает маркер конца потока. Всё собранное за тот день догружено в базу, витрина пересобрана последней и оказалась лучшей за жизнь проекта: 3 011 ниш со спросом против 2 780 тремя днями раньше.

Что мешает просто взять частотность и писать в самые популярные темы?

Два обстоятельства. Первое: частотность запроса перестала предсказывать трафик — заметная доля запросов закрывается ответом прямо в выдаче, до перехода на сайт. Второе замерено: стратегия «что растёт, то и будет расти» даёт на 3,8 млн решений подъём 0,93 и 0,95, то есть работает хуже случайного выбора. Популярность прошлой недели — не то же самое, что спрос следующего квартала.

Как проверяли, что расчёт не подглядывает в будущее?

Двумя опытами, объявленными до прогона. В первом исходы перемешивались внутри каждой точки решения: связь обязана исчезнуть, и подъём упал ровно до 1,00. Во втором точка исхода сдвигалась на 12 недель при тех же признаках: результат обязан измениться, и он изменился — 1,00 и 0,97. Признаки в каждой точке считаются строго по неделям до неё, ни одна неделя после точки в них не входит.

Почему одна и та же метрика даёт разные числа в разных отчётах?

Потому что она посчитана на разных популяциях, и это не ошибка, а свойство устройства. Реестр — все фразы словаря, включая ни разу не измеренные; витрина — только фразы с измеренным рядом; очередь — разность между ними. На 17.08.2026 в реестре 152 218 фраз, а измерено 82 560: витрина вдвое меньше, поэтому «носитель есть» и «ниша живая» — два разных числа. Метрика без названной популяции в проекте недействительна: за двое суток ярлык дважды прочитали не тем, чем он был, и каждый раз это стоило дня.

Что происходит с собранными данными, пока проект стоит?

Ничего — и это цель остановки. Снимки неизменяемы по построению, база из них пересобирается бесплатно, поэтому пауза не портит ни одной строки. Невосполнимое лежит в двух местах: 2,6 ГБ на сервере и 977 МБ сырых снимков в копии на локальной машине, контрольные суммы распакованных потоков сверены. Чекпоинт сборщика, реестр загруженных снимков и журнал измеренного паузу переживают: после возобновления сбор продолжится с того места, где остановился, без ручной доводки.

Сколько стоит анализ ниши?

Себестоимость расчёта — 0 ₽: недельную статистику Вордстат отдаёт по бесплатной квоте, платных моделей в расчёте нет вовсе. По рынку та же работа стоит 67 000 ₽ в месяц — столько стоит SEO-специалист по вакансиям hh.ru. За эти ноль рублей измерено 82 560 фраз, а в последней сборке витрины 17.08.2026 — 9 722 ниши.

Как найти свободную нишу?

Свободная ниша — это разрыв: спрос на тему есть, а материалов по ней написано мало. Платформа сводит недельную историю запросов Вордстата с числом уже опубликованных материалов Дзена и ставит нише вердикт по трём величинам: спрос, индекс концентрации и доля лидера. Ниша с неизмеренным спросом помечается «молчит». В последней сборке витрины 17.08.2026 спрос измерен у 3 011 ниш из 9 722.

Как проверить спрос на тему?

Спрос проверяют по недельной истории показов: средние показы за последние 8 недель сравнивают с предыдущими 8, и рост не меньше 20% считается сигналом. На истории это проверено на 3 820 805 решений: среди помеченных фраз спрос дальше вырастал больше чем на 10% в 1,38 раза чаще, чем в среднем по выборке. Это перевес, а не гарантия — из 65 точек решения подъём выше единицы в 43.

Источники
  1. Hirschman A. O. National Power and the Structure of Foreign Trade. University of California Press, 1945 — индекс концентрации.
  2. Herfindahl O. C. Concentration in the Steel Industry. Columbia University, 1950 — индекс концентрации.
  3. Cho J., Garcia-Molina H. Effective Page Refresh Policies for Web Crawlers. ACM Transactions on Database Systems, 28(4), 2003 — теоремы 5.1–5.2. doi:10.1145/958942.958945
  4. Nosek B. A., Ebersole C. R., DeHaven A. C., Mellor D. T. The preregistration revolution. PNAS, 115(11), 2018. doi:10.1073/pnas.1708274114
  5. Fisher R. A. The Design of Experiments. Oliver & Boyd, 1935 — permutation test.
  6. Pardo R. Design, Testing and Optimization of Trading Systems. Wiley, 1992 — walk-forward validation.
  7. Simpson E. H. The Interpretation of Interaction in Contingency Tables. Journal of the Royal Statistical Society B, 13(2), 1951 — парадокс Симпсона.
  8. Tversky A., Kahneman D. Belief in the law of small numbers. Psychological Bulletin, 76(2), 1971. doi:10.1037/h0031322
  9. Reyna V. F., Brainerd C. J. Numeracy, ratio bias, and denominator neglect in judgments of risk and probability. Learning and Individual Differences, 18(1), 2008. doi:10.1016/j.lindif.2007.03.011
  10. Popper K. Logik der Forschung. Springer, 1934 — фальсифицируемость.
  11. Nygard M. Documenting Architecture Decisions, 2011. cognitect.com
  12. Databricks. What is a medallion architecture? databricks.com

Нужна такая же система?

Напишите в Telegram: отвечу сам, разберу вашу задачу и скажу, что из этого ей подходит.

Написать в Telegram
Другие проекты лаборатории
наверх