Закон Ципфа: Норма естественной речи
Если вы возьмете любой достаточно длинный текст и посчитаете, сколько раз в нем встречается каждое слово (сумма всех словоформ), вы обнаружите интересную вещь: распределение слов не будет случайным. Оно подчиняется строгому правилу, которое в 1935 году популяризировал лингвист Джордж Ципф.
Закон Ципфа простыми словами
Представьте себе очередь слов, где они выстроены по популярности (рангу). Закон Ципфа по-простому звучит так: частота использования слова в естественной речи обратно пропорциональна его порядковому номеру в этом списке.
Математически это выглядит так:
Где:
F – частота появления слова в тексте;
C – константа (количество раз), зависящая от самого частотного слова.
R – ранг слова (наиболее часто употребляемое слово получает ранг 1, следующее – 2 и т. д.);
Что это значит данный закон на практике? Если самое частое слово (исключая предлоги, союзы и т. д.) встретилось 100 раз, то второе по популярности встретится примерно 50 раз (100/2), третье – 33 раза (100/3), а десятое – всего 10 раз.
Экспонента Ципфа: что значит показатель s
В формуле F = C / Rs показатель s (экспонента) имеет критическое значение для оценки текста. Он показывает, насколько «круто» падает частота слов от ранга к рангу.
- s ≈ 1,0 – классическое распределение Ципфа. Свойственно большинству естественных текстов среднего объёма. Хороший ориентир для SEO.
- s > 1,2–1,5 – слишком крутой спад. Означает, что автор использует очень мало уникальных слов, постоянно повторяя одни и те же. Типично для низкокачественного рерайта или ИИ-текстов без редактуры.
- s < 0,8 – слишком пологий спад. Частоты слов выравниваются, текст начинает напоминать «кашу» из равномерно распределённых терминов. Бывает при искусственном разбавлении текста синонимами или при генерации случайных последовательностей.
Показатель s связан с энтропией текста – мерой его лексического разнообразия. Чем выше энтропия, тем больше разных слов использует автор. Но высокая энтропия не всегда хорошо: если текст состоит из уникальных слов, каждое из которых встречается 1-2 раза, он теряет тематическую плотность. Баланс между энтропией и частотностью ключевых слов – задача, которую решает семантический анализ.
👉 Проверить экспоненту s своего текста и построить график Ципфа можно через анализатор ключевых слов DSSO – он автоматически рассчитывает показатель IRAT и показывает отклонения от идеальной кривой.
График Ципфа: как выглядит здоровый текст
Самое наглядное представление закона Ципфа – график. По оси X откладывается ранг слова (от 1 до N), по оси Y – частота его употребления в логарифмическом масштабе. В «здоровом» тексте точки ложатся на прямую линию с наклоном около -1.
Вот как выглядят разные ситуации:
- Идеальный график – все слова плавно убывают по частоте. Самое частое (предлоги, союзы, стоп-слова в SEO-аналитике должны игнорироваться и удаляться автоматически при тесте) встречается в ~2 раза чаще второго, в ~3 раза чаще третьего и так далее. Линия на логарифмическом графике – прямая. Это естественная речь.
- Горб в середине – если какое-то слово или фраза повторяются аномально часто (например, «купить диван Москва» 40 раз), на графике появляется «горб» – точка, которая резко выбивается вверх относительно соседних рангов. Поисковик видит это как переоптимизацию.
- Плоская линия – если автор использует ограниченный набор слов, постоянно повторяя одни и те же лексемы, график становится слишком пологим. Это признак бедного словарного запаса или ленивого рерайта.
- Резкий обрыв – после 5-10 самых частых слов частота резко падает почти до нуля. Значит, автор использовал только базовую лексику и не вводил термины, синонимы, LSI-дополнения. Такой текст Яндекс посчитает малоценным и неэкспертным.
В методе DSSO мы смотрим на двух графиках (начальные словоформы и оригинальные) именно на форму кривой. Если линия плавная, без изломов – текст естественный. Если виден «зуб» в районе ключевых словоформ, значит, нужна редактура или контент – технически-инструктивный.
Закон Ципфа в лингвистике
В классической лингвистике этот закон подтверждается на всех живых языках. Он отражает принцип «наименьшего усилия»: мы гармонично используем естественный набор обычных разговорных словоформ и ограниченный коротких форм (предлоги, союзы), а специфические, сложные термины – крайне редко.
Закон Ципфа в лингвистике позволяет отличить нормальную человеческую речь от абракадабры. Если вы случайным образом наберете текст из букв, он не будет подчиняться этому закону. Если же вы напишете осмысленную статью – график будет стремиться к идеальной гиперболе.
Качество контента по закону Ципфа и SEO
Для современного SEO этот закон стал настоящим спасением. Когда оптимизаторы начали злоупотреблять ключевиками, поисковые роботы научились проверять качество написанного по закону Ципфа.
Переоптимизация (Спам): Если вы 50 раз вставили фразу «купить стулья» в короткую статью, она выбьется из графика. Частота «ключевика» станет аномально высокой по сравнению с естественными словами-связками. Поисковик поймет: это написано не для людей, а для роботов.
Скудный лексикон: Если график слишком «плоский», это значит, что автор использует одни и те же словоформы, не разбавляя их синонимами, LSI-формами или подходящими по смыслу фразами.
Именно поэтому в методе DSSO классический и модернизированный графики Ципфа являются ключевыми инструментами анализа. Они показывают «здоровье» текста: насколько он естественен и безопасен для продвижения. Естественный текст по закону Ципфа простыми словами – тот, который нравится и алгоритмам, и живым читателям.
Закон Ципфа и нейросети: как ИИ пишет, отличаясь от человека
В 2026 году, когда значительная часть контента создаётся с помощью нейросетей, закон Ципфа приобрёл новое значение. Дело в том, что чистый AI-контент (без редактуры) имеет характерные отличия в распределении частот слов, которые видны на графике Ципфа.
Чем ИИ-текст отличается от человеческого:
- Слишком ровная кривая. Нейросеть, обученная на миллионах текстов, «знает» закон Ципфа и старается ему соответствовать. Но она делает это слишком точно – график получается идеально гладким, почти без шероховатостей. Человек пишет менее предсказуемо: где-то повторяет слово чаще, где-то реже, создавая естественные флуктуации.
- Однородность по абзацам. В человеческом тексте разные разделы могут иметь разную лексическую плотность. Во введении – одни слова, в технической части – другие. Нейросеть же распределяет лексику равномерно по всему тексту, что видно на графике как отсутствие «ступенек».
- Низкая вариативность редких слов. AI использует меньше редких и специфических терминов. График в хвосте (ранги 50+) у нейросети обрывается быстрее, чем у человека-эксперта, который вводит профессиональные термины.
Важный нюанс: хороший AI-SEO-копирайтинг (когда человек редактирует сгенерированный черновик) всё это нивелирует. График отредактированного текста максимально приближается к «живому».
Закон Ципфа-Мандельброта
Математик Бенуа Мандельброт (отец фракталов) позже уточнил формулу закона Ципфа, сделав её более гибкой и пластичной для короткого контента и специфических ниш. Корректирующий закон Ципфа-Мандельброта добавляет дополнительные параметры, которые учитывают «индивидуальный почерк» разных языков и сложность темы.
Формула стала выглядеть так:
Где:
a – коэффициент, характеризующий богатство словарного запаса. Чем больше значение a, тем богаче лексическое разнообразие в авторском тексте.
Это уточнение позволяет анализировать не только огромные библиотеки, но и небольшие статьи, сохраняя высокую точность оценки качества оптимизации.
Бенуа Мандельброт пояснил закон Ципфа с точки зрения, что язык – это механизм общения, в ходе чего работают строгие закономерности, справедливые как для разговорной речи, так для других вариантов связи. В момент передачи информации при увеличение числа слов происходит увеличение времени коммуникации, но также при этом уменьшается вероятность появления возможных ошибок.
Но эта зависимость работает также и обратно. Компромисс между этими противоречивыми требованиями приводит к тому, что чаще всего употребляются более короткие слова.
Важно: закон Ципфа-Мандельброта хорошо согласуется с показателями литературных произведений с чёткой сюжетной линией.
Практическая проверка текста по закону Ципфа
Чтобы оценить свой текст, не обязательно быть математиком. Вот простой алгоритм из пяти шагов:
- Возьмите финальную версию текста – чистовую (без HTML) со всеми заголовками. И если есть поле для ввода, то вставляйте, если проверка идёт через URL, тогда используйте адрес страницы. На нашем сервисе аналитики можно двумя вариантами сделать проверку на Ципфа.
- Проверьте объём. Закон Ципфа работает корректно на текстах от 2000–3000 знаков. На коротких текстах (до 1000 знаков) график будет неточным из-за малой выборки.
- Посмотрите на самое частое слово. Если это не предлог, союз или частица (в, на, и, не, что), а знаменательное слово – есть повод проверить, не переспамлен ли текст по этому слову. Особенно если это ваше ключевое слово. Наш сервис глубокого анализа, строя графики Ципфа (их два), не учитывает предлоги, союзы, стоп-слова и частицы.
- Оцените плотность топ-5 слов. В естественной речи разница между первым, вторым, третьим и т.д. по частоте словом – примерно 2x и 3x и по аналогии. Если второе слово встречается почти так же часто, как первое, – это аномалия. Значит, в написанном имеются два конкурирующих «центра тяжести». Но всё зависит от темы статьи и контекста, когда такое можно считать нормой.
- Проверьте хвост распределения. Слова с рангом 30+ должны встречаться примерно 1-3 раза. Если после 20-го слова все вхождения равны чётко 1, тогда текст лексически бедноват, но это не смертельно. Например, для инструкций и технических текстов такое принимается за норму.
Нормы естественности по закону Ципфа (по данным разных сервисов):
- 50–70% – приемлемый уровень для SEO-текстов
- 70–85% – хороший уровень (текст близок к естественной речи)
- 85–100% – отличный уровень (но встречается редко, в основном у профессиональных авторов)
- Ниже 50% – стоит доработать текст, разбавить синонимами и LSI-словами
Однако помните: 100% естественности не гарантирует топ. Закон Ципфа – лишь один из сигналов. Важнее – смысловая плотность, соответствие интенту и E-E-A-T. Именно поэтому метод DSSO использует Ципфа в комбинации с анализом биграмм, триграмм и расчётом индекса IRAT.
👉 Проанализируйте свой текст бесплатно – получите график Ципфа, экспоненту s и рекомендации по улучшению.
Типичные заблуждения о законе Ципфа
Насмотревшись на ТЗ с бирж копирайтинга, многие считают закон Ципфа панацеей. На самом деле:
- Миф 1: «Идеальное соответствие Ципфу гарантирует топ». Нет. Это лишь проверка естественности, а не релевантности. Текст может идеально соответствовать Ципфу, но не отвечать на запрос пользователя.
- Миф 2: «Процент естественности должен быть 100%». Скорее наоборот: подозрительно идеальный график – признак того, что текст «подогнан» под Ципфа искусственно или сгенерирован нейросетью. Или, как вариант, имеем качественный нарратив на какую-то тему, а не обо всём сразу.
- Миф 3: «Закон Ципфа устарел, Яндекс его больше не использует». Неправда. Алгоритм YATI и его преемники учитывают распределение n-грамм, а это прямая производная от закона Ципфа. Просто теперь к анализу частот добавился семантический анализ.
- Миф 4: «Достаточно проверить текст в любом онлайн-сервисе – и готово». Разные сервисы считают по-разному: одни учитывают стоп-слова и союзы, другие нет; одни лемматизируют, другие считают по начальным словоформам. Но если обобщить все данные на 2026 и учесть современную высокую адекватику поисковых нейро-сетей, то оптимальнее будет учитывать только значимые слова.
- Миф 5: «Если текст соответствует Ципфу, он написан человеком, а не нейросетью». Нет. Хороший AI-копирайтинг с редактурой даёт график, неотличимый от человеческого. Ципф – лишь один из сигналов, а не детектор ИИ.
Вывод: закон Ципфа – важный, но не единственный критерий. Используйте его в связке с семантическим анализом, проверкой интента и оценкой поведенческих факторов.
Закон Ципфа – это не просто сухая теория. Это золотой стандарт качества контента. Если ваш текст «укладывается» в график, значит, вы соблюли баланс между ключевыми словами и нормами естественной речи.
В рамках анализа по методу DSSO мы всегда смотрим на этот график: если линия плавная – всё отлично. Если на ней видны резкие «горбы», особенно в районе ключевых словоформ, – текст, возможно, пора лечить от переспама или просто приводить к нормам естественной речи.
