Уникальность текста: почему сервисы проверки врут, и на что поисковики смотрят вместо процентов
На дворе уже ИИ-революция вовсю, а сервисы аналитики своих алгоритмов до сих пор не поменяли. Классическая сцена из практики копирайтера: написал текст, проверил в Text.ru – 100%. Отправил заказчику. Тот проверяет в Advego – 71%. Работа не принята, деньги не выплачены, репутация подорвана. Автор в ярости: «Я писал сам, ничего не копировал, откуда 71%?!» А ответ простой: никакого «объективного процента уникальности» не существует. Есть алгоритмы разных сервисов, считающие по разным правилам. И то, что один из них называет «100%», другой может назвать «71%» – для одного и того же текста, проверенного с разницей в минуту.
Парадокс усугубляется тем, что поисковики – Яндекс и Google – не используют ни один из этих сервисов. У них свои алгоритмы оценки контента, которые давно вышли за пределы подсчёта совпадений по шинглам. И текст со 100% технической уникальностью может ранжироваться хуже, чем текст с 85% – если второй семантически глубже и полезнее для читателя. Эта статья – о том, как на самом деле работают сервисы проверки, почему они дают разные результаты, и что реально важно для поисковиков вместо процента уникальности.
Как работают сервисы проверки: два алгоритма, которые дают разные цифры для одного текста
Все популярные сервисы – Text.ru, Advego, Content-Watch, eTXT Антиплагиат – используют вариации двух базовых алгоритмов. Понимание разницы между ними объясняет, почему ваш текст получает 100% в одном сервисе и 70% в другом.
Шингловый алгоритм: текст режут на «кирпичики» и ищут совпадения
Самый старый и самый распространённый метод. Текст разбивается на шинглы – последовательности из N слов подряд. Обычно N = 3 или 5. Сервис берёт каждый шингл, отправляет его в поисковик и проверяет: встречается ли такая последовательность на других сайтах.
Например, предложение «чугунная ванна Roca отличается долговечностью и прочностью» при шингле в 3 слова превратится в набор: «чугунная ванна Roca», «ванна Roca отличается», «Roca отличается долговечностью», «отличается долговечностью и», «долговечностью и прочностью». Если хотя бы один из этих шинглов найден на другом сайте – фрагмент считается неуникальным.
Проблема метода: чем короче шингл, тем больше ложных совпадений. При шингле в 3 слова фраза «в этой статье мы» будет найдена на миллионах сайтов и снизит уникальность, хотя это стандартный языковой оборот, а не плагиат. При шингле в 5-6 слов сервис может пропустить реально скопированный фрагмент, если мошенник переставил пару слов местами.
Text.ru использует шинглы переменной длины с дополнительными эвристиками. Advego Plagiatus – классический шингловый алгоритм с настраиваемым размером шингла. Content-Watch добавляет к шинглам «корреляционный» анализ.
Корреляционный алгоритм: «я не знаю, скопировали вы или нет, но выглядит подозрительно»
Более новый подход. Вместо поиска точных совпадений сервис анализирует статистические закономерности: частоту слов, их взаимное расположение, структуру предложений. Если текст статистически похож на уже существующий – он считается неуникальным, даже если дословных совпадений нет.
Проблема метода: два эксперта, пишущих на одну тему, неизбежно используют похожие термины и конструкции. Корреляционный алгоритм может пометить такой текст как «подозрительный», хотя это независимая работа. Особенно страдают технические и юридические тексты, где терминология жёстко задана – «договор купли-продажи недвижимости» не перепишешь другими словами.
Именно поэтому Text.ru часто показывает 100% там, где Advego выдаёт 80% – они используют разные комбинации алгоритмов с разными настройками. Advego более «подозрительный» к техническим и SEO-текстам, Text.ru – более лояльный к художественным. Но оба сервиса не имеют отношения к тому, как поисковики оценивают качество контента.
Почему 100% уникальность – это подозрительный сигнал, а не признак качества
Представьте: вы ищете статью про «как выбрать беговые кроссовки». Открываете топ-3. В каждой статье есть фразы: «поддержка свода стопы», «амортизация», «размерная сетка», «пронация». Это профессиональная терминология. Без неё текст про кроссовки – не экспертный, а дилетантский.
Теперь представьте текст про кроссовки с уникальностью 100% по Text.ru. Что произошло? Автор намеренно избегал любой устоявшейся терминологии, заменяя «пронацию» на «наклон стопы внутрь при беге», а «амортизацию» на «смягчение удара при соприкосновении с поверхностью». С точки зрения сервиса – идеально. С точки зрения эксперта – текст написан дилетантом, который не владеет темой.
Поисковик, анализируя LSI-слова (латентно-семантические связи), видит: у всех топовых статей про кроссовки есть «пронация», «амортизация», «поддержка свода стопы». У вашей статьи их нет. Вывод поисковика: «этот текст менее релевантен теме, чем тексты конкурентов». Результат: 100% уникальность, но позиция ниже, чем у текста с 80%.
Ключевой парадокс: техническая уникальность и семантическая полнота – это конкурирующие параметры. Чем выше одна, тем ниже другая. Гонясь за 100%, вы жертвуете LSI-словами, терминами и устоявшимися оборотами – ровно тем, что поисковик использует для определения релевантности текста запросу.
Техническая и смысловая уникальность: два параметра, которые путают даже SEO-специалисты
Сервисы проверки измеряют техническую уникальность – процент текста, который не встречается в такой же последовательности слов на других сайтах. Поисковики оценивают смысловую уникальность – насколько текст содержит новую, оригинальную информацию, которой нет у конкурентов. Это принципиально разные вещи.
Технически уникальный, но смыслово пустой текст: рерайт статьи конкурента с заменой каждого третьего слова на синоним. Text.ru показывает 100%, но полезной информации в тексте ноль – она уже есть у конкурента, просто другими словами. Поисковик видит: «смысловой вектор совпадает с существующей статьёй, ничего нового». Позиции не растут.
Технически «средний», но смыслово уникальный текст: статья содержит данные собственного исследования, личный опыт автора, уникальные примеры, цифры из внутренней аналитики компании. Техническая уникальность – 85% (потому что используются стандартные термины и обороты). Но для поисковика это ценный, оригинальный контент, которого нет ни у кого. Позиции растут.
Реальный пример из моей практики: интернет-магазин сантехники заказал рерайт карточки товара. Копирайтер переписал текст, добился 100% уникальности по Text.ru – заменил «чугунную ванну» на «ванну из чугуна», «эмалевое покрытие» на «стекловидный защитный слой». Текст стал технически уникальным, но – нечитаемым и комичным. Месяц в индексе – ноль заказов с этой карточки. Параллельно другая карточка с уникальностью 87% (авторский обзор с реальными фото и видео) вышла в топ-5 Яндекса по запросу «чугунная ванна купить» и принесла 12 заказов за тот же месяц. Разница – не в процентах, а в смысловой ценности.
Методология DSSO (Deep Semantic Search Optimization) решает именно эту проблему: она оценивает не формальный процент совпадений, а семантическую глубину – насколько полно текст раскрывает тему относительно всего корпуса знаний по данному запросу. Вместо вопроса «уникален ли этот текст технически» DSSO задаёт вопрос «закрывает ли этот текст потребность пользователя лучше, чем любая другая страница в интернете».
Нейросети и уникальность: почему технические 100% от ChatGPT больше не работают
В 2026 году добавился новый фактор, который окончательно обесценил техническую уникальность как метрику. Нейросети – ChatGPT, Claude, DeepSeek – генерируют текст, который технически уникален на 99-100%. Ни один шингл не совпадает с другими текстами в интернете. Но проблема в том, что миллионы пользователей задают нейросети одни и те же вопросы. И получают семантически идентичные ответы.
Проведите эксперимент: попросите ChatGPT написать статью на тему «как выбрать беговые кроссовки». Попросите коллегу сделать то же самое с другого аккаунта. Сравните два текста. С точки зрения сервисов проверки – оба уникальны на 100%. С точки зрения поисковика – два текста с практически идентичным семантическим вектором. Одинаковая структура, одинаковый набор тем, одинаковые выводы. Разница только в формулировках.
Именно поэтому Google в своих рекомендациях по созданию полезного контента всё больше акцентирует не уникальность, а «добавочную ценность» (value-add): что ваш текст даёт читателю такого, чего нет в других текстах по этой теме. Экспертный опыт, реальные данные, цифры из практики, авторскую позицию. Нейросеть этого дать не может – она компилирует уже существующее. Техническая уникальность есть, смысловой – нет. И поисковик это видит.
Для владельцев сайтов это означает простую вещь: текст, написанный ChatGPT без экспертной редактуры и без добавления уникальных данных, не будет ранжироваться высоко, даже если он на 100% технически уникален. Конкуренция по «смысловой глубине» пришла на смену конкуренции по «проценту шинглов».
Что на самом деле важно для поисковиков вместо процентов уникальности
Ни Яндекс, ни Google не используют сервисы вроде Text.ru или Advego для ранжирования. Их алгоритмы оценки контента работают на другом уровне. Яндекс.Вебмастер и Google Search Central в своих рекомендациях вообще не упоминают формальную уникальность как фактор качества. Вот что реально имеет значение:
- Семантическая полнота. Поисковик анализирует, насколько полно текст покрывает тему. Статья про «выбор велосипеда», в которой нет ни слова про размер колёс, типы тормозов и материал рамы – семантически неполна, даже если технически уникальна на 100%. Статья с 85% уникальности, но раскрывающая все аспекты – выигрывает.
- LSI-слова и n-граммы. Поисковик ожидает увидеть в тексте определённый набор связанных понятий. Для текста про SEO это «индексация», «сни́ппет», «ранжирование», «семантическое ядро». Если их нет – текст нерелевантен, даже если он «уникален».
- Поведенческие факторы. Если пользователь открыл ваш текст, провёл на странице 4 минуты, проскроллил до конца и перешёл на другую страницу сайта – поисковик делает вывод: «контент полезен». Если открыл и через 15 секунд ушёл обратно в поиск – «контент не соответствует запросу». И это решение принимается независимо от процента технической уникальности.
- E-E-A-T (опыт, экспертность, авторитет, доверие). Google оценивает, кто написал текст: эксперт с подтверждённой репутацией или анонимный копирайтер. Текст эксперта с 80% уникальности будет ранжироваться выше, чем текст анонима со 100% – потому что поисковик доверяет источнику.
- Добавочная ценность. Что ваш текст даёт пользователю такого, чего нет в текстах конкурентов? Уникальные данные, личный опыт, цифры из практики, сравнительные таблицы, видеообзоры, реальные фото – всё это поисковик оценивает выше, чем формальную уникальность.
Ни один из этих факторов не измеряется сервисами проверки уникальности. Text.ru не скажет вам, что текст семантически пуст. Advego не предупредит, что LSI-облако на 40% ýже, чем у конкурентов. И тем более ни один сервис не оценит поведенческие факторы, которые сложатся вокруг вашего текста после публикации.
Когда уникальность действительно важна – и когда её можно вообще не проверять
Из сказанного выше может сложиться ложное впечатление: «уникальность вообще не важна, можно копировать что угодно». Это не так. Техническая уникальность – гигиенический фактор. Она должна быть достаточной, чтобы текст не был копией. Но гнаться за 100% бессмысленно и вредно.
| Тип контента | Достаточная уникальность | Почему |
|---|---|---|
| Информационные статьи | 85-95% | Неизбежны совпадения в терминологии и общих оборотах. Главное – смысловая оригинальность, а не техническая. |
| SEO-тексты для продвижения | 90-98% | Ключевые слова создают повторяющиеся конструкции. Гнаться за 100% – значит калечить семантическое ядро ради формального показателя. |
| Карточки товаров | 70-85% | Технические характеристики повторяются у всех продавцов. Уникальность карточки – в фото, видеообзорах, реальных отзывах, а не в тексте. |
| Юридические и технические тексты | 60-80% | Терминология жёстко задана. Замена «расторжения договора» на «прекращение действия соглашения» не добавляет экспертности, а вредит. |
Когда уникальность КРИТИЧНА: тексты для блогов, информационные статьи, новости – контент, который должен приносить трафик из поиска. Здесь копирование чужих текстов напрямую вредит ранжированию, потому что поисковик видит дубль и не знает, какой из двух источников показывать.
Когда уникальность НЕ КРИТИЧНА: карточки товаров, страницы с техническими характеристиками, юридические документы, страницы контактов. Здесь важнее полнота информации и удобство пользователя, а не формальный процент совпадения шинглов.
Практический алгоритм: как проверить текст правильно, а не «по процентам»
- Проверьте текст в ОДНОМ сервисе. Не гоняйте один и тот же текст через Text.ru, Advego и Content-Watch – вы получите три разных цифры и потеряете время. Выберите один сервис (я рекомендую Text.ru как самый сбалансированный по соотношению «строгость / адекватность») и придерживайтесь его для всех проверок.
- Если уникальность ниже 85% – ищите конкретные фрагменты, помеченные как неуникальные. Не пытайтесь «поднять процент» абстрактно. Посмотрите, какие конкретно куски текста сервис считает заимствованными. Часто это цитаты, термины, названия законов – то, что и должно совпадать. Их не нужно «уникализировать».
- Если уникальность 85-95% – остановитесь. Этого достаточно для подавляющего большинства типов контента. Дальнейшая погоня за процентами – это замена терминов на неестественные синонимы, что ухудшит качество текста и его ранжирование.
- Вместо повторных проверок – проверьте семантическую глубину. Сравните ваш текст с текстами конкурентов из топа. Какие темы они закрывают, а вы пропустили? Какие LSI-слова есть у них, но нет у вас? Добавьте недостающие смысловые блоки – это даст больший прирост позиций, чем повышение уникальности с 92% до 100%.
- Если вы используете DSSO-методологию – уникальность вообще не должна быть главной метрикой. Индекс IRAT (индекс релевантной привлекательности текста) показывает семантическую глубину, а не формальную уникальность. Два текста с одинаковой уникальностью 95% могут иметь IRAT 60 и IRAT 95 – и второй будет ранжироваться кардинально лучше.
Часто задаваемые вопросы об уникальности текста
Почему Text.ru показывает 100%, а Advego – 71% для одного и того же текста?
Разные алгоритмы и разные поисковые базы. Text.ru использует шинглы переменной длины с эвристиками и собственную базу проиндексированных страниц. Advego Plagiatus – классический шингловый алгоритм с возможностью выбора размера шингла, сверяющийся с выдачей поисковиков. Один и тот же фрагмент может быть признан уникальным одним сервисом и заимствованным другим – и оба будут правы в рамках своей методологии. Для получения стабильных результатов выберите ОДИН сервис и используйте только его.
Может ли текст со 100% уникальностью попасть под фильтры поисковика?
Да, если уникальность достигнута за счёт замены терминов на неестественные синонимы. Поисковик видит: текст не совпадает ни с чем в интернете, но при этом не содержит ожидаемых LSI-слов и терминов, обычных для данной темы. Вывод: «автор намеренно исказил терминологию, чтобы обмануть алгоритм». Последствия: занижение позиций за нерелевантный контент. Техническая уникальность, достигнутая ценой семантической полноты – это вред, а не польза.
Копирует ли Яндекс тексты конкурентов и проверяет их на уникальность?
Формально – Яндекс не раскрывает детали алгоритмов оценки уникальности. Практически – известно, что Яндекс анализирует тексты не по шинглам, а по смысловым векторам и LSI-связям. Прямые копии чужих текстов (полный копипаст) Яндекс может детектировать и понижать. Но текст, написанный самостоятельно, даже с использованием общепринятой терминологии, не будет понижен только из-за того, что какие-то шинглы совпадают. Яндекс оценивает смысловую оригинальность, а не техническую уникальность.
Как уникальность текста влияет на позиции сайта в целом?
Уникальность конкретного текста влияет только на позиции конкретной страницы, на которой он размещён. Сайт в целом не получает штрафов за одну неуникальную страницу (кроме случаев массового копирования). Однако если на сайте систематически публикуются копии чужих материалов, это снижает общий авторитет домена и может привести к пессимизации всех страниц, включая уникальные. Одна техническая страница с 60% уникальности не разрушит сайт, но десять таких страниц подряд – уже сигнал для поисковика.
Что делать, если тема настолько узкая, что написать уникальный текст невозможно?
В узких нишах техническая уникальность объективно ниже – и это нормально. Вместо погони за процентами сфокусируйтесь на добавочной ценности: добавьте то, чего нет у конкурентов. Личный опыт, собственные фотографии, цифры из вашей практики, сравнение продуктов в таблицах, видеообзоры, ответы на вопросы клиентов – всё это создаёт смысловую уникальность, которую поисковик оценит выше, чем формальные проценты.
Проверка уникальности – полезный инструмент для обнаружения откровенного плагиата и контроля работы копирайтера. Но процент, который выдаёт сервис – это не оценка качества текста. Это оценка того, насколько последовательности слов в вашем тексте отличаются от последовательностей в поисковой базе сервиса. Не более. Поисковики ушли далеко вперёд – от подсчёта шинглов к анализу смысловых векторов, LSI-облаков и поведенческих факторов. И ваша стратегия работы с контентом должна уйти вместе с ними. Проверяйте уникальность как гигиенический минимум. Но оценивайте качество текста по семантической глубине и пользе для читателя. Именно это ранжирует поисковик.
