IT Market
Инструменты/Код/Данные/Декодер HTML-сущностей в обычный текст онлайн
HTML Entities

Кодирование и декодирование HTML-сущностей

Коротко об инструменте

Декодер HTML-сущностей в обычный текст онлайн

Когда текст проходит через CMS, выгрузку из базы или чужой API, кавычки и кириллица нередко приезжают в виде ", П и  . Читать такое невозможно, а вставлять в документ тем более. Страница пропускает фрагмент через штатный разбор браузера и возвращает нормальные символы: числовые коды становятся буквами, неразрывный пробел — пробелом. Всё считается в открытой вкладке. Смотрите также: экранировать спецсимволы в HTML-сущности, убрать теги и оставить чистый текст, перевести готовую вёрстку в Markdown.

Как пользоваться

  1. Вставьте фрагмент с последовательностями вида &, " или П в поле «Текст».
  2. Нажмите кнопку «Декодировать» — на этой же странице есть и обратная кнопка «Закодировать», не перепутайте их.
  3. Прочитайте расшифровку в поле «Результат» и убедитесь, что кириллица встала на место.
  4. Нажмите «Копировать», чтобы забрать чистый текст в буфер обмена.
  5. Если часть сущностей осталась, декодируйте результат ещё раз: данные бывают экранированы дважды.

Вопросы и ответы

Почему после декодирования остались сущности вида "?

Значит, текст экранировали дважды: сначала кавычку превратили в ", а потом сам амперсанд — в &. Один проход снимает только верхний слой. Прогоните полученный результат через кнопку «Декодировать» ещё раз, и со второй попытки строка станет читаемой. Такое часто случается с полями, которые прошли и через шаблонизатор, и через API.

Как убрать   из текста, скопированного с сайта?

После декодирования на месте   окажется неразрывный пробел — визуально он неотличим от обычного, но переносы строк ведут себя иначе, а поиск по обычному пробелу его не находит. Если он мешает, замените такие пробелы в редакторе через поиск с регулярным выражением по символу U+00A0 после того, как заберёте результат кнопкой «Копировать».

Поддерживаются ли числовые коды кириллицы и эмодзи?

Да. Разбор ведёт сам браузер, поэтому понимаются и десятичные ссылки вроде П, и шестнадцатеричные вида П, и именованные сущности из спецификации HTML5. Эмодзи, записанные суррогатной парой числовых кодов, тоже собираются обратно в один символ.

Можно ли декодировать целую HTML-страницу?

Небольшие фрагменты и отдельные поля обрабатываются мгновенно. Очень длинный документ, вставленный целиком, заметно подтормаживает вкладку, потому что весь текст лежит в одном поле. Разбейте такой файл на части по несколько тысяч строк — так и результат проще проверить глазами.

Чем этот инструмент отличается от декодера URL?

Здесь снимается экранирование HTML — именованные и числовые сущности, которые начинаются с амперсанда. Последовательности вида %D0%9F из адресной строки к HTML отношения не имеют, для них нужен отдельный декодер URL. Если в строке встречаются оба вида кодирования, сначала снимите процентное, а затем HTML-экранирование.

Куда попадает вставленный текст?

Он остаётся в поле ввода открытой вкладки. Расшифровка выполняется скриптом страницы, отправки данных на сервер в этом сценарии нет, история ввода нигде не сохраняется. Обновление страницы очищает оба поля, поэтому забирайте результат кнопкой «Копировать» до перезагрузки.

Примеры

Заголовок новости из выгрузки базы
До: <p>Компания "Вектор" & партнёры</p>
После: Компания "Вектор" & партнёры
Кириллица в числовых кодах
До: Привет
После: Привет