Очистка HTML-кода

Убирает из кода мусор офисных редакторов: служебные теги Word, инлайн-стили, классы, пустые теги и неразрывные пробелы.

Набор расставляет галочки ниже. Любую можно переключить вручную.

Код остаётся в браузере: на сервер он не уходит.

Текст, скопированный из Word или Google Docs, приносит с собой служебную разметку: теги вида <o:p>, классы MsoNormal, инлайн-стили на каждом абзаце, условные комментарии. Вёрстку это не улучшает, а вес страницы поднимает в три-четыре раза.

Отдельная беда — списки. Word отдаёт их не списком, а вереницей абзацев, и знак маркера кладёт прямо в текст. На сайте такой список теряет и отступ, и нумерацию, а перед каждым пунктом остаётся висеть точка.

Что убирается

  • служебная разметка Word: теги с двоеточием, атрибуты o: и v:, условные комментарии, знаки маркеров;
  • инлайн-стили, классы, идентификаторы, data-атрибуты;
  • пустые теги, в том числе те, где остался один неразрывный пробел;
  • устаревшие теги: <font>, <center>, <strike> — вместе с атрибутами оформления вроде align и bgcolor;
  • ссылки, картинки и таблицы, когда нужен только текст.

Абзацы-пункты после Word собираются обратно в <ul> или <ol>: вид списка определяется по знаку маркера.

Теги <script>, обработчики onclick и ссылки вида javascript: удаляются независимо от галочек. Чужой код чаще всего чистят перед тем, как положить к себе на сайт, и активная часть в нём не нужна.

Другие инструменты