Guillaume Duvernay

Open source

astro-md-twins

Chaque page servie deux fois: HTML pour les humains, Markdown pour les machines.

Un template Astro. Il génère un site statique et, pour chaque page, un fichier Markdown au même chemin avec l'extension .md. Un Cloudflare Worker optionnel sert ce Markdown depuis l'URL de la page lorsqu'un client le demande via le header.

Rôle
Auteur
Année
2026
Stack
Astro, Cloudflare Workers

Le HTML est coûteux à lire pour une machine

Une page contient la navigation, le pied de page, des bannières, des scripts et des attributs de classe. Un crawler télécharge tout cela pour récupérer trois paragraphes. Cloudflare a mesuré un article de blog à 16 180 tokens en HTML contre 3 150 en Markdown, soit environ 80% de moins. Pour des pages e-commerce, la réduction peut atteindre 95%.

Les crawlers utilisent bel et bien le Markdown

Ces données proviennent de mes propres logs serveur pour la doc d'AI Glot, du 19 août au 14 septembre 2026, en comptant uniquement les bots vérifiés par Cloudflare pour ne faire confiance à aucun user agent. GoogleOther a récupéré 46,8% de ses documents en Markdown, GPTBot 42,7% et ClaudeBot 34,4%. Les chiffres varient selon le site, mais la tendance reste la même.

Comment éviter le contenu dupliqué

Chaque réponse Markdown contient un lien canonique vers sa page HTML, et aucun jumeau ne figure dans le sitemap. Une vérification au build échoue si une page n'a pas de jumeau, si le canonique est erroné, si le jumeau est vide ou si l'un d'eux s'est glissé dans le sitemap.

You are reading a site that does this

Add .md to any article URL here and you get the source instead of the page.

/fr/articles/harness-agnostic-workspaces.md

The same article, fetched two ways. The Markdown response carries a canonical link back to the HTML page, so the two never compete in search.

80%moins de tokens que la même page en HTML

46.8%des requêtes GoogleOther récupérées en .md

42.7%des requêtes GPTBot récupérées en .md