# ============================================================ # robots.txt — Politique IA & moteurs de recherche # Site : https://www.halles.be # Public : Belgique (FR / NL / EN) # Dernière mise à jour : 2026-08-07 # ============================================================ # ------------------------------------------------------------ # Sitemap # ------------------------------------------------------------ Sitemap: https://www.halles.be/sitemap_index.xml # ============================================================ # BLOQUÉS — Crawlers IA jugés néfastes pour les ressources # (entraînement massif sans contrepartie de visibilité, # non-respect fréquent du robots.txt, agressivité du crawl) # ============================================================ # ByteDance / TikTok — crawl d'entraînement très agressif, # respect partiel du robots.txt, peu de trafic entrant en BE User-agent: Bytespider Disallow: / # Meta / Facebook — entraînement de modèles (LLaMA), # rapports de crawl massif quasi-DDoS, pas de retour de trafic User-agent: Meta-ExternalAgent Disallow: / # Meta — fetcher externe (souvent confondu avec des scrapers) User-agent: Meta-ExternalFetcher Disallow: / # Amazon — entraînement Alexa/Kendra, crawl intensif User-agent: Amazonbot Disallow: / # Amazon — Kendra (autre agent d'indexation Amazon) User-agent: amazon-kendra- Disallow: / # Common Crawl — dataset public servant à entraîner de nombreux # modèles ; aucune visibilité en retour pour le site source User-agent: CCBot Disallow: / # Apple — entraînement IA (Apple Intelligence / GPT interne), # à distinguer d'Applebot (recherche) qui reste autorisé ci-dessous User-agent: Applebot-Extended Disallow: / # Huawei / Petal Search — peu pertinent pour l'audience belge, # crawl consommateur de ressources User-agent: PetalBot Disallow: / # Google — autres agents d'entraînement/expérimentation # (à ne pas confondre avec Googlebot ni Google-Extended) User-agent: GoogleOther Disallow: / # Google Vertex AI — entraînement de modèles via Google Cloud User-agent: CloudVertexBot Disallow: / # Moonshot / Kimi — modèle chinois, pas de pertinence pour BE User-agent: KimiBot Disallow: / # NTT — crawler académique japonais, gros consommateur User-agent: ICC-Crawler Disallow: / # Cotoyogi — crawler opaque, usage non documenté publiquement User-agent: Cotoyogi Disallow: / # Cloudflare Browser Rendering — crawl de rendu automatisé User-agent: CloudflareBrowserRenderingCrawler/1.0 Disallow: / # Opaque AI / scrapers non identifiés connus User-agent: Diffbot Disallow: / User-agent: ImagesiftBot Disallow: / User-agent: Omgilibot Disallow: / User-agent: Omgili Disallow: / User-agent: YouBot Disallow: / # ============================================================ # AUTORISÉS — Bots IA utiles (visibilité & recherche) # Ces bots génèrent du trafic et des citations vers le site # ============================================================ # --- Moteurs de recherche classiques (indispensables BE) --- # Googlebot — moteur dominant en Belgique User-agent: Googlebot Allow: / Disallow: /admin/ # Google-Extended — autorisé : contrôle l'usage par Gemini # (réponses IA Google). Bloquer peut réduire la présence dans # Google AI Overviews et Discover. Recommandé d'autoriser. User-agent: Google-Extended Allow: / Disallow: /admin/ # Bingbot — moteur Microsoft, part de marché significative en BE User-agent: Bingbot Allow: / Disallow: /admin/ # Applebot — Siri, Spotlight, Apple Search (intégré à Safari/iOS) User-agent: Applebot Allow: / Disallow: /admin/ # DuckAssistBot — DuckDuckGo (présence européenne non négligeable) User-agent: DuckAssistBot Allow: / Disallow: /admin/ # --- OpenAI / ChatGPT --- # GPTBot — entraînement des modèles GPT # Autorisé : le contenu apparaît dans les réponses ChatGPT, # générant du trafic de citation (87% du trafic IA vient de ChatGPT) User-agent: GPTBot Allow: / Disallow: /admin/ # OAI-SearchBot — index pour la recherche ChatGPT (SearchGPT) User-agent: OAI-SearchBot Allow: / Disallow: /admin/ # ChatGPT-User — fetch déclenché par un utilisateur dans ChatGPT User-agent: ChatGPT-User Allow: / Disallow: /admin/ # --- Anthropic / Claude --- # ClaudeBot — entraînement & indexation Claude User-agent: ClaudeBot Allow: / Disallow: /admin/ # anthropic-ai — autre agent d'entraînement Anthropic User-agent: anthropic-ai Allow: / Disallow: /admin/ # Claude-SearchBot — recherche/citation dans Claude User-agent: Claude-SearchBot Allow: / Disallow: /admin/ # Claude-User — fetch utilisateur déclenché dans Claude User-agent: Claude-User Allow: / Disallow: /admin/ # --- Perplexity --- # PerplexityBot — index de recherche IA User-agent: PerplexityBot Allow: / Disallow: /admin/ # Perplexity-User — fetch à la demande utilisateur User-agent: Perplexity-User Allow: / Disallow: /admin/ # --- Mistral AI (entreprise française, pertinence UE) --- # MistralAI-User — fetch utilisateur dans Le Chat User-agent: MistralAI-User Allow: / Disallow: /admin/ # ============================================================ # Règle par défaut — tout le reste autorisé # (moteurs mineurs, bots légitimes non listés) # Pour verrouiller davantage : remplacer Allow par Disallow: / # ============================================================ User-agent: * Allow: / Disallow: /admin/