# # robots.txt [ MallorcaInforma.es ] # User-Agent: * Disallow: /cgi-bin Disallow: /wp-admin Disallow: /wp-includes Disallow: /wp-content/plugins Disallow: /wp-content/cache Disallow: /wp-content/themes Disallow: /trackback Disallow: /comments Disallow: */trackback Disallow: */comments Disallow: /*?* Disallow: /*? Allow: /wp-content/uploads Allow: /category/*/* # Google Image User-Agent: Googlebot-Image Disallow: Allow: /* # Google AdSense User-Agent: Mediapartners-Google* Disallow: Allow: /* # Internet Archiver Wayback Machine User-Agent: ia_archiver Disallow: / # digg mirror User-Agent: diggmirror Disallow: / # Tambien podemos desindexar todo lo que empiece # por wp-. Es lo mismo que los Disallow de arriba pero # incluye cosas como wp-rss.php Disallow: /wp- # # Sitemap permitido, busquedas no. # # Sitemap: http://www.mallorcainforma.es/sitemap.xml.gz # Disallow: /?s= # Disallow: /search # # Permitimos el feed general para Google Blogsearch. # # Impedimos que permalink/feed/ sea indexado # # Lo mismo con URLs terminadas en /trackback/ que solo # sirven como Trackback URI (y son contenido duplicado). # Allow: /feed/$ Disallow: /feed Disallow: /comments/feed Disallow: /*/feed/$ Disallow: /*/feed/rss/$ Disallow: /*/trackback/$ Disallow: /*/*/feed/$ Disallow: /*/*/feed/rss/$ Disallow: /*/*/trackback/$ Disallow: /*/*/*/feed/$ Disallow: /*/*/*/feed/rss/$ Disallow: /*/*/*/trackback/$ # # Lista de bots que suelen respetar el robots.txt # User-Agent: MSIECrawler Disallow: / User-Agent: WebCopier Disallow: / User-Agent: HTTrack Disallow: / User-Agent: Microsoft.URL.Control Disallow: / User-Agent: libwww Disallow: / # # reduccion del rastreo # User-Agent: noxtrumbot Crawl-Delay: 50 User-Agent: msnbot Crawl-Delay: 30 User-Agent: Slurp Crawl-Delay: 10