Index Sitemap o Sitemaps individuales?

  • Autor Autor acorrionero
  • Fecha de inicio Fecha de inicio
A

acorrionero

Beta
SEO
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
Buenas,

Alguien sabe si es mejor enviar el indice de sitemaps o los sitemaps por separado (paginas, imagenes, posts, ....)? O es indiferente?
Pasa algo si se envia tanto el indice como los sitemaps individuales?

Gracias.
 
[MENTION=182975]acorrionero[/MENTION] con un sitemap en .xml es más que suficiente, no es necesario enviar tantos, al contrario, esto no hará que tu contenido sea indexado más rápido, lo más que puedes ocasionar es que te identifiquen contenido duplicado así que ten demasiado cuidado con esto. Y en caso de que lo hagas, desde el primer sitemap debes llamar al segundo o al menos desde los robots.txt a tener en cuenta.
 
Ok, pues dejo únicamente el index y tendré paciencia... El problema es que al explorar como Google me aparece el siguiente error:
"Googlebot no ha podido obtener todos los recursos para esta página. A continuación se muestra una lista de los recursos no disponibles: https://pagead2.googlesyndication.com/pagead/js/adsbygoogle.js Tipo:Secuencia de comandos. Motivo: bloqueada. Gravedad: bajo. Robots.txt"

Puede ser porque tuviera el código html de Google Adsense para solicitar cuenta en una de las páginas y me denegaran la solicitud? He quitado el código ahora.
 
Ok, pues dejo únicamente el index y tendré paciencia... El problema es que al explorar como Google me aparece el siguiente error:
"Googlebot no ha podido obtener todos los recursos para esta página. A continuación se muestra una lista de los recursos no disponibles: https://pagead2.googlesyndication.com/pagead/js/adsbygoogle.js Tipo:Secuencia de comandos. Motivo: bloqueada. Gravedad: bajo. Robots.txt"

Puede ser porque tuviera el código html de Google Adsense para solicitar cuenta en una de las páginas y me denegaran la solicitud? He quitado el código ahora.
[MENTION=182975]acorrionero[/MENTION] esto no es por tus sitemaps, es porque algún contenido tuyo se estará bloqueando a nivel del robots.txt o a nivel de una meta etiqueta en el header, te recomiendo compartir tu robots censurando tu dominio para evaluarlo o de pleno aportar más información al tema para ayudarte con la situación que estás teniendo.
 
[MENTION=182975]acorrionero[/MENTION] esto no es por tus sitemaps, es porque algún contenido tuyo se estará bloqueando a nivel del robots.txt o a nivel de una meta etiqueta en el header, te recomiendo compartir tu robots censurando tu dominio para evaluarlo o de pleno aportar más información al tema para ayudarte con la situación que estás teniendo.

El header de mi tema es el siguiente:

<?php
/**
* The header for our theme
*
* This is the template that displays all of the <head> section and everything up until <div id="content">
*
* [MENTION=3037]Link[/MENTION] Template Files | Theme Developer Handbook | WordPress Developer Resources
*
* [MENTION=156547]pack[/MENTION]age WordPress
* @subpackage Twenty_Seventeen
* @since 1.0
* @version 1.0
*/

?><!DOCTYPE html>
<html <?php language_attributes(); ?> class="no-js no-svg">
<head>
<meta charset="<?php bloginfo( 'charset' ); ?>">
<meta name="viewport" content="width=device-width, initial-scale=1">
<link rel="profile" href="http://gmpg.org/xfn/11">

<?php wp_head(); ?>
</head>

<body <?php body_class(); ?>>
<div id="page" class="site">
<a class="skip-link screen-reader-text" href="#content"><?php _e( 'Skip to content', 'twentyseventeen' ); ?></a>

<header id="masthead" class="site-header" role="banner">

<?php get_template_part( 'template-parts/header/header', 'image' ); ?>

<?php if ( has_nav_menu( 'top' ) ) : ?>
<div class="navigation-top">
<div class="wrap">
<?php get_template_part( 'template-parts/navigation/navigation', 'top' ); ?>
</div><!-- .wrap -->
</div><!-- .navigation-top -->
<?php endif; ?>

</header><!-- #masthead -->

<?php

/*
* If a regular post or page, and not the front page, show the featured image.
* Using get_queried_object_id() here since the $post global may not be set before a call to the_post().
*/
if ( ( is_single() || ( is_page() && ! twentyseventeen_is_frontpage() ) ) && has_post_thumbnail( get_queried_object_id() ) ) :
echo '<div class="single-featured-image-header">';
echo get_the_post_thumbnail( get_queried_object_id(), 'twentyseventeen-featured-image' );
echo '</div><!-- .single-featured-image-header -->';
endif;
?>

<div class="site-content-contain">
<div id="content" class="site-content">

En cuanto al robots.txt clicando en el enlace de la página de Explorar como Google en Search Console aparece lo siguiente:
User-Agent: *
Allow: /ads/preferences/
Allow: /gpt/
Disallow: /
Noindex: /

Que por lo que veo bloquea toda la indexación del sitio!!!

Mientras que él robots.txt correcto (y que aparece en la página de probar robots.txt de SC) es este:
User-Agent: *
Disallow: /wp-login/
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://www.midominio.es/sitemap_index.xml

Como puedo hacer para que haga caso omiso al primer robots.txt? De donde lo coge? Como se ha creado?
 
El header de mi tema es el siguiente:

<?php
/**
* The header for our theme
*
* This is the template that displays all of the <head> section and everything up until <div id="content">
*
* [MENTION=3037]Link[/MENTION] Template Files | Theme Developer Handbook | WordPress Developer Resources
*
* [MENTION=156547]pack[/MENTION]age WordPress
* @subpackage Twenty_Seventeen
* @since 1.0
* @version 1.0
*/

?><!DOCTYPE html>
<html <?php language_attributes(); ?> class="no-js no-svg">
<head>
<meta charset="<?php bloginfo( 'charset' ); ?>">
<meta name="viewport" content="width=device-width, initial-scale=1">
<link rel="profile" href="http://gmpg.org/xfn/11">

<?php wp_head(); ?>
</head>

<body <?php body_class(); ?>>
<div id="page" class="site">
<a class="skip-link screen-reader-text" href="#content"><?php _e( 'Skip to content', 'twentyseventeen' ); ?></a>

<header id="masthead" class="site-header" role="banner">

<?php get_template_part( 'template-parts/header/header', 'image' ); ?>

<?php if ( has_nav_menu( 'top' ) ) : ?>
<div class="navigation-top">
<div class="wrap">
<?php get_template_part( 'template-parts/navigation/navigation', 'top' ); ?>
</div><!-- .wrap -->
</div><!-- .navigation-top -->
<?php endif; ?>

</header><!-- #masthead -->

<?php

/*
* If a regular post or page, and not the front page, show the featured image.
* Using get_queried_object_id() here since the $post global may not be set before a call to the_post().
*/
if ( ( is_single() || ( is_page() && ! twentyseventeen_is_frontpage() ) ) && has_post_thumbnail( get_queried_object_id() ) ) :
echo '<div class="single-featured-image-header">';
echo get_the_post_thumbnail( get_queried_object_id(), 'twentyseventeen-featured-image' );
echo '</div><!-- .single-featured-image-header -->';
endif;
?>

<div class="site-content-contain">
<div id="content" class="site-content">

En cuanto al robots.txt clicando en el enlace de la página de Explorar como Google en Search Console aparece lo siguiente:
User-Agent: *
Allow: /ads/preferences/
Allow: /gpt/
Disallow: /
Noindex: /

Que por lo que veo bloquea toda la indexación del sitio!!!

Mientras que él robots.txt correcto (y que aparece en la página de probar robots.txt de SC) es este:
User-Agent: *
Disallow: /wp-login/
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://www.midominio.es/sitemap_index.xml

Como puedo hacer para que haga caso omiso al primer robots.txt? De donde lo coge? Como se ha creado?

En el robots no puede ir todo ese contenido, está malformado!

Tiene que quedar asi en robots.txt:

Insertar CODE, HTML o PHP:
User-Agent: *
Disallow: 
Allow: /
Sitemap: http://ejemplo.tld/sitemap.xml
 
En el robots no puede ir todo ese contenido, está malformado!

Tiene que quedar asi en robots.txt:

Insertar CODE, HTML o PHP:
User-Agent: *
Disallow: 
Allow: /
Sitemap: http://ejemplo.tld/sitemap.xml

Pero esto lo cambio por mi robots.txt? Y como hago para que "el otro robots.txt" desaparezca?
 
Un sitemap es suficiente... hasta que pesa 50mb o contiene 50k url, entonces tendrás que crear varios y utilizar un indice.
 
Un sitemap es suficiente... hasta que pesa 50mb o contiene 50k url, entonces tendrás que crear varios y utilizar un indice.

Gracias SilverXL lo tengo en cuenta! Respecto al error del robots.txt sabes cómo puedo solucionarlo?
 
Tiene que ser porque en robots.txt se está bloqueando ese recurso.

En Search Console / Rastreo / Probador de robots.txt, te dirá si está correcto, qué estás bloqueando, etc.
 
Atrás
Arriba