miércoles, 11 de noviembre de 2015

WEB SUPERFICIAL Y WEB PROFUNDA.

El acceso a la web, se ha convertido en la principal fuente de investigación en el ámbito académico, profesional y recreativo, no obstante es importante tener en cuenta que los buscadores únicamente tienen acceso a lo que e denomina como Web superficial o Web visible.

  ¿Qué es la Web superficial o visible?

La Web Superficial comprende todos aquellos sitios cuya información puede ser indexada por los robots de los buscadores convencionales y recuperada casi en su totalidad mediante una consulta en sus formularios de búsqueda.
Es decir, la web superficial o visible es aquella a la que todos tenemos acceso mediante el simple hecho de utilizar un buscador.
 
Dicha Web, posee las siguientes características:
 
  • su información no está contenida en bases de datos.
  • es de libre acceso.
  • no se requiere la realización de un proceso de registro para acceder a la información.
  • mayoritariamente está formada por páginas Web estáticas, es decir páginas o archivos con una URL fija y accesibles desde otro enlace.

  ¿Qué es la Web profunda o invisible?
 
Por otro lado tenemos la Web profunda o invisible que es el término utilizado para describir toda la información disponible en Internet que no se recupera interrogando a los buscadores convencionales. Generalmente es información almacenada y accesible mediante bases de datos. Parte de la información es "invisible" a los robots de los buscadores convencionales, ya que los resultados se generan en la contestación a una pregunta directa mediante páginas dinámicas  es decir páginas que no tienen una URL fija y que se construyen en el mismo instante  desapareciendo una vez cerrada la consulta.
 
Dentro del ámbito de la Web profunda o invisible, se reconocen 4 tipos de dicha Web, los cuales son los siguientes:
 
  • La Web opaca está compuesta por archivos que, si bien podrían estar incluidos en los índices de los buscadores, no lo están por alguno de los siguientes motivos:
1.- Extensión de la indización: a veces, por economía, no todas las páginas de un sitio son indizadas en los buscadores.
 
2.- Frecuencia de la indización: los buscadores no poseen la capacidad de indizar todas las páginas existentes; a diario se agregan y modifican muchas y la indización no se realiza al ritmo que permita incluirlas a todas.
 
3.- Número máximo de resultados visibles: aunque los motores de búsqueda arrojan a veces un gran número de resultados, generalmente limitan el número de documentos que se muestran (entre 200 y 1000).
 
4.- URL desconectadas: las generaciones más recientes de buscadores, presentan los documentos por relevancia basada en el número de veces que aparecen referenciados en otros. Si un documento no tiene un link a él, desde otro documento, será imposible que la página sea encontrada, pues no se encuentra indizada.
 
  • La Web privada consiste en las páginas Web que podrían estar indizadas en los buscadores pero son excluidas deliberadamente por alguno de estos motivos:
1.- Las páginas están protegidas por contraseñas.
 
2.- Contienen un archivo “robots.txt” para evitar ser indizadas.
 
3.- Contienen un campo “noindex” para evitar que el buscador pueda indizar la parte correspondiente al cuerpo de la página.
 
  • La Web propietaria incluye aquellas páginas en las que es necesario registrarse para tener acceso al contenido, ya sea de forma gratuita o arancelada.
  • La Web realmente invisible se compone de páginas que no pueden ser indizadas por limitaciones técnicas de los buscadores, programas ejecutables y archivos comprimidos, páginas generadas dinámicamente, es decir, que se generan a partir de datos que introduce el usuario,  información almacenada en bases de datos relacionales, que no puede ser extraída a menos que se realice una petición específica.  
Para la búsqueda en la web profunda o invisible, esta nos apoya con determinadas herramientas de búsqueda, las cuales son las siguientes:
 
  • The WWW Virtual Library se considera el catálogo más antiguo en la web y fue iniciado por Tim Berners-Lee, el creador de la web.  
  • Infoplease es una Web de consulta con más de 57.000 artículos de la prestigiosa enciclopedia Columbia. Facilita la consulta de información con opciones de búsqueda por términos o por áreas de conocimiento.
  • DeepWebTech ofrece cinco motores de búsqueda para temas específicos. Los motores de búsqueda abarcan la ciencia, medicina y negocios.
  • TechXtra centra su información, en ingeniería, matemáticas e informática. Es posible navegar a través de una extensa lista de revistas gratuitas especializadas de ingeniería, documentos técnicos, descargas y podcasts.
La Web resulta mucho más amplia de lo que imaginamos y a pesar de contar con una infinidad de información dentro de la Web visible, es imprescindible que conozcamos acerca de la Web profunda, para ampliar nuestras posibilidades y conocimientos con respecto a las búsquedas en internet.

1 comentario: