28  Fuentes secundarias, archivos y datos digitales

28.1 Lo que ya existe

No siempre necesitas generar datos nuevos. Hay una enorme cantidad de datos ya disponibles, y en América Latina más de lo que la mayoría de los tesistas cree.

Fuente Ejemplos Ventaja Limitación
Encuestas nacionales ENAHO (Perú), CASEN (Chile), ENIGH (México), GEIH (Colombia) Grandes, representativas, gratuitas No diseñadas para tu pregunta
Censos Censo nacional de población Cobertura total Cada 10 años, pocas variables
Registros administrativos Datos de escuelas, hospitales, programas sociales Gran N, longitudinales Calidad variable, acceso restringido
Bases internacionales Banco Mundial, CEPAL, UNESCO, PNUD Comparabilidad entre países Indicadores agregados, no individuales
Datos abiertos Portales gubernamentales de datos abiertos Acceso libre Documentación a veces deficiente
Datos digitales Redes sociales, scraping, Google Trends Masivos, en tiempo real Problemas éticos, representatividad cuestionable

28.2 El costo oculto de los datos ajenos

Usar datos secundarios parece gratis. No lo es. Heredas el diseño de otro: sus definiciones, sus categorías, sus errores de medición, sus decisiones de muestreo. Si la encuesta define “empleo informal” de una manera que no sirve a tu pregunta, no puedes hacer nada al respecto.

La pregunta correcta no es “¿hay datos disponibles?” sino “¿los datos disponibles miden lo que necesito medir?”. Ver Capítulo 12.

28.3 Datos digitales y big data: la frontera nueva

Las ciencias sociales están experimentando una explosión de datos digitales: publicaciones en redes, datos de movilidad de celulares, transacciones electrónicas, búsquedas. Esto abre posibilidades enormes y también trampas:

  • Representatividad: Los usuarios de una red social no son “la sociedad”. Son un subgrupo con características particulares: más jóvenes, más urbanos, más opinados.
  • Ética: ¿El hecho de que los datos sean “públicos” significa que puedes usarlos sin consentimiento? Spoiler: no necesariamente. Ver Capítulo 6.
  • Señal contra ruido: Tener millones de datos no garantiza buenas conclusiones. Pueden ser millones de datos irrelevantes.
  • Transparencia: Los algoritmos de las plataformas determinan qué ves y qué no. No controlas el marco muestral, y muchas veces ni siquiera puedes describirlo.
NotaPara recordar

Más datos no es lo mismo que mejores datos. Una encuesta bien diseñada con 500 casos puede ser infinitamente más valiosa que 5 millones de registros sesgados. La calidad del dato importa más que la cantidad.

TipEjercicio
  1. Busca una encuesta nacional de tu país que toque tu tema. Descarga el cuestionario y el manual metodológico, no solo la base.
  2. Localiza la definición operativa de tu variable principal. ¿Coincide con tu concepto? Anota las diferencias: eso es material directo para tu sección de limitaciones.
  3. Verifica si la base tiene ponderadores y diseño muestral complejo. Si los tiene y pensabas ignorarlos, ver Capítulo 22.