Blog

Notas sobre comparar, dividir y limpiar datos sucios de hojas de cálculo. Sin humo, sin oversell. Sólo lo que hemos aprendido enviando MessyMatch.

Qué vas a encontrar aquí

Posts cortos y prácticos sobre el trabajo que hay detrás de los datos limpios. La mayoría los escribimos cuando topamos con un problema y queremos un texto claro que nos habría gustado leer al empezar. Sin clickbait, sin pensamiento estratégico de cartón piedra, sin contenido patrocinado.

  1. Guías prácticas para comparar, dividir, fusionar y anonimizar datos sin escribir código.
  2. Comparativas honestas entre los flujos de hoja de cálculo (BUSCARV, BUSCARX, Power Query) y las herramientas dedicadas.
  3. Notas sobre coincidencia aproximada, normalización, codificación, ceros a la izquierda y todo lo que rompe un diff sin avisar.
  4. Tutoriales con privacidad por defecto: cómo preparar un CSV para ChatGPT sin filtrar datos de cliente.
  5. Cada post indica el tramo exacto de MessyMatch que hace el trabajo, incluido el camino gratis cuando lo hay.

Los temas a los que volvemos

Si lees tres posts aquí, lo más probable es que veas alguno de los temas de abajo. Son las preguntas que nos hace la gente y las que vamos puliendo.

  • Comparar dos archivos sucios

    Por qué un diff byte a byte falla, cómo cambian el resultado las reglas de limpieza, cuándo la coincidencia aproximada ayuda y cuándo miente.

  • Dividir y fusionar datos grandes

    Cómo Excel se rompe a partir del millón de filas, por qué las importaciones SQL topan en 50 MB en hosting compartido y qué hacer en los dos casos.

  • Anonimizar datos para ChatGPT y otros LLM

    El mínimo que hay que eliminar (nombres, emails, IDs, IBAN, DNI), por qué importa el mapeo reversible y en qué se diferencian pseudonimización RGPD y anonimización.

  • Coincidencia aproximada honesta

    Qué mide en realidad Jaro-Winkler, cuándo te ahorra trabajo el bloqueo y cuándo la distancia entre cadenas da una falsa sensación de seguridad.

  • Hojas de cálculo en 2026

    Dónde sigue teniendo sentido BUSCARV, dónde BUSCARX es de verdad mejor y dónde no pinta ninguno de los dos: la respuesta es un diff real.

Preguntas frecuentes sobre el blog

¿Con qué frecuencia publicáis?+

Una o dos veces al mes, más o menos. Publicamos cuando tenemos algo que nos habría gustado leer. No hay calendario editorial.

¿Los posts los escribe una persona?+

Sí. Cada post lo redacta, edita y revisa una persona. A veces usamos IA para revisar tono o erratas, nunca para generar el texto.

¿Puedo proponer un tema?+

Sí. Escribe a hello@messymatch.com con el flujo de trabajo que te dio la idea. No prometemos cubrirlo, pero llevamos una lista y las mejores propuestas suben.

¿Aceptáis posts de invitado?+

Hoy no. Mantenemos el tono y el nivel técnico escribiéndolo todo en casa.

¿Hay RSS?+

Todavía no. De momento, marca el índice del blog. La lista es corta de revisar.

¿Cómo aviso de un error en un post?+

hello@messymatch.com. Actualizamos los posts en sitio y dejamos una nota al final cuando la corrección es importante.