Imported from LuiccianDev/eda-skouries-vulcan-2026 (
.agents/skills/eda-csv-contextual/SKILL.md). Install upstream withnpx skills add LuiccianDev/eda-skouries-vulcan-2026 --skill eda-csv-contextual. Copyright stays with the author.
EDA CSV Contextual
Objetivo
Crear un analisis exploratorio reproducible y util para decisiones, empezando por contexto semantico de columnas y continuando con limpieza, verificacion, visualizacion y hallazgos. Cada grafica debe incluir una explicacion clara de que muestra y que se puede inferir.
Cuando usar este skill
- Cuando hay un archivo CSV y se necesita EDA completo.
- Cuando la calidad de datos es incierta y se deben validar supuestos.
- Cuando se requiere documentar reglas por columna antes del analisis.
Entradas minimas
- Ruta de archivo CSV.
- Objetivo del analisis (ejemplo: control de calidad, modelado, reporte operativo).
Paso 0: Solicitar contexto por columna (obligatorio)
Antes de cualquier calculo, pedir al usuario una ficha por columna. Si el usuario no tiene todo, permitir "desconocido" y continuar con advertencias.
Plantilla requerida por columna:
column_nametipo_esperado: numerico | categorico | fecha | texto | booleano | iddescripcion_columna(que representa la columna en lenguaje simple)unidad(si aplica)rango_valido(min/max o regla)categorias_validas(si aplica)nulos_permitidos: si/no + reglavalores_invalidos_conocidos(ejemplo: -999, NA, texto basura)es_clave(si/no)
Decision:
- Si falta mas del 50% del contexto critico (tipo_esperado, nulos_permitidos, rango/categorias, descripcion_columna), generar primero una version "EDA preliminar" y marcar conclusiones como provisionales.
Paso 1: Carga y estandarizacion
- Cargar CSV con configuracion robusta (encoding, separador, parse de fechas controlado).
- Normalizar nombres de columnas (trim, lower_snake_case opcional, remover espacios dobles).
- Crear diccionario de metadatos por dataset: filas, columnas, memoria, muestra.
Checks de calidad:
- Confirmar lectura sin truncamiento.
- Detectar columnas duplicadas por nombre.
Paso 2: Limpieza inicial
- Estandarizar nulos (
'', 'na', 'n/a', 'null', 'none', '-999'segun contexto). - Convertir tipos usando
tipo_esperadocon coercion segura. - Limpiar texto (trim, unificar mayus/minus cuando aplique).
- Eliminar duplicados exactos y reportar duplicados de clave si
es_clave = si.
Decision:
- Si conversion de tipo falla en >10% de filas para una columna, no forzar conversion silenciosa. Reportar y pedir confirmacion de regla.
Paso 3: Verificacion de calidad
Analizar por columna:
- Completitud: nulos y vacios.
- Validez: rango/categorias/tipos contra reglas esperadas.
- Consistencia: formatos mixtos, unidades mezcladas, valores atipicos de dominio.
- Unicidad: para columnas clave e IDs.
Checks de salida:
- Tabla de issues priorizada por severidad (alta/media/baja).
- Conteo y porcentaje de filas afectadas por issue.
Paso 4: EDA descriptivo
Para numericas:
count, mean, std, min, p25, p50, p75, max, skewness opcional.- Outliers con IQR por defecto.
Para categoricas:
- cardinalidad, top categorias, rare categories.
Para fechas:
- cobertura temporal, huecos, granularidad, estacionalidad basica.
Paso 5: Visualizaciones recomendadas
- Numericas: histogramas + boxplots.
- Categoricas: barras de frecuencia.
- Fechas: series temporales y volumen por periodo.
- Relaciones: matriz de correlacion (solo numericas), scatter para pares clave.
Para cada grafica, agregar una seccion breve:
lectura: que se observa de forma objetiva.inferencia: que hipotesis o conclusion preliminar sugiere.accion: que validar o limpiar despues de este hallazgo.
Regla:
- Evitar graficos redundantes. Priorizar los que respondan el objetivo del analisis.
Paso 6: Analisis por CSV
Para el CSV cargado:
- Resumen ejecutivo (3-7 hallazgos).
- Riesgos de calidad y su impacto probable.
- Recomendaciones de limpieza adicional.
Paso 7: Entregables
Generar:
data_quality_reportpor dataset.eda_summarycon hallazgos accionables.- Lista de decisiones tomadas y pendientes de confirmacion del usuario.
- Interpretacion de cada grafica con lectura, inferencia y accion.
Criterios de finalizacion
- Contexto por columna solicitado y registrado (o marcado como desconocido).
- Limpieza aplicada con trazabilidad de cambios.
- Verificacion completada con issues priorizados.
- Visualizaciones clave generadas.
- Explicacion inferencial incluida en cada grafica.
- Recomendaciones finales conectadas al objetivo del analisis.
Prompt de ejemplo
/eda-csv-contextual Analiza data/assays.csv y explica que se puede inferir de cada grafica./eda-csv-contextual Analiza data/litho.csv para calidad de datos y resume riesgos criticos.