Infografía: 7 librerías de Python que todo analista de datos debería conocer.
Python se volvió el lenguaje favorito de quienes trabajan con datos, y buena parte de la razón son sus librerías. Con unas pocas puedes limpiar información, analizarla, graficarla, automatizar reportes en Excel, construir modelos y hasta traer datos desde APIs. En esta guía repasamos las 7 librerías clave de la infografía, con ejemplos de código listos para adaptar.
🔄 Del dato a la decisión
La infografía resume el trabajo de un analista en cinco pasos. Cada librería encaja en una o más de estas etapas:
| Etapa | Qué haces | Librerías |
|---|---|---|
| 1. Obtener datos | Traer información desde archivos, bases o APIs. | Requests, Pandas, OpenPyXL |
| 2. Limpiar y transformar | Corregir errores, filtrar y dar forma a los datos. | Pandas, NumPy |
| 3. Analizar y visualizar | Explorar patrones y comunicarlos con gráficos. | Pandas, Matplotlib, Seaborn |
| 4. Modelar y predecir | Entrenar modelos y evaluar resultados. | Scikit-learn, NumPy |
| 5. Comunicar y automatizar | Generar reportes y repetir el proceso sin esfuerzo. | OpenPyXL, Pandas |
⚙️ Antes de empezar: instalación
Instala todas las librerías con un solo comando (idealmente dentro de un entorno virtual):
pip install pandas numpy matplotlib seaborn openpyxl scikit-learn requests
ventas.xlsx, columnas como zona, importe o fecha). Cambia los nombres por los de tus propios datos.1️⃣ Pandas: manipulación y análisis de datos
Para qué la usas:
- Limpiar y transformar datos.
- Trabajar con DataFrames.
- Leer y escribir archivos Excel y CSV.
- Realizar análisis exploratorios.
import pandas as pd
df = pd.read_excel("ventas.xlsx")
df["fecha"] = pd.to_datetime(df["fecha"])
df = df.dropna(subset=["importe"]).drop_duplicates()
resumen = (
df.groupby("zona", as_index=False)["importe"]
.sum()
.sort_values("importe", ascending=False)
)
print(resumen.head())df.head(), df.info() y df.describe() para conocer tus datos antes de transformarlos.2️⃣ NumPy: cálculo numérico eficiente
Para qué la usas:
- Operaciones matemáticas rápidas.
- Arreglos multidimensionales.
- Cálculos estadísticos.
- Base para otras bibliotecas.
import numpy as np
importes = df["importe"].to_numpy()
print("Media:", np.mean(importes))
print("Mediana:", np.median(importes))
print("Desv. estándar:", np.std(importes))
print("Percentil 90:", np.percentile(importes, 90))
# Transformación logarítmica para datos muy sesgados
importes_log = np.log1p(importes)3️⃣ Matplotlib: visualización de datos
Para qué la usas:
- Crear gráficos de líneas, barras, etc.
- Visualizar tendencias.
- Personalizar ejes y etiquetas.
- Elaborar gráficos para informes.
import matplotlib.pyplot as plt
plt.figure(figsize=(8, 4))
plt.bar(resumen["zona"], resumen["importe"], color="#1a73e8")
plt.title("Ventas por zona")
plt.xlabel("Zona")
plt.ylabel("Importe")
plt.tight_layout()
plt.savefig("ventas_por_zona.png", dpi=150)
plt.show()savefig para insertarlos luego en informes o presentaciones.4️⃣ Seaborn: visualización estadística
Para qué la usas:
- Gráficos estadísticos atractivos.
- Visualizar distribuciones.
- Analizar correlaciones.
- Facilitar el storytelling con datos.
import seaborn as sns import matplotlib.pyplot as plt sns.set_theme(style="whitegrid") # Distribución de importes por zona sns.boxplot(data=df, x="zona", y="importe") plt.show() # Correlaciones entre variables numéricas corr = df[["importe", "cantidad", "descuento"]].corr() sns.heatmap(corr, annot=True, cmap="Blues") plt.show()
5️⃣ OpenPyXL: automatización de Excel
Para qué la usas:
- Leer y escribir archivos Excel.
- Crear y modificar hojas de cálculo.
- Aplicar formatos y fórmulas.
- Automatizar reportes.
from openpyxl import Workbook
from openpyxl.styles import Font
wb = Workbook()
ws = wb.active
ws.title = "Resumen"
ws.append(["Zona", "Importe"])
for fila in resumen.itertuples(index=False):
ws.append([fila.zona, fila.importe])
for celda in ws[1]:
celda.font = Font(bold=True)
ultima = len(resumen) + 1
ws["D1"] = "Total"
ws["E1"] = f"=SUM(B2:B{ultima})"
wb.save("resumen_ventas.xlsx")6️⃣ Scikit-learn: Machine Learning
Para qué la usas:
- Algoritmos de clasificación y regresión.
- Modelos predictivos.
- Clustering y segmentación.
- Evaluación de modelos.
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_absolute_error
X = df[["cantidad", "descuento"]]
y = df["importe"]
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
modelo = LinearRegression().fit(X_train, y_train)
pred = modelo.predict(X_test)
print("Error absoluto medio:", mean_absolute_error(y_test, pred))7️⃣ Requests: obtención de datos desde APIs
Para qué la usas:
- Realizar solicitudes HTTP.
- Obtener datos en formato JSON.
- Integrar información externa.
- Automatizar la extracción de datos.
import requests
import pandas as pd
resp = requests.get(
"https://api.ejemplo.com/ventas",
params={"anio": 2026},
timeout=30,
)
resp.raise_for_status()
datos = resp.json()
df_api = pd.DataFrame(datos)
print(df_api.head())timeout y raise_for_status() para que tu script falle de forma clara cuando la API no responde. Y nunca escribas claves o tokens directamente en el código.📋 Resumen de las 7 librerías
| Librería | Para qué sirve | Función o clase clave | Etapa |
|---|---|---|---|
| Pandas | Manipulación y análisis de datos | read_excel, groupby | Limpiar y analizar |
| NumPy | Cálculo numérico eficiente | np.mean, np.percentile | Transformar |
| Matplotlib | Visualización de datos | plt.bar, savefig | Visualizar |
| Seaborn | Visualización estadística | boxplot, heatmap | Visualizar |
| OpenPyXL | Automatización de Excel | Workbook, load_workbook | Comunicar y automatizar |
| Scikit-learn | Machine Learning | train_test_split, LinearRegression | Modelar y predecir |
| Requests | Obtención de datos desde APIs | requests.get | Obtener datos |
🚀 Mini proyecto: de la API al reporte en Excel
Este script junta cuatro librerías en un flujo completo: obtiene datos, los limpia, genera un gráfico y deja un reporte listo en Excel. La URL de la API es ilustrativa.
import requests
import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt
from openpyxl import load_workbook
from openpyxl.styles import Font
# 1. Obtener datos
resp = requests.get("https://api.ejemplo.com/ventas", timeout=30)
resp.raise_for_status()
df = pd.DataFrame(resp.json())
# 2. Limpiar y transformar
df["fecha"] = pd.to_datetime(df["fecha"])
df = df.dropna(subset=["importe"]).drop_duplicates()
df["mes"] = df["fecha"].dt.to_period("M").astype(str)
resumen = df.groupby("mes", as_index=False)["importe"].sum()
# 3. Analizar y visualizar
sns.lineplot(data=resumen, x="mes", y="importe", marker="o")
plt.xticks(rotation=45)
plt.tight_layout()
plt.savefig("ventas_mensuales.png", dpi=150)
# 4. Comunicar y automatizar
with pd.ExcelWriter("reporte_ventas.xlsx", engine="openpyxl") as writer:
resumen.to_excel(writer, sheet_name="Resumen", index=False)
wb = load_workbook("reporte_ventas.xlsx")
ws = wb["Resumen"]
for celda in ws[1]:
celda.font = Font(bold=True)
wb.save("reporte_ventas.xlsx")cron.🗓️ Ruta de aprendizaje en 4 semanas
| Semana | Enfoque | Meta |
|---|---|---|
| 1 | Pandas y NumPy | Cargar, limpiar y resumir un archivo real. |
| 2 | Matplotlib y Seaborn | Crear 5 gráficos que cuenten una historia con tus datos. |
| 3 | OpenPyXL y Requests | Automatizar un reporte en Excel con datos traídos de una API. |
| 4 | Scikit-learn | Entrenar y evaluar un modelo sencillo de regresión o clasificación. |
⚠️ Errores comunes al empezar
- Aprender las 7 a la vez: avanza por etapas y practica con datos reales.
- Saltarse la limpieza: la mayor parte del trabajo de un analista está en preparar los datos.
- Gráficos sobrecargados: un gráfico debe responder una sola pregunta.
- Modelar sin entender los datos: explora antes de predecir.
- Código sin documentar: comenta tus scripts; tu yo del futuro lo agradecerá.
🧠 Autoevaluación rápida
Respuesta: Requests.
2. ¿Cuál es la base de cálculo numérico sobre la que se apoyan Pandas y scikit-learn?
Respuesta: NumPy.
3. ¿Qué librería usarías para escribir un reporte con formato en Excel?
Respuesta: OpenPyXL.
4. ¿Por qué se separan datos de entrenamiento y de prueba?
Respuesta: para evaluar el modelo con datos que no vio durante el entrenamiento.
❓ Preguntas frecuentes
¿Necesito saber programar para empezar?
Basta con conocer lo básico de Python (variables, listas, funciones). Las librerías hacen el resto.
¿Por cuál empiezo?
Por Pandas: es la que más vas a usar en tu día a día de análisis.
¿Python reemplaza a Excel o a Power BI?
No: se complementan. Python automatiza y escala; Excel y Power BI facilitan la exploración y la comunicación.
¿Hay otras librerías importantes?
Sí. Por ejemplo, Plotly para gráficos interactivos o SQLAlchemy para bases de datos. Estas 7 son una base sólida para empezar.
🏁 Conclusión
Con Pandas, NumPy, Matplotlib, Seaborn, OpenPyXL, scikit-learn y Requests cubres todo el camino del dato a la decisión: mejores herramientas, mejor análisis y mejores decisiones. No necesitas dominarlas todas de golpe; elige un proyecto pequeño, aplícalo a tus propios datos y ve sumando librerías.
¿Cuál de las 7 usas más en tu trabajo? Cuéntamelo en los comentarios y comparte esta guía con alguien que esté empezando en análisis de datos.
#Python #DataAnalytics #AnalistaDeDatos #DataScience #Pandas #NumPy #Matplotlib #Seaborn #OpenPyXL #ScikitLearn #MachineLearning #APIs #DataVisualization #BusinessIntelligence #DataDriven


No hay comentarios.:
Publicar un comentario
Gracias por visitarnos, comenta y comparte la página. GRACIAS !!!!