Business Intelligence, Power BI y Data Engineering explicados paso a paso: DAX, modelado de datos, arquitectura y herramientas de IA (Claude) para analistas que quieren dar el salto a Ingeniería de Datos.

Breaking

viernes, 9 de octubre de 2026

7 Librerías de Python que Todo Analista de Datos Debería Conocer (Guía con Ejemplos)

Infografía: 7 librerías de Python que todo analista de datos debería conocer

 

Infografía: 7 librerías de Python que todo analista de datos debería conocer.

Python se volvió el lenguaje favorito de quienes trabajan con datos, y buena parte de la razón son sus librerías. Con unas pocas puedes limpiar información, analizarla, graficarla, automatizar reportes en Excel, construir modelos y hasta traer datos desde APIs. En esta guía repasamos las 7 librerías clave de la infografía, con ejemplos de código listos para adaptar.

🎯 Lo que vas a llevarte: qué hace cada librería, cuándo usarla, un ejemplo práctico de cada una, un mini proyecto que las integra y una ruta de aprendizaje de 4 semanas.

🔄 Del dato a la decisión

La infografía resume el trabajo de un analista en cinco pasos. Cada librería encaja en una o más de estas etapas:

EtapaQué hacesLibrerías
1. Obtener datosTraer información desde archivos, bases o APIs.Requests, Pandas, OpenPyXL
2. Limpiar y transformarCorregir errores, filtrar y dar forma a los datos.Pandas, NumPy
3. Analizar y visualizarExplorar patrones y comunicarlos con gráficos.Pandas, Matplotlib, Seaborn
4. Modelar y predecirEntrenar modelos y evaluar resultados.Scikit-learn, NumPy
5. Comunicar y automatizarGenerar reportes y repetir el proceso sin esfuerzo.OpenPyXL, Pandas

⚙️ Antes de empezar: instalación

Instala todas las librerías con un solo comando (idealmente dentro de un entorno virtual):

pip install pandas numpy matplotlib seaborn openpyxl scikit-learn requests
⚠️ Sobre los ejemplos: usan archivos y datos ilustrativos (ventas.xlsx, columnas como zona, importe o fecha). Cambia los nombres por los de tus propios datos.

1️⃣ Pandas: manipulación y análisis de datos

Para qué la usas:

  • Limpiar y transformar datos.
  • Trabajar con DataFrames.
  • Leer y escribir archivos Excel y CSV.
  • Realizar análisis exploratorios.
import pandas as pd

df = pd.read_excel("ventas.xlsx")
df["fecha"] = pd.to_datetime(df["fecha"])
df = df.dropna(subset=["importe"]).drop_duplicates()

resumen = (
    df.groupby("zona", as_index=False)["importe"]
      .sum()
      .sort_values("importe", ascending=False)
)
print(resumen.head())
💡 Tip: empieza siempre con df.head(), df.info() y df.describe() para conocer tus datos antes de transformarlos.

2️⃣ NumPy: cálculo numérico eficiente

Para qué la usas:

  • Operaciones matemáticas rápidas.
  • Arreglos multidimensionales.
  • Cálculos estadísticos.
  • Base para otras bibliotecas.
import numpy as np

importes = df["importe"].to_numpy()

print("Media:", np.mean(importes))
print("Mediana:", np.median(importes))
print("Desv. estándar:", np.std(importes))
print("Percentil 90:", np.percentile(importes, 90))

# Transformación logarítmica para datos muy sesgados
importes_log = np.log1p(importes)
💡 Tip: NumPy trabaja por debajo de Pandas y de scikit-learn; entender sus arreglos te ayuda a escribir código más rápido.

3️⃣ Matplotlib: visualización de datos

Para qué la usas:

  • Crear gráficos de líneas, barras, etc.
  • Visualizar tendencias.
  • Personalizar ejes y etiquetas.
  • Elaborar gráficos para informes.
import matplotlib.pyplot as plt

plt.figure(figsize=(8, 4))
plt.bar(resumen["zona"], resumen["importe"], color="#1a73e8")
plt.title("Ventas por zona")
plt.xlabel("Zona")
plt.ylabel("Importe")
plt.tight_layout()
plt.savefig("ventas_por_zona.png", dpi=150)
plt.show()
💡 Tip: guarda tus gráficos con savefig para insertarlos luego en informes o presentaciones.

4️⃣ Seaborn: visualización estadística

Para qué la usas:

  • Gráficos estadísticos atractivos.
  • Visualizar distribuciones.
  • Analizar correlaciones.
  • Facilitar el storytelling con datos.
import seaborn as sns
import matplotlib.pyplot as plt

sns.set_theme(style="whitegrid")

# Distribución de importes por zona
sns.boxplot(data=df, x="zona", y="importe")
plt.show()

# Correlaciones entre variables numéricas
corr = df[["importe", "cantidad", "descuento"]].corr()
sns.heatmap(corr, annot=True, cmap="Blues")
plt.show()
💡 Tip: Seaborn se apoya en Matplotlib y en Pandas, así que puedes pasarle un DataFrame directamente.

5️⃣ OpenPyXL: automatización de Excel

Para qué la usas:

  • Leer y escribir archivos Excel.
  • Crear y modificar hojas de cálculo.
  • Aplicar formatos y fórmulas.
  • Automatizar reportes.
from openpyxl import Workbook
from openpyxl.styles import Font

wb = Workbook()
ws = wb.active
ws.title = "Resumen"

ws.append(["Zona", "Importe"])
for fila in resumen.itertuples(index=False):
    ws.append([fila.zona, fila.importe])

for celda in ws[1]:
    celda.font = Font(bold=True)

ultima = len(resumen) + 1
ws["D1"] = "Total"
ws["E1"] = f"=SUM(B2:B{ultima})"

wb.save("resumen_ventas.xlsx")
💡 Tip: OpenPyXL escribe las fórmulas como texto; Excel las calcula al abrir el archivo.

6️⃣ Scikit-learn: Machine Learning

Para qué la usas:

  • Algoritmos de clasificación y regresión.
  • Modelos predictivos.
  • Clustering y segmentación.
  • Evaluación de modelos.
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_absolute_error

X = df[["cantidad", "descuento"]]
y = df["importe"]

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42
)

modelo = LinearRegression().fit(X_train, y_train)
pred = modelo.predict(X_test)
print("Error absoluto medio:", mean_absolute_error(y_test, pred))
💡 Tip: separa siempre datos de entrenamiento y de prueba: evaluar con los mismos datos que usaste para entrenar da resultados engañosos.

7️⃣ Requests: obtención de datos desde APIs

Para qué la usas:

  • Realizar solicitudes HTTP.
  • Obtener datos en formato JSON.
  • Integrar información externa.
  • Automatizar la extracción de datos.
import requests
import pandas as pd

resp = requests.get(
    "https://api.ejemplo.com/ventas",
    params={"anio": 2026},
    timeout=30,
)
resp.raise_for_status()

datos = resp.json()
df_api = pd.DataFrame(datos)
print(df_api.head())
💡 Tip: usa siempre timeout y raise_for_status() para que tu script falle de forma clara cuando la API no responde. Y nunca escribas claves o tokens directamente en el código.

📋 Resumen de las 7 librerías

LibreríaPara qué sirveFunción o clase claveEtapa
PandasManipulación y análisis de datosread_excel, groupbyLimpiar y analizar
NumPyCálculo numérico eficientenp.mean, np.percentileTransformar
MatplotlibVisualización de datosplt.bar, savefigVisualizar
SeabornVisualización estadísticaboxplot, heatmapVisualizar
OpenPyXLAutomatización de ExcelWorkbook, load_workbookComunicar y automatizar
Scikit-learnMachine Learningtrain_test_split, LinearRegressionModelar y predecir
RequestsObtención de datos desde APIsrequests.getObtener datos

🚀 Mini proyecto: de la API al reporte en Excel

Este script junta cuatro librerías en un flujo completo: obtiene datos, los limpia, genera un gráfico y deja un reporte listo en Excel. La URL de la API es ilustrativa.

import requests
import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt
from openpyxl import load_workbook
from openpyxl.styles import Font

# 1. Obtener datos
resp = requests.get("https://api.ejemplo.com/ventas", timeout=30)
resp.raise_for_status()
df = pd.DataFrame(resp.json())

# 2. Limpiar y transformar
df["fecha"] = pd.to_datetime(df["fecha"])
df = df.dropna(subset=["importe"]).drop_duplicates()
df["mes"] = df["fecha"].dt.to_period("M").astype(str)
resumen = df.groupby("mes", as_index=False)["importe"].sum()

# 3. Analizar y visualizar
sns.lineplot(data=resumen, x="mes", y="importe", marker="o")
plt.xticks(rotation=45)
plt.tight_layout()
plt.savefig("ventas_mensuales.png", dpi=150)

# 4. Comunicar y automatizar
with pd.ExcelWriter("reporte_ventas.xlsx", engine="openpyxl") as writer:
    resumen.to_excel(writer, sheet_name="Resumen", index=False)

wb = load_workbook("reporte_ventas.xlsx")
ws = wb["Resumen"]
for celda in ws[1]:
    celda.font = Font(bold=True)
wb.save("reporte_ventas.xlsx")
🧪 Reto: adapta el script a tus datos reales, agrega una segunda hoja con el detalle y programa su ejecución semanal con el Programador de tareas de Windows o con cron.

🗓️ Ruta de aprendizaje en 4 semanas

SemanaEnfoqueMeta
1Pandas y NumPyCargar, limpiar y resumir un archivo real.
2Matplotlib y SeabornCrear 5 gráficos que cuenten una historia con tus datos.
3OpenPyXL y RequestsAutomatizar un reporte en Excel con datos traídos de una API.
4Scikit-learnEntrenar y evaluar un modelo sencillo de regresión o clasificación.

⚠️ Errores comunes al empezar

  • Aprender las 7 a la vez: avanza por etapas y practica con datos reales.
  • Saltarse la limpieza: la mayor parte del trabajo de un analista está en preparar los datos.
  • Gráficos sobrecargados: un gráfico debe responder una sola pregunta.
  • Modelar sin entender los datos: explora antes de predecir.
  • Código sin documentar: comenta tus scripts; tu yo del futuro lo agradecerá.

🧠 Autoevaluación rápida

1. ¿Qué librería usarías para obtener datos desde una API?
Respuesta: Requests.

2. ¿Cuál es la base de cálculo numérico sobre la que se apoyan Pandas y scikit-learn?
Respuesta: NumPy.

3. ¿Qué librería usarías para escribir un reporte con formato en Excel?
Respuesta: OpenPyXL.

4. ¿Por qué se separan datos de entrenamiento y de prueba?
Respuesta: para evaluar el modelo con datos que no vio durante el entrenamiento.

❓ Preguntas frecuentes

¿Necesito saber programar para empezar?
Basta con conocer lo básico de Python (variables, listas, funciones). Las librerías hacen el resto.

¿Por cuál empiezo?
Por Pandas: es la que más vas a usar en tu día a día de análisis.

¿Python reemplaza a Excel o a Power BI?
No: se complementan. Python automatiza y escala; Excel y Power BI facilitan la exploración y la comunicación.

¿Hay otras librerías importantes?
Sí. Por ejemplo, Plotly para gráficos interactivos o SQLAlchemy para bases de datos. Estas 7 son una base sólida para empezar.

🏁 Conclusión

Con Pandas, NumPy, Matplotlib, Seaborn, OpenPyXL, scikit-learn y Requests cubres todo el camino del dato a la decisión: mejores herramientas, mejor análisis y mejores decisiones. No necesitas dominarlas todas de golpe; elige un proyecto pequeño, aplícalo a tus propios datos y ve sumando librerías.

¿Cuál de las 7 usas más en tu trabajo? Cuéntamelo en los comentarios y comparte esta guía con alguien que esté empezando en análisis de datos.

#Python #DataAnalytics #AnalistaDeDatos #DataScience #Pandas #NumPy #Matplotlib #Seaborn #OpenPyXL #ScikitLearn #MachineLearning #APIs #DataVisualization #BusinessIntelligence #DataDriven

No hay comentarios.:

Publicar un comentario

Gracias por visitarnos, comenta y comparte la página. GRACIAS !!!!

Adbox