Cuando hablamos de tech, no todo se puede aprender leyendo o viendo videos. Si quieres aprender Machine Learning (ML), la práctica real es una de las maneras más efectivas de avanzar dentro de la ciencia de datos. Y para practicar necesitas datos, algo que suele frenar a mucha gente al inicio.
En este artículo aprenderás cómo construir datasets para proyectos reales, qué opciones tienes para recopilar o generar datos, y por qué este proceso te va a enseñar mucho más que simplemente descargar un archivo ya listo.
¿Qué es un dataset y por qué importa tanto en ML?
Un dataset es, en pocas palabras, una colección organizada de datos. Así de simple.
Puede ser una tabla con filas y columnas, donde cada fila representa una observación y cada columna es una característica de esa observación. Por ejemplo, si quisieras predecir el precio de un departamento, tu dataset podría tener columnas como número de cuartos, metros cuadrados, colonia y precio final.
La estructura de un dataset es la base de cualquier proyecto de ML que quieras construir. Como los modelos aprenden a partir de los datos, si estos están mal estructurados o incompletos, el modelo aprenderá patrones incorrectos.
Por qué crear tus propios datasets puede ayudarte a aprender mejor
Cuando descargas un dataset público ya listo, donde no tienes que mover nada, te saltas una parte importante del proceso de aprender Machine Learning: entender de dónde viene la información y qué significa cada variable. Construir tus propios datos te da ventajas, como:
🔷 Entender el origen de los datos y sus limitaciones desde el principio.
🔶 Aprender a definir variables, etiquetas y columnas con un propósito claro.
🔷 Practicar limpieza de datos en condiciones reales, no en datos ya pulidos.
🔶 Construir un proyecto con contexto personal, lo que hace mucho más fácil explicarlo en una entrevista.
🔷 Obtener experiencia en todo el ciclo de un proyecto de datos, no solo en la parte del modelo.
Formas sencillas de crear datasets para proyectos
Empezar es más fácil de lo que parece. Aquí tienes algunas formas accesibles de generar tus primeros datos.
Recopilación manual
La vieja escuela. Con este método puedes anotar observaciones del mundo real en una hoja de cálculo; por ejemplo, registrar el tiempo que tardas en llegar al trabajo cada día, el clima que había y el medio de transporte que usaste. En unas semanas tendrás suficientes filas para practicar análisis básico.
Encuestas y formularios
Las herramientas de formularios como Google Forms te permiten recopilar respuestas de otras personas. Puedes preguntar a amistades o compañeros sobre hábitos de estudio, preferencias de entretenimiento o cualquier tema que te interese analizar. Las respuestas se exportan fácilmente como un archivo CSV.
Seguimiento en hojas de cálculo
Si ya llevas algún registro personal (gastos, ejercicio, lectura, horas de sueño), ya tienes la base de un dataset. Ahora solo necesitas organizarlo en columnas claras y asegurarte de que los valores sean consistentes.
Organizar información pública
Puedes tomar información disponible en sitios web (precios, noticias, calificaciones) y organizarla manualmente en una tabla. Con este método podrás copiar datos relevantes y estructurarlos con un propósito de aprendizaje.
Datos sintéticos o simulados
Cuando aprendes a generar datos con Python, puedes usar librerías como NumPy o Scikit-learn para crear datos artificiales con patrones específicos. Esto es útil para entender cómo funciona un algoritmo en condiciones controladas; sin embargo, no reemplaza a los datos reales. Aun así, sirve mucho para experimentar.

¿Cómo generar datos ML sin complicarte la vida?
No esperes tener el dataset perfecto para arrancar; mejor empieza con algo pequeño y ve ajustando sobre la marcha. Aquí van algunos consejos que te ahorrarán tiempo y estrés:
🔷 Empieza pequeño: veinte o treinta registros son suficientes para validar si tu idea tiene sentido.
🔶 Define el problema primero: ¿qué quieres predecir o clasificar? Eso te dirá qué columnas necesitas.
🔷 Elige variables con propósito: no agregues columnas solo por agregar; cada una debe aportar información relevante.
🔶 No intentes imitar datasets empresariales: un dataset de aprendizaje puede ser simple y enfocado.
Recuerda que preparar datos para ML no requiere infraestructura compleja: un archivo CSV bien organizado es más que suficiente para comenzar.
¿Qué debe tener un buen dataset para principiantes?
No te preocupes por la cantidad de datos: ya vimos que no necesitas llenar miles de celdas para empezar. Lo importante es que tenga estas características desde el inicio:
🔷 Columnas con nombres claros que indiquen qué representa cada variable.
🔶 Valores consistentes en cada columna (no mezclar “sí” con “Si” o “SI” para la misma respuesta).
🔷 Suficientes ejemplos para que el modelo tenga algo con qué trabajar.
🔶 Una variable objetivo clara si tu proyecto es de predicción o clasificación.
💡 Recordatorio amable: una estructura bien pensada desde el inicio te ahorra muchos problemas después.
Ejemplos de datasets para proyectos de aprendizaje
Ya hablamos de lo que debe tener un dataset para que funcione. Si todavía no tienes una idea en mente, aquí van algunos ejemplos concretos que cualquier principiante puede construir con información práctica y cercana:
🔷 Registro de gastos personales: fecha, categoría, monto, forma de pago. Puedes practicar agrupaciones, promedios y visualizaciones.
🔶 Calificaciones de películas o libros: título, género, año, calificación personal. Ideal para proyectos de recomendación básica.
🔷 Hábitos de estudio: horas estudiadas, materia, día de la semana, calificación obtenida. Bueno para practicar regresión.
🔶 Observaciones del clima: temperatura, humedad, lluvia (sí/no), ciudad. Sencillo y fácil de construir con datos públicos.
🔷 Comparación de precios: producto, tienda, precio, fecha. Útil para practicar análisis exploratorio.
🔶 Registro de comportamiento de usuarios: visitas a una página, tiempo, acción realizada. Simula un entorno de negocio real.
Cualquiera de estos ejemplos te servirá para practicar análisis de datos, visualización o modelos de clasificación y regresión. Si quieres ver qué construir con ellos, revisa los primeros modelos de Machine Learning para principiantes.
Errores comunes al crear datasets
Antes de ponerte a recopilar datos, vale la pena conocer los tropiezos más frecuentes de quienes empiezan en ciencia de datos. Son fáciles de evitar una vez que sabes dónde están:
🔷 Tener muy pocos datos: con 10 o 15 filas no vas a poder entrenar ningún modelo significativo.
🔶 Formato inconsistente: mezclar fechas como “01/03/2024” y “1 de marzo” en la misma columna genera problemas al limpiar los datos.
🔷 Sin etiquetas o variable objetivo: si tu proyecto es de clasificación, debes tener claro desde el inicio qué columna quieres predecir.
🔶 Entradas repetidas o sesgadas: si todos los registros son del mismo día, el mismo usuario o la misma condición, el modelo no va a generalizar.
🔷 Recopilar datos sin un objetivo claro: antes de empezar, define qué pregunta quieres responder.
Si quieres anticipar más tropiezos de esta etapa, aquí están los errores comunes al iniciar en Machine Learning.
¿Cómo preparar y limpiar tu dataset antes de usarlo?
A partir de aquí vas a trabajar con los datos obtenidos. Pero antes de entrenar cualquier modelo necesitas revisarlos y limpiarlos. Estos son los pasos básicos:
🔷 Valores faltantes: decide si eliminar las filas con datos vacíos o rellenarlos con un valor promedio o por defecto.
🔶 Filas duplicadas: revisa si hay registros idénticos.
🔷 Categorías estandarizadas: asegúrate de que “hombre” y “Hombre” no sean tratados como valores diferentes.
🔶 Tipos de datos correctos: las columnas numéricas deben ser numéricas, no texto.
🔷 Validación básica: revisa los rangos de los valores. Si tienes una columna de edad y aparece un 300, hay un error.
Esta fase es tan importante como el entrenamiento del modelo. Muchos proyectos fallan no por el algoritmo, sino por datos mal preparados.
¿Cuándo conviene crear datos propios y cuándo usar datasets públicos?
Ninguna de las dos opciones es mejor que la otra: sirven para cosas distintas.
| Cuándo crear datos propios | Cuándo usar datasets públicos |
| No encuentras un dataset público que se ajuste a tu idea de proyecto. | Quieres comparar tu trabajo con benchmarks conocidos. |
| Quieres practicar el ciclo completo de un proyecto de datos, desde la recolección hasta el modelo. | Necesitas una cantidad grande de datos que sería muy difícil generar manualmente. |
| Tu tema de proyecto es específico o personal y los datos disponibles no lo reflejan. | Estás aprendiendo una técnica específica y el contenido del dataset no es lo importante. |
Lo ideal cuando estás aprendiendo es combinar ambas. Practica con datasets públicos para compararte con otros, y crea los tuyos cuando quieras un proyecto personal que muestre cómo piensas.
Crear datasets es parte del aprendizaje
Construir tus propios datasets es una práctica accesible que te enseña mucho más que simplemente descargar datos listos. Cuando creas un dataset para practicar, entiendes el contexto de los datos, aprendes a estructurar variables con propósito y practicas la limpieza en condiciones reales.
Un dataset simple sobre tus gastos del mes o las películas que has visto puede ser el punto de partida de un portafolio de proyectos sólido.
Y si quieres recorrer ese camino con una ruta estructurada, proyectos reales y acompañamiento, el programa de Data Science de TripleTen está diseñado justo para llevarte desde los primeros datos hasta un portafolio listo para el mercado laboral.