Entradas

Mostrando las entradas etiquetadas como datos aleatorios

Generación de datos aleatorios con Dataframe

Imagen
Para hacer pruebas, especialmente cuando de habla de optimización, es muy útil poder generar una tanda de datos aleatorios con cierto control. Lo primero que se nos viene a la cabeza es crear una lista muy grande y distribuirla, pero... Esto es un problema si quieres crear 10 millones de registros. Función Spark.range Esta función de spark nos permite crear un dataframe con una columna id, tendrá tantos registros como le indiquemos. import org.apache.spark.sql.SparkSession object GeneradorAleatorio { def main(args: Array[String]): Unit = { val spark = SparkSession .builder .appName("GeneradorAleatorio") .getOrCreate() val df_1M = spark.range(1000000) } } Con esto, ya tenemos un dataframe con 1 millon de registros con un id incremental, desde 0 hasta 999.999. La creación de las columnas la haremos mediante UDFs (o cualquier otra funcionalidad de los dataframe). Veamos algunos ejemplos de columnas útiles, qué columnas crear depend...

Entradas populares de este blog

Agregaciones básicas en Spark

Optimizar joins: Tabla de hechos y tabla de dimensión cruzadas

Generación de datos aleatorios con Dataframe