Ir al contenido principal

Data Mining Parte I

Con el paso de cada segundo, la cantidad de información crece de forma exponencial, por ejemplo, durante el tiempo que usted ha leído este articulo, varias personas  han llamado a una central telefónica a registrar, actualizar y dejar nueva información sobre sus transacciones, todo esto se suma a la gran montaña de información que se esta acumulando desde hace años  la cual va cambiando segundo a segundo. Este crecimiento  de la data es tan solo comparable con la expansión acelerada del universo. Ante este panorama un poco desalentador para las empresas, se enfrentan al reto de poder almacenar de forma eficiente los datos, para luego poderlos administrar y tomar decisiones acertadas sobre el negocio. 

La parte de Hardware y Software empiezan a ser muy relevantes para tener un control efectivo de la data, tener uno o varios servidores lo suficientemente robusto con la capacidad de almacenaje, procesamiento y eficiencia se convierte en un pilar fundamental a la hora de manejar datos; esto debe ir acompañando de excelentes programas que permita extraer, clasificar, modelar la información realmente importante, que permita hacer la diferencia entre un antes y un después  con poca información, esto nos lleva al concepto de  data niminig  lo cual se asemeja a la extracción de oro, que para obtener un gramo del importante metal se debe extraer varias toneladas. para tener buenos resultados se recomienda seguir los siguientes pasos, los cuales no pretenden ser una receta pero si ser una guía.

  1. Disponibilidad y accesibilidad de la información.
  2. Identificar la cantidad de datos basura que tenemos los cuales pueden estar sesgando nuestra información.
  3. Cantidad suficiente de datos  correctos que permitan un  análisis de estos.
  4. Se debe contar con expertos familarizados con los datos de tal manera que ellos nos permitan traducir y conocer la funcionalidad de muchas variables.
En el siguiente articulo les estaré escribiendo mas sobre Data Mining .

Comentarios

Entradas populares de este blog

Importación de un archivo csv utilizando SAS Vs R Vs Python

E n el siguiente articulo, se realizara una comparación entre tres software, en cuanto a la velocidad, cantidad de caracteres del código, lógica y entendimiento de los lenguajes. Acá los resultados: El Archivo Se trata de un documento .CSV, llamado CaseStudy1. Y son datos de empleados de una compañía, la tabla contiene 8 variables y 424 registros. Figura 1: Tabla CaseStudy1 Importación SAS: Para importar el archivo usando SAS, es necesario clarificar que se esta trabajando desde un servidor llamado  On Demand For Academic, la cual es una interfaz de mi PC hacia SAS que se conecta vía web a un servidor a estados unidos. Abrir la version web de SAS que es el SAS Studio. Introducir el usuario y contraseña.  Figura 2: Credenciales Le damos clic en la area del SAS Studio, la cual nos va a llevar a version web de SAS. Como no es posible leer los archivos directamente desde mi equipo es necesario realizar un puente para poder importar los datos, para lo cual es

Un Gráfico de pastel para elecciones presidenciales 2010 en Colombia que no suma el 100%.

No se si este sumando mal pero a este grafico de pastel no le da el 100%; al parecer le falta un 8.4%. Y al parecer el 23.3% de Sanin ocupa más espacio en la torta que los demás candidatos. fuente: http://www.laopinion.com.co/noticias/index.php?option=com_content&task=view&id=347881&Itemid=31

Fácil y desde cero, Minería de datos. Aplicaciones casos reales. (Arboles)

Un banco quiere tener un modelo estadístico, en el cual permita medir el riesgo de realizar un préstamo hipotecario (pagos e impagos de la deuda), para poder cuantificar este riesgo se va a tener en cuenta una serie de variables que según el científico de datos puede llegar a ser relevantes.Para esto se selecciona una muestra representativa de la población de usuarios del banco. Los datos describen el comportamiento de cada cliente al corte de un periodo dado, de tal manera que se tendrá dentro de la muestra personas que están al día  o en mora con su crédito hipotecario. A continuación se realizará una descripción de las variables que quizás puedan influenciar en el resultado del modelo. En resumen, son variables que indican numero de obligaciones, en diferentes cortes de tiempo, cantidad de consultas a la centrales de riesgo, porcentajes de deudas, saldos de deudas, tiempos trascurridos desde el ultimo pago etc ... Siguiendo la metodología de minería de datos lo prime