Ir al contenido principal

Modelando en la minería de datos: Arboles de decisión

Antes de entrar al tema de arboles de decisión, se tratará de explicar el termino de modelo.

Un modelo es la abstracción de una realidad palpable, representada por medio de algoritmos matemáticos y apoyada por potentes software informáticos, lo cual se ha convertido en una imperiosa necesidad para los diferentes sectores de análisis del mundo.


El modelo estadístico pretende cumplir esto, por medio de una simple igualdad matemática, que en la mayoría de casos esta compuesta por una relación en donde interviene un error.

A lo largo de la historia se han podido clasificar en tres grupos los modelos estadísticos.
  • Modelos asociativos: Estos modelos pretenden identificar un orden de acontecimientos, que permitan describir a tiempo una cadena de sucesos, por ejemplo: ¿que serie de sucesos pasa para que un suscriptor cancele un servicio televisivo?.
    • Primero llama, luego va personalmente a quejarse,  después manda una carta,... (¿?)...., por ultimo cancela. Estos modelos permiten clarificar y resolver el orden de importancia de los eventos que suceden para que se de un resultado de deserción.

  • Modelos de agrupación: Identifica patrones que permiten agrupar variables o registros en grupos homogéneos dentro de si y heterogéneos entre los conjuntos de datos. Este tipo de modelos es utilizado bastante en el área de mercadeo;  lo primero es  identificar  las variables mas relevantes, que hacen que un grupo de cliente sea diferente a los demás, lo cual me permita segmentar y poder elaborar campañas especificas a grupo objetivo, teniendo en cuenta las características propias de mi población segmentada.

  • Modelos predictivos: Son modelos que permiten pronosticar a un futuro lo que va a pasar, teniendo en cuenta patrones y sucesos del pasado, un ejemplo son las series de tiempo.


La ecuación del modelo estadístico esta dividida en dos partes:
Variables Dependientes.
Variables Independientes.
La parte dependiente son todas las variables que conocemos y que en conjunto pretenden explicar  afectar o predecir, las variable(s) independientes. Ejemplo :
factores que inciden en el valor del precio del petróleo,
En tema de identificación y prevención de: RIESGO, FRAUDE, DESERCIÓN, CORRUPCIÓN, etc.  


      – Control de enfermedades.
      –Deserción de clientes.
      –Compra de Productos.

      –Crediticio.
      –Identificación de patrones delictivos.





por lo tanto los Arboles de decisión,  son la manera gráfica y analítica de clasificación jerárquica que nos permite tomar la mejor decisión desde un punto de vista probabilístico.
Sirven para:
Segmentar.
Predecir.
Ordenar.
Reducir variables.
Identificación de interacciones.
Fusión categorías.
Re categorización variables continuas.

•El Algoritmo utilizado es:
CHAID:  Técnica 1980. (CHisquared Automatic Interaction Detection).

debe de tener cantidades responsables de números de datos.   

Ventajas:
Permite clasificar jerárquica mente las variables que mas se relaciona con la variable dependiente.
La segunda técnica mas utilizada en la minería de datos.
Es una técnica flexible se puede utilizar variables cualitativas y cuantitativas.
Permite resumir fácilmente las correlaciones mas importantes.
Se aplica en casi todos los sectores.



Comentarios

Entradas populares de este blog

Importación de un archivo csv utilizando SAS Vs R Vs Python

E n el siguiente articulo, se realizara una comparación entre tres software, en cuanto a la velocidad, cantidad de caracteres del código, lógica y entendimiento de los lenguajes. Acá los resultados: El Archivo Se trata de un documento .CSV, llamado CaseStudy1. Y son datos de empleados de una compañía, la tabla contiene 8 variables y 424 registros. Figura 1: Tabla CaseStudy1 Importación SAS: Para importar el archivo usando SAS, es necesario clarificar que se esta trabajando desde un servidor llamado  On Demand For Academic, la cual es una interfaz de mi PC hacia SAS que se conecta vía web a un servidor a estados unidos. Abrir la version web de SAS que es el SAS Studio. Introducir el usuario y contraseña.  Figura 2: Credenciales Le damos clic en la area del SAS Studio, la cual nos va a llevar a version web de SAS. Como no es posible leer los archivos directamente desde mi equipo es necesario realizar un puente para poder importar los datos, para l...

Un Gráfico de pastel para elecciones presidenciales 2010 en Colombia que no suma el 100%.

No se si este sumando mal pero a este grafico de pastel no le da el 100%; al parecer le falta un 8.4%. Y al parecer el 23.3% de Sanin ocupa más espacio en la torta que los demás candidatos. fuente: http://www.laopinion.com.co/noticias/index.php?option=com_content&task=view&id=347881&Itemid=31

Fácil y desde cero, Minería de datos. Aplicaciones casos reales. (Arboles)

Un banco quiere tener un modelo estadístico, en el cual permita medir el riesgo de realizar un préstamo hipotecario (pagos e impagos de la deuda), para poder cuantificar este riesgo se va a tener en cuenta una serie de variables que según el científico de datos puede llegar a ser relevantes.Para esto se selecciona una muestra representativa de la población de usuarios del banco. Los datos describen el comportamiento de cada cliente al corte de un periodo dado, de tal manera que se tendrá dentro de la muestra personas que están al día  o en mora con su crédito hipotecario. A continuación se realizará una descripción de las variables que quizás puedan influenciar en el resultado del modelo. En resumen, son variables que indican numero de obligaciones, en diferentes cortes de tiempo, cantidad de consultas a la centrales de riesgo, porcentajes de deudas, saldos de deudas, tiempos trascurridos desde el ultimo pago etc ... Siguiendo la metodología de minería de datos lo p...