Ir al contenido principal

Modelando en la minería de datos: Arboles de decisión

Antes de entrar al tema de arboles de decisión, se tratará de explicar el termino de modelo.

Un modelo es la abstracción de una realidad palpable, representada por medio de algoritmos matemáticos y apoyada por potentes software informáticos, lo cual se ha convertido en una imperiosa necesidad para los diferentes sectores de análisis del mundo.


El modelo estadístico pretende cumplir esto, por medio de una simple igualdad matemática, que en la mayoría de casos esta compuesta por una relación en donde interviene un error.

A lo largo de la historia se han podido clasificar en tres grupos los modelos estadísticos.
  • Modelos asociativos: Estos modelos pretenden identificar un orden de acontecimientos, que permitan describir a tiempo una cadena de sucesos, por ejemplo: ¿que serie de sucesos pasa para que un suscriptor cancele un servicio televisivo?.
    • Primero llama, luego va personalmente a quejarse,  después manda una carta,... (¿?)...., por ultimo cancela. Estos modelos permiten clarificar y resolver el orden de importancia de los eventos que suceden para que se de un resultado de deserción.

  • Modelos de agrupación: Identifica patrones que permiten agrupar variables o registros en grupos homogéneos dentro de si y heterogéneos entre los conjuntos de datos. Este tipo de modelos es utilizado bastante en el área de mercadeo;  lo primero es  identificar  las variables mas relevantes, que hacen que un grupo de cliente sea diferente a los demás, lo cual me permita segmentar y poder elaborar campañas especificas a grupo objetivo, teniendo en cuenta las características propias de mi población segmentada.

  • Modelos predictivos: Son modelos que permiten pronosticar a un futuro lo que va a pasar, teniendo en cuenta patrones y sucesos del pasado, un ejemplo son las series de tiempo.


•La ecuación del modelo estadístico esta dividida en dos partes:
–Variables Dependientes.
– Variables Independientes.
•La parte dependiente son todas las variables que conocemos y que en conjunto pretenden explicar  afectar o predecir, las variable(s) independientes. Ejemplo :
–factores que inciden en el valor del precio del petróleo,
En tema de identificación y prevención de: RIESGO, FRAUDE, DESERCIÓN, CORRUPCIÓN, etc.  


      – Control de enfermedades.
      –Deserción de clientes.
      –Compra de Productos.

      –Crediticio.
      –Identificación de patrones delictivos.





por lo tanto los Arboles de decisión,  son la manera gráfica y analítica de clasificación jerárquica que nos permite tomar la mejor decisión desde un punto de vista probabilístico.
•Sirven para:
–Segmentar.
–Predecir.
–Ordenar.
–Reducir variables.
–Identificación de interacciones.
–Fusión categorías.
–Re categorización variables continuas.

•El Algoritmo utilizado es:
–CHAID:  Técnica 1980. (CHisquared Automatic Interaction Detection).

– debe de tener cantidades responsables de números de datos.   

•Ventajas:
–Permite clasificar jerárquica mente las variables que mas se relaciona con la variable dependiente.
–La segunda técnica mas utilizada en la minería de datos.
–Es una técnica flexible se puede utilizar variables cualitativas y cuantitativas.
–Permite resumir fácilmente las correlaciones mas importantes.
–Se aplica en casi todos los sectores.



Comentarios

Entradas populares de este blog

DATOS DEL AUTOR DEL BLOG

Mi nombre, es Laureano Romero Velásquez soy Estadístico de la Universidad del Valle, esta foto es con el profesor Víctor Guerrero de la UNAM, México (derecha) durante el cursillo Estimación de tendencias de series de tiempo mediante mínimos cuadrados penalizados, en el First International Workshop on Applied Statistics, Universidad Santo Tomas Bogotá Colombia 2009. Este BLOG tendrá como objetivo ser una fuente de discusión de temas estadísticos y como estos influyen en nuestro entorno. Bienvenidos!!!

Sobre la ley 379 de 1997.

Sobre la ley 379 de 1997. Organizando unos archivos empecé a leer la ley que reglamenta la profesión de estadístico en Colombia; y se entiende  como: (…) “la aplicación de los conocimientos y medios de las ciencias, las matemáticas, la informática y las humanidades en el análisis, administración, dirección, supervisión y control de proceso en los cuales se efectúen recolección, ordenamientos, evaluación, control, captura y crítica de la información así mismo en el diseño de modelos matemáticos, económicos y administrativos que se utilizarán en toda entidad pública, privada, universidad, entidad dedicada a la investigación que necesite de este proceso para tomar decisiones” (…) También me llama la atención que la ley obliga a todas las entidades comerciales que manejan  y divulgan información a contratar estadísticos (…) Las firmas comerciales destinadas al tratamiento de información estadística que incluye la recolección, procesamiento, análisis y divulgación...

Como crear un blog

Una de las cosas que hay hacer en la vida además de plantar un árbol es crear un blog por eso, ayer recibí la llamada de una amigo el cual me solicitaba ayuda para crear un blog. A mi amigo y a todo aquel que este interesado, le respondo: Es fácil, y nada complicado montar un blog en la red  además es muy gratificante, es muy similar a crear un perfil en una red social, la diferencia es el objetivo de la pagina, ya que el blog esta dirigido principalmente a promulgar opiniones y conceptos de temas específicos. existen diferentes proveedores tales como Blogger que es una empresa Google ; Wordpress ; Movable Type . Despues de una inscripción, el mismo proveedor nos da las pausas necesarias para personalizar nuestro blog, lo cuales muy sencillo de hacer.