jueves, 14 de junio de 2012

ASOCIACION ENTRE VARIABLES ORDINALES, METODO DE CORRELACION DE SPERMAN

Correlación de Spearman





La correlación de Spearman (rs) es una medida de relación lineal entre dos variables. Se diferencia de la correlación de Pearson en que utiliza valores medidos a nivel de una escala ordinal. Si alguna de las variables está medida a nivel de escala de intervalo/razón deberá procederse antes de operar el estadístico a su conversión en forma ordinal.
 
 

Por ejemplo, si tenemos las siguientes variables:
 
   X      Y
   7      4
   5      7
   8      9
   9      8

Al convertilas en una escala ordinal obtendriamos los resultados:

   X      Y
   2      1
   1      2
   3      4
   4      3

El primer valor de X (en este caso 7) se convierte en 2 porque el 7 es el segundo valor más pequeño de X. El valor en X de 5 se convierte en 1 porque es el más pequeño.
La formula clásica suele expresarse como:

Obteniendose las diferencias de rangos en primer lugar:
  di   di2

  --------
  2-1   1
  1-2   1
  3-4   1
  4-3   1
  --------
        4

                                       6*4
y operando la formula anterior = 1 - _______ = 0.60
                                     4(16-1)


Nota: La correlación de Spearman puede ser calculada con la formula de de Pearson si antes hemos transformado las puntuaciones en rangos.

Por ejemplo, utilizando la formula de Pearson para típicas:

     Zx       Zy       Zx*Zy
  ---------------------------
   -.38730  -1.16190    .45
  -1.16190   -.38730    .45
    .38730   1.16190    .45
   1.16190    .38730    .45
                     --------
                       1.80

ASOCIACION ENTRE VARIABLES DE INTERVALOS: METODO DE CORRELACION, MOMENTO DE PEARSON

Correlación de Pearson


La correlación entre dos variables refleja el grado en que las puntuaciones están asociadas. La formulación clásica, conocida como correlación producto momento de Pearson, se simboliza por la letra griega rho,  cuando ha sido calculada en la población. Si se obtiene sobre una muestra, se designa por la letra "rxy".
 
Este tipo de estadístico puede utilizarse para medir el grado de relación de dos variables si ambas utilizan una escala de medida a nivel de intervalo/razón (variables cuantitativas).
La formula suele aparecer expresada como:


-La primera expresión se resuelve utilizando la covarianza y las desviaciones típicas de las dos variables (en su forma insesgada).
-La segunda forma se utiliza cuando partimos de las puntuaciones típicas empíricas.

Este estadístico, refleja el grado de relación lineal que existe entre dos variables. El resultado numérico fluctua entre los rangos de +1 a -1.
    Una correlación de +1 significa que existe una relación lineal directa perfecta (positiva) entre las dos variables. Es decir, las puntuaciones bajas de la primera variable (X) se asocian con las puntuaciones bajas de la segunda variable (Y), mientras las puntuaciones altas de X se asocian con los valores altos de la variable Y.


    Una correlación de -1 significa que existe una relación lineal inversa perfecta (negativa) entre las dos variables. Lo que significa que las puntuaciones bajas en X se asocian con los valores altos en Y, mientras las puntuaciones altas en X se asocian con los valores bajos en Y.




    Una correlación de 0 se interpreta como la no existencia de una relación lineal entre las dos variables estudiadas.


    MEDIDAS DE ASOCIACION

    En estadística hay datos cualitativos y cuantitativos para las pruebas de 1, 2 y 3 o más variables. Típicos estadísticos de asociación son la regresión y la correlación, que a su vez se divide en datos cardinales y ordinales.


     

    Ejemplos de estadísticos de asociación

    Las tablas de contingencia y la matriz de correlación de tabulaciones cruzadas. Estos dos ejemplos de estadísticos miden asociaciones entre dos tablas de características con dos diferentes tratamientos y se pueden usan conjuntamente y son no parametricas, sino establecemos probabilidades.


    la correlación indica la fuerza y la dirección de una relación lineal y proporcionalidad entre dos variables estadísticas. Se considera que dos variables cuantitativas están correlacionadas cuando los valores de una de ellas varían sistemáticamente con respecto a los valores homónimos de la otra: si tenemos dos variables (A y B) existe correlación si al aumentar los valores de A lo hacen también los de B y viceversa. La correlación entre dos variables no implica, por sí misma, ninguna relación de causalidad



     



    Fuerza, sentido y forma de la correlación

    La relación entre dos super variables cuantitativas queda representada mediante la línea de mejor ajuste, trazada a partir de la nube de puntos. Los principales componentes elementales de una línea de ajuste y, por lo tanto, de una correlación, son la fuerza, el sentido y la forma:
    • La fuerza extrema según el caso, mide el grado en que la línea representa a la nube de puntos: si la nube es estrecha y alargada, se representa por una línea recta, lo que indica que la relación es fuerte; si la nube de puntos tiene una tendencia elíptica o circular, la relación es débil.
    • El sentido mide la variación de los valores de B con respecto a A: si al crecer los valores de A lo hacen los de B, la relación lopositiva; si al crecer los valores de A disminuyen los de B, la relación es negativa.
    • La forma establece el tipo de línea que define el mejor ajuste: la línea recta, la curva monotónica o la curva no monotónica.
    •  
    •  
       
       

    Coeficientes de correlación

    Existen diversos coeficientes que miden el grado de correlación, adaptados a la naturaleza de los datos. El más conocido es el coeficiente de correlación de Pearson (introducido en realidad por Francis Galton), que se obtiene dividiendo la covarianza de dos variables por el producto de sus desviaciones estándar. Otros coeficientes son:
    • Coeficiente de correlación de Spearman
    • Correlación canónica
    • Coeficiente de Correlación Intraclase
    •  
    •  
       

     

    Interpretación geométrica

    Dados los valores muestrales de dos variables aleatorias X (x_1, \ldots, x_n) e Y (y_1, \ldots, y_n), que pueden ser consideradas como vectores en un espacio a n dimensiones, puden construirse los "vectores centrados" como:

    X (x_1 - \bar x, \ldots, x_n - \bar x) e Y (y_1 - \bar y, \ldots, y_n - \bar y).

    El coseno del ángulo alfa entre estos vectores es dada por la fórmula siguiente:

    \cos(\alpha) = \dfrac{\displaystyle \sum_{i=1}^N (x_i - \bar x)\cdot(y_i - \bar y)}{\sqrt{\displaystyle \sum_{i=1}^N (x_i - \bar x)^2}\cdot\sqrt{\displaystyle \sum_{i=1}^N (y_i - \bar y)^2}}

    Pues \cos(\alpha) es el coeficiente de correlación muestral de Pearson. El coeficiente de correlación es el coseno entre ambos vectores centrados:

    • Si r = 1, el ángulo \alpha = 0°, ambos vectores son colineales (paralelos).
    • Si r = 0, el ángulo \alpha = 90°, ambos vectores son ortogonales.
    • Si r =-1, el ángulo \alpha = 180°, ambos vectores son colineales de dirección opuesto.

    Más generalmente: \alpha = \arccos(r).
    Por supuesto, del punto vista geométrica, no hablamos de correlación lineal: el coeficiente de correlación tiene siempre un sentido, cualquiera si que sea su valor entre -1 y 1. Nos informa de modo preciso, no tanto sobre el grado de dependencia entre las variables, que sobre su distancia angular en la hiperesfera a n dimensiones.
    La Iconografía de las correlaciones es un método de análisis multidimensional que reposa en esta idea. La correlacion lineal se da cuando en una nube de puntos estos se encuentran o se distribuyen alrededor de una recta.

     Distribución del coeficiente de correlación

     

     

    El coeficiente de correlación muestral de una muestra es de hecho una varible aleatoria, eso significa que si repetimos un experimento o consideramos diferentes muestras se obtendrán valores diferentes y por tanto el coeficiente de correlación muestral calculado a partir de ellas tendrá valores ligeramente diferentes. Para muestras grandes la variación en dicho coeficiente será menor que para muestras pequeñas. R. A. Fisher fue el primero en determinar la distribución de probabilidad para el coeficiente de correlación.
    Si las dos variables aleatorias que trata de relacionarse proceden de una distribución gaussiana bivariante entonces el coeficiente de correlación r sigue una distribución de probabilidad dada por:


    f\left(r\right) = \frac{\left(n - 2\right)\, \mathbf{\Gamma}\left(n - 1\right) \left(1 - \rho^2\right)^{\frac{n - 1}{2}} \left(1 - r^2\right)^{\frac{n - 4}{2}}}{\sqrt{2\pi}\, \mathbf{\Gamma}\left(n - \frac{1}{2}\right) \left(1 - \rho r\right)^{n - \frac{3}{2}}} \,\mathbf{_2F_1}\left(\frac{1}{2}, \frac{1}{2}; \frac{2n - 1}{2}; \frac{\rho r + 1}{2}\right)

    donde:
    \mathbf{\Gamma} es la distribución gamma
    \,\mathbf{_2F_1}(a,b;c;z) es la función gaussiana hipergeométrica.
     
    Nótese que E\left(r\right) = \rho - \frac{\rho \left(1 - \rho^2\right)}{2 \left(n - 1\right)} + \cdots , por tanto r es estimador sesgado de \,\rho.
    Puede obtenerse un estimador aproximado no sesgado resolviendo la ecuación:

    r = E\left(r\right) = \rho - \frac{\rho \left(1 - \rho^2\right)}{2 \left(n - 1\right)} for \,\rho

    Aunque, la solucón:


    \breve{\rho} = r \left[1 + \frac{1 - r^2}{2\left(n - 1\right)}\right]

    es subóptima. Se puede obtener un estimador sesgado con mínima varianza para grandes valores de n, con sesgo de orden \frac{1}{n - 1} buscando el máximo de la expresión:

    \log{f\left(r\right)}, i.e. \hat{\rho} = r \left[1 - \frac{1 - r^2}{2\left(n - 1\right)}\right]

    En el caso especial de que \,\rho = 0, la distribución original puede ser reescrita como:


    f\left(r\right) = \frac{\left(1 - r^2\right)^{\frac{n - 4}{2}}}{\mathbf{B}\left(\frac{1}{2}, \frac{n - 2}{2}\right)}


    donde \mathbf{B} es la función beta

    Diagrama de dispersión

        
     

    Un diagrama de dispersión es un tipo de diagrama matemático que utiliza las coordenadas cartesianas para mostrar los valores de dos variables para un conjunto de datos.
    Los datos se muestran como un conjunto de puntos, cada uno con el valor de una variable que determina la posición en el eje horizontal y el valor de la otra variable determinado por la posición en el eje vertical. Un diagrama de dispersión se llama también gráfico de dispersión.

     Descripción

     


    Se emplea cuando una variable está bajo el control del experimentador. Si existe un parámetro que se incrementa o disminuye de forma sistemática por el experimentador, se le denomina parámetro de control o variable independiente = eje de x y habitualmente se representa a lo largo del eje horizontal.

    La variable medida o dependiente = eje de y usualmente se representa a lo largo del eje vertical. Si no existe una variable dependiente, cualquier variable se puede representar en cada eje y el diagrama de dispersión mostrará el grado de correlación (no causalidad) entre las dos variables.

    Un diagrama de dispersión puede sugerir varios tipos de correlaciones entre las variables con un intervalo de confianza determinado. La correlación puede ser positiva (aumento), negativa (descenso), o nula (las variables no están correlacionadas). Se puede dibujar una línea de ajuste (llamada también "línea de tendencia") con el fin de estudiar la correlación entre las variables.

     Una ecuación para la correlación entre las variables puede ser determinada por procedimientos de ajuste. Para una correlación lineal, el procedimiento de ajuste es conocido como regresión lineal y garantiza una solución correcta en un tiempo finito.





    Uno de los aspectos más poderosos de un gráfico de dispersión, sin embargo, es su capacidad para mostrar las relaciones no lineales entre las variables. Además, si los datos son representados por un modelo de mezcla de relaciones simples, estas relaciones son visualmente evidentes como patrones superpuestos.

    El diagrama de dispersión es una de las herramientas básicas de control de calidad, que incluyen además el histograma, el diagrama de Pareto, la hoja de verificación, los gráficos de control, el diagrama de Ishikawa y el (diagrama de flujo).

    miércoles, 13 de junio de 2012

    PROCEDIMIENTO DE CALIFICACION

    CALIFICACIÓN DEL DESEMPEÑO POR VARIABLE

    Se encuentra dentro de la categoría “Matrices” y muestra una calificación cuantitativa del desempeño individual de cada SLA con respecto a cada unade las variables.




    “CALIFICACIÓN DEL DESEMPEÑO POR VARIABLE”.


    En esta visualización, se presentan con un símbolo “~” aquellos campos enlos cuales el usuario no introdujo ningún dato, en otras palabras, este dato esdesconocido para el sistema y formará parte de la incertidumbre delresultado final.





    .
     DESEMPEÑO INDIVIDUAL POR VARIABLE


    Pertenece también a la categoría de las “Matrices” y combina la calificaciónobtenida de cada variable por un SLA con la importancia o el nivel deinfluencia de cada una de ellas. Es la representación en pantalla de la matrizinterna “Ponderado”.







    DESEMPEÑO GLOBAL
    Está incluido dentro de la categoría de los “Vectores”. Reúne la totalidad delos valores mencionados con anterioridad e indica la respuesta general delSLA frente a las condiciones planteadas por el usuario. Estos valores son presentados también dentro de la ventana “SELECCIÓNFINAL”.


    martes, 12 de junio de 2012

    MEDIDAS DE DISPERSION Y VARIABILIDAD

    Las medidas de dispersión, también llamadas medidas de variabilidad, muestran la variabilidad de una distribución, indicando por medio de un número, si las diferentes puntuaciones de una variable están muy alejadas de la mediana media. Cuanto mayor sea ese valor, mayor será la variabilidad, cuanto menor sea, más homogénea será a la mediana media.



    Así se sabe si todos los casos son parecidos o varían mucho entre ellos.

    Para calcular la variabilidad que una distribución tiene respecto de su media, se calcula la media de las desviaciones de las puntuaciones respecto a la media aritmética.

    Pero la suma de las desviaciones es siempre cero, así que se adoptan dos clases de estrategias para salvar este problema. Una es tomando las desviaciones en valor absoluto (Desviación media) y otra es tomando las desviaciones al cuadrado (Varianza).




    El conocimiento de la forma de la distribución y del respectivo promedio de una colección de valores de una variable, puede servir para tener una idea bastante clara de la conformación, pero no de de la homogeneidad de cada una de los valores con respecto a la medida de tendencia central aplicada.

    En el caso de las variables con valores que pueden definirse en términos de alguna escala de medida de igual intervalo, puede usarse un tipo de indicador que permite apreciar el grado de dispersión o variabilidad existente en el grupo de variantes en estudio.




    A estos indicadoresles llamamos medidas de dispersión, por cuanto que están referidos a la variabilidad que exhiben los valores de las observaciones, ya que si no hubiere variabilidad o dispersión en los datos interés, entonces no habría necesidad de la gran mayoría de las medidas de la estadística descriptiva.

    Las medidas de tendencia central tienen como objetivo el sintetizar los datos en un valor representativo, las medidas de dispersión nos dicen hasta que punto estas medidas de tendencia central son representativas como síntesis de la información.

    Las medidas de dispersión cuantifican la separación, la dispersión, la variabilidad de los valores de la distribución respecto al valor central. Distinguimos entre medidas de dispersión absolutas, que no son comparables entre diferentes muestras y las relativas que nos permitirán comparar varias muestras.



    EL RANGO O RECORRIDO ( R ):


    Es la medida de variabilidad más fácil de calcular. Para datos finitos o sin agrupar, el rango se define como la diferencia entre el valor más alto (Xn ó Xmax.) y el mas bajo (X1 ó Xmin) en un conjunto de datos.



    Rango para datos no agrupados;
    R = Xmáx.-Xmín = Xn-X1


    Ejemplo:
    Se tienen las edades de cinco estudiantes universitarios de Ier año, a saber: 18,23, 27,34 y 25., para calcular la media aritmética (promedio de las edades, se tiene que:


    R = Xn-X1 ) = 34-18 = 16 años


    Con datos agrupados no se saben los valores máximos y mínimos. Si no hay intervalos de clases abiertos podemos aproximar el rango mediante el uso de los límites de clases. Se aproxima el rango tomando el limite superior de la última clase menos el limite inferior de la primera clase.

    Rango para datos agrupados;
    R= (lim. Sup. de la clase n – lim. Inf. De la clase 1)



    Desviación Intercuartil.

    Esta medida de dispersión se construye basándose en la diferencia entre el tercer y primer cuartil. En realidad es la mitad de esa diferencia.
    Si se escribe Q1 y Q3 para el primer y tercer cuartil respectivamente, entonces la 'desviación intercuartil' está definida por:


    Esta estadística cumple una función similar a la desviación estádar, pero es mucho más resistente al efecto de valores extremos en los datos.

    De hecho, los cuartiles primero y tercero dejan entre sí la mitad de la muestra, La otra mitad se encuentra fuera y por lo tanto la presencia de un bajo número de datos extremos no cambia el valor de la desviación intercuartil.


    se denomina rango intercuartílico o rango intercuartil, a la diferencia entre el tercer y el primer cuartil de una distribución. Es una medida de la dispersión estadística.
    A diferencia del rango, se trata de un estadístico robusto.


     

     

    Definición

     

    El rango intercuartílico es una medida de variabilidad adecuada cuando la medida de posición central empleada ha sido la mediana. Se define como la diferencia entre el tercer cuartil (Q3) y el primer cuartil (Q1), es decir: RQ = Q3 - Q1. A la mitad del rango intercuartil se le conoce como desviación cuartil (DQ): DQ = RQ/2= (Q3 - Q1)/2.
    Se usa para construir los diagramas de caja y bigote (box plots) que sirven para visualizar la variabilidad de una variable y comparar distribucionesde la misma variable; además de ubicar valores extremos