Este blog se centrará en la asignatura "Estadística y Tecnología de la Información y Comunicación".
Lo usaré para poner entradas acerca del temario que demos en las clases o acerca de otros temas que sean de interés y tengan relación con la estadística.

sábado, 8 de junio de 2013

Intervalo de confianza y tipos de muestreo.

Esta entrada es la continuación de la última entrada, que correspondía al tema 9. En esta ocasión voy a definir qué es el intervalo de confianza, el nivel de confianza y el muestreo, y mostraré un esquema de los tipos de muestreo que hay.
  • Intervalo de confianza: Es un medio para conocer el parámetro en una población midiendo el error aleatorio. Está formado por un par de nºs entre los que se estima que estará cierto valor desconocido con una determinada probabilidad de acierto. Se calcula considerando que el estimador muestral sigue una distribución normal, como se establece en la teoría central del límite.
  • Nivel de confianza: Es la probabilidad de éxito en la estimación. Se representa por 1 - alfa.
El nivel de confianza y la amplitud del intervalo varían conjuntamente. Cuanto más amplio sea un intervalo, más posibilidades de acierto (mayor nivel de confianza) habrá.
  • Muestreo: Método tal que al escoger un grupo pequeño de una población podamos tener un grado de probabilidad de que ese pequeño grupo posea las características que estamos estudiando.
En el siguiente esquema podemos ver los tipos de muestreo:
 
 
 
 

jueves, 6 de junio de 2013

Estadística inferencial: Teorema central del límite

En esta entrada he decidido poneros un video que vimos en clase acerca de una de las partes más importantes de la bioestadística. En él, trata los conceptos que dimos en el tema 9 de la asignatura, entre ellos explica el Teorema Central del Límite, una de las bases de la estadística inferencial.

Considero que se entiende bastante bien y lo explica mucho mejor de lo que lo podría hacer yo, así que aquí o lo dejo:




miércoles, 5 de junio de 2013

Distribución normal y medidas de asimetría y curtosis.

En la segunda parte del tema 8, estuvimos viendo cuál es la distribución normal que se usa en estadística.
 
La distribución de Gauss es la distribución normal que se usa como referencia, ya que es la distribución de probabilidad de variable continua que ´con más frecuencia se da en fenómenos reales. Su gráfica corresponde a la campana de Gauss:
 
 
En el punto medio de la campana se concentran la media, la mediana y la moda. El punto de inflexión corresponde con la desviación típica. Los valores de los extremos son valores aislados, que dentro de la campana representan el 0,1 %.
 
Una distribución normal sigue los siguiente principios básicos:
  • Media 3 veces la desviación típica (S)= 99,73% de las observaciones.
  • Media  2,58 x S = 99% de las observaciones.
  • Media  2 x S = 95,45% de las observaciones.
  • Media  1,96 x S = 95% de las observaciones.
  • Media  1 x S = 68,26% de las observaciones.
Asimetría: Hace referencia al grado en que los datos se reparten por encima y por debajo de la tendencia central. La distribución puede ser: asimétrica hacia la izquierda (asimétrica negativa cuando As < 0), simétrica (si As = 0) o asimétrica hacia la derecha (asimétrica positiva cuando As > 0).
 
 
 
Curtosis: Hace referencia al grado de apuntamiento de una distribución.
  • Si Cr > 0, la distribución es leptocúrtica.
  • Si Cr = 0, la distribución es mesocúrtica.
  • Si Cr < 0, la distribución es platicúrtica.
 
 
 

martes, 4 de junio de 2013

Medidas de tendencia central, de posición y de dispersión.

En esta nueva entrada comentaré los aspectos que para mí son más importantes de la primera parte del tema 8 de la asignatura, haciendo un pequeño resumen de éste.
 
MEDIDAS DE TENDENCIA CENTRAL: Son los valores típicos o representativos de un conjunto de datos. Me centraré en 3 de ellas:
  • Media (media aritmética): Es el centro de gravedad de nuestros datos y se calcula para variables cuantitativas. Considera todos los valores de la variable.
  • Mediana (Me): Es el punto para el que la distancia media a los valores de la muestra es mínima. Se calcula para variables cuantitativas. Sólo tiene en cuenta la posición de los valores en la muestra. Si hay más de una mediada, se toma el punto medio entre la mediana mayor y la más pequeña.
  • Moda (Mo): Es el valor con mayor frecuencia, es decir, el que se repite más veces. Si hay más de una se dice que la variable es multimodal. Se calcula para cualquier tipo de variable.
 
MEDIDAS DE POSICIÓN: Se calculan para variables cuantitativas y sólo tienen en cuenta la posición de los valores en la muestra. Son los llamados "cuantiles" y pueden ser:
  • Cuartiles: Ordenan la muestra en 4 partes:
    • Q1 (primer cuartil): al menos el 25% de los datos son menores o iguales que él.
    • Q2 (segundo cuartil): al menos 50% de los datos menos o iguales que él (corresponde a la mediana).
    • Q3 (tercer cuartil): al menos el 75% de los datos son menores o iguales que él.
    • Q4 (cuarto cuartil): es el mayor valor que se alcanza en la muestra.
  • Deciles: Dividen la muestra ordenada en 10 partes.
  • Percentiles: Ordenan la muestra en 100 partes. En este caso, Q1 = P25 y Q3 = P75.
 
MEDIDAS DE DISPERSIÓN: Se usan para variables cuantitativas y se definen para variables no agrupadas. Hablaré de 3 de ellas:
  • Rango o recorrido (R): Es la diferencia entre el mayor y el menor valor de la muestra.
  • Desviación típica (S): Cuantifica el error que cometemos si representamos una muestra únicamente por su media.
  • Varianza muestral: Desviación típica al cuadrado.
 
 
Y esto es todo. Próximamente me centraré en la segunda parte de este tema 8.


 
(A partir de ahora publicaré las entradas más seguidas, ya que el plazo que tenemos para hacer el blog es hasta el 14 de Junio).

jueves, 30 de mayo de 2013

Representaciones gráficas.

Para hacer esta entrada voy a basarme en la segunda parte del tema 7, en la que vimos como se pueden representar los datos a través de gráficas. Así que para ello, voy a explicar y a enseñaros los tipos de gráficas que más se usan normalmente:
  • DIAGRAMA DE BARRAS: En el eje OX se representan los valores de las variables levantando una barra longitudinal que es igual a la frecuencia relativa.
 
  • PICTOGRAMA: Figuras cuya área es la frecuencia del valor que representan.
 
  • GRÁFICO DE SECTORES: Se divide un círculo en sectores proporcionales a la frecuencia relativa de un valor.
 
  • HISTOGRAMA (representación más frecuente con datos agrupados): Está formado por un grupo de rectángulos cuyas bases coinciden con el intervalo que representan y cuyos valores aparecen en el eje OX (el área del rectángulo debe ser igual a la frecuencia relativa del intervalo).
 
  • POLÍGONO DE FRECUENCIAS: Se obtiene uniendo los puntos medios de los extremos superiores de los rectángulos que forman el histograma.
 
  • DIAGRAMA DE TRONCO O TALLO Y HOJAS: Si los datos son 2 dígitos, a la izquierda (en el tronco o tallo) aparece la cifra de las decenas, a la derecha separadas por una línea aparecen las hojas y se escriben todas seguidas. Si hay 3 dígitos el tallo está formado por los dos primeros.
 
 
Considero que la parte de la representación de datos es la más "divertida" de todo el proceso que se lleva a cabo cuando se realiza un estudio y se obtienen los resultados de éste.
 
 

domingo, 26 de mayo de 2013

Estadística y tipos de variables.

Con esta entrada, lo que pretendo es que quede claro el concepto de estadística y los tipos de variables que existen y que podemos usar en el estudio que queramos realizar. Para ello me voy a centrar en lo que vimos en la primera parte del tema 7 de la asignatura.

ESTADÍSTICA: Cuerpo de conocimientos para aprender de la experiencia y poner en números las respuestas de las personas para poder relacionarlas. Según la RAE, se define en una de las acepciones como "estudio de los datos cuantitativos de la población, de los recursos naturales e industriales, del tráfico o de cualquier otra manifestación de las sociedades humanas", otra acepción la define como "rama de las matemáticas que utiliza grandes conjuntos de datos numéricos para obtener inferencias basadas en el cálculo de probabilidades".

 
VARIABLE: Magnitud cuyos valores están determinados por las leyes de la probabilidad, como los puntos resultantes de la tirada de un dado (def. RAE). Hay dos tipos:

 

La etapa empírica de la investigación

Antes del examen parcial vimos los temas 6 y 7, de los cuales hablaré en esta entrada y en las siguientes que haga próximamente.

El tema 6 es un tema muy amplio. En él dimos, la clasificación de estudios, el algoritmo de clasificación de estudios analíticos y las medidas de frecuencia.

En esta entrada me voy a centrar sobre todo en la clasificación de estudio y las medidas de frecuencia.


CLASIFICACIÓN DE ESTUDIOS SEGÚN:

 
 
 
MEDIDAS DE FRECUENCIA:
  • Prevalencia: Proporción de población que ya tiene "enfermedad" en un punto específico en el tiempo. Adopta valores en 0 y 1. La magnitud de asociación que le corresponde es la razón de prevalencia, que relaciona la prevalencia de los expuestos y los no expuestos.
  • Incidencia: Describe la frecuencia de nuevos casos que ocurre durante un período de tiempo. La magnitud de asociación de ésta es el riesgo relativo (razón de incidencia), que mide la relación entre los expuestos y los no expuestos.
  • Odds ratio: Se usa en el estudio de casos y controles y la población ya está "enferma". Mide la relación entre la razón de los casos y la razón de los no casos.
 
A la hora de llegar a una conclusión, hay que tener en cuenta lo siguiente:
  • Si la razón de prevalencia (RP) o el riesgo relativo (RR) da como resultado 1 (RP o RR = 1), no hay asociación, por lo que se da por válida la hipótesis nula (h₀).
  • Si RP o RR < 1, se rechaza la h₀ y se acepta una de las hipótesis alternativas.
  • Si RP o RR = 0 (o muy próxima), hay más enfermos entre los no expuestos que entre los expuestos.
  • Si RP o RR > 1, se rechaza la h₀ y se acepta la otra hipótesis alternativas.