miércoles, 19 de marzo de 2014

Presentaciones con Markdown y knitr


Con RStudio es posible redactar una presentación sencilla y elegante que combine texto, imágenes, código R y sus resultados numéricos y gráficos y todo gracias al paquete knitr y al programa Pandoc.
En primer lugar debemos redactar la presentación con el formato Markdown. Aprender este formato es muy fácil ya que hay muy pocas reglas y sus opciones también son escasas pero suficientes para un documento sencillo. En RStudio tenemos la ayuda pertinente.
Los títulos de cada apartado (con uno o más símbolos #) fijarán el principio de cada nueva diapositiva.
El código R se introduce dentro de un chunk como se ve en la imagen de arriba.
El documento así creado será un documento .Rmd.

A continuación se procesará con el paquete knitr para obtener los archivos .md y HTML. Simplemente hay que hacer clic en el icono con la madeja Knit HTML y se tienen los dos archivos mencionados. Sin embargo, el archivo HTML no es una presentación. Necesitamos el programa Pandoc.
Una vez instalado el programa Pandoc (ver instrucciones más abajo), tomaremos el archivo .md (el markdown) y lo transformaremos en un documento HTML5 así:

system(pandoc -s -S -i -t dzslides -m documento.md -o documento.html)

o también

system(pandoc -s -S -i -t slidy -m documento.md -o documento.html)

Fórmulas LaTeX

En un documento Markdown escrito en RStudio también podemos añadir fórmulas matemáticas en formato LaTeX que se transformarán en imágenes incrustadas en el archivo HTML o en la presentación. Las instrucciones LaTeX deben ir entre dos símbolos $ para una fórmula en la misma línea o entre dos símbolos con doble dólar $$ para una ecuación centrada. Por ejemplo, la instrucción
$$y_{ij} = \mu + \alpha_i + \varepsilon_{ij}$$
se presentará con el siguiente gráfico:
 



En la página del Rincón Matemático podemos ver muchos ejemplos.
También podemos escribir la fórmula con el ratón o el dedo en la página de demostración Web Equation y tomar el código LaTeX cuando el resultado es correcto.

Instalación de knitr

El autor sugiere que instalemos los siguientes paquetes de R:


install.packages(c('knitr', 'XML', 'RCurl'))

Instalación de Pandoc

Los usuarios de Windows están de suerte. Instalar Pandoc en Windows ahora es muy fácil. Se puede hacer desde R con el paquete installr. Una vez instalado este paquete en R, ejecutaremos la instrucción

library(installr)
install.pandoc()


y ya está.
En otros sistemas operativos, como Ubuntu, podemos utilizar el paquete del repositorio (un poco anticuado) o embarcarnos en las instrucciones para bajarnos la última versión:

http://johnmacfarlane.net/pandoc/installing.html

También hay un instalador para Mac OS X.

Referencias

Producing slide shows with Pandoc

http://yihui.name/en/2012/05/how-to-make-html5-slides-with-knitr/

Writing beautiful and reproducible slides quickly


http://www.r-bloggers.com/installing-pandoc-from-r-on-windows/

martes, 14 de enero de 2014

Un ejemplo de ACP paso a paso

Como expliqué en el último artículo, el otro día buscaba información en internet sobre el test de esfericidad de Barlett y el índice KMO con R. Además de los tutoriales de Ricco Rakotomala, también me encontré con un documento propio que había olvidado de una asignatura de Investigación de Mercados que impartí allá por el curso 2001-2002 y anteriores. Se trataba de una asignatura con muy poca Estadística Matemática, pero con mucha Estadística práctica y algunas técnicas multivariantes. En particular, el Análisis de Componentes Principales (ACP).
El ejemplo del documento es un caso muy sencillo con 6 marcas de coches y su valoración media en tres características o variables. Los cálculos estaban hechos con SPSS y un programa llamado DYANE (Diseño y análisis de encuestas) de Miquel Santesmases. Este último es un software muy adecuado por su sencillez para las clases y la investigación en ciencias sociales y de mercados.
Pues bien, la idea ha sido reescribir el ejemplo aportando más explicaciones de los pasos de un ACP y utilizando los resultados y gráficos con R.
Con los siguientes enlaces se pueden descargar tanto el documento completo y el código R, así como las funciones que calculan el test de esfericidad de Bartlett y el índice KMO.

Un ejemplo de ACP paso a paso (PDF)
Código R y funciones

martes, 31 de diciembre de 2013

R en la Universidad de la Luz


Estaba buscando referencias en internet sobre el test de esfericidad de Bartlett y el índice KMO con R cuando me encontré con unos tutoriales muy interesantes relacionados con la Estadística aplicada con R, pero especialmente con "Data mining".
El autor es el profesor Ricco Rakotomalala del Departamento de informática y estadística de la Facultad de Economía de  la Université Lumière Lyon 2. Podéis visitar la página web de sus cursos donde se ofrece material entre otras cosas de Programación R, Data mining, Regresión logística y Econometría. Además nos ofrece una gran variedad de enlaces a recursos como scripts, archivos PDF y datos de diversas fuentes. Todo muy bien organizado.
En particular podemos acceder a TANAGRA, un entorno integrado de métodos de Data mining para Windows. Este proyecto es el sucesor del proyecto SIPINA orientado a implementar varios algoritmos de aprendizaje supervisado.
Últimamente yo no utilizo mucho Windows, pero me ha resultado muy interesante todo el material didáctico que ofrece el proyecto Tanagra en su blog. Aquí podéis hallar Análisis discriminante lineal, Análisis de las componentes principales, Regresión PLS, Análisis de correspondencias, etc.
Sobre el test de esfericidad de Bartlett y el índice KMO hablaremos otro día.

miércoles, 25 de diciembre de 2013

Análisis de la Covarianza con R

ancova_blog.utf8

El Análisis de la Covarianza es una síntesis del Análisis de la Varianza y los métodos de Regresión. Combina por lo tanto, unas variables cualitativas con unas variables cuantitativas. Se trata estudiar las diferencias entre los niveles de un factor o contrastar la significación de algunos factores sobre una variable cuantitativa observable, cuando alguna o algunas variables regresoras, llamadas concomitantes, influyen también en la respuesta.

Desde el punto de vista de la Regresión, se trata de considerar, junto a las variables regresoras cuantitativas, variables predictoras cualitativas, como por ejemplo el sexo, que se califican de categóricas o, más técnicamente, como factores.

El Análisis de la Covarianza tiene las siguientes características (ver Cuadras 1):

  • Tiene en cuenta la influencia de las variables concomitantes sobre la variable observable o respuesta.
  • La variable concomitante es siempre cuantitativa. Cada réplica debe tener asociado un valor de la variable concomitante.
  • Las variables concomitantes no se utilizan como variables de referencia para contrastar hipótesis. Lo que se pretende es eliminar su influencia sobre la variable observable.
  • La varianza del diseño queda reducida al introducir una variable concomitante. Una consecuencia es el aumento de la precisión en las conclusiones.
  • En general se logra simplificar el diseño, reduciendo el número de factores, lo que redundará en un número menor de réplicas.
  • La interpretación del diseño es más fácil cuando los factores sólo influyen en la variable respuesta y no en las variables concomitantes.

En este documento se resuelven algunos ejemplos sencillos con el programa estadístico R.

Para profundizar en la teoría del Análisis de la Covarianza se puede consultar, entre otros, el libro clásico de Snedecor y Cochran 3. Para estudiar modelos lineales avanzados con R se puede leer el libro de J.J. Faraway 2.

Bibliografía

  1. C.M. Cuadras, Problemas de Probabilidades y Estadística. Vol.2:Inferencia Estadística. EUB, 2000.

  2. J.J. Faraway, Linear Models with R, Chapman & Hall/CRC, 2004.

  3. G.W. Snedecor y W.G. Cochran, Statistical Methods, Iowa State University Press, 1989.