Control estadístico de procesos
Diseño de experimentos
Jordi Cuadros, Lucinio González
Noviembre de 2018

Análisis y mejora del proceso

Pasos en la mejora del proceso

  • Caracterización del problema de mejora
    • Identificación del problema o la variable de respuesta
    • Root-cause analysis, identificación de las posibles causas
    • Priorización de las posibles causas
  • Investigación: Obtención de datos y toma de decisiones
    • Diseño de experimentos
      • Estudios de un factor
      • Diseños de múltiples factores
    • Experimentos ex-post-facto: Minería de datos y análisis correlacionales.

Caracterización del problema de mejora

Identificación del problema o la variable de respuesta

  • Todo proceso de mejora empieza identificando el objeto de esta mejora
    • Incidente
    • Valor de una característica del proceso o del producto
    • Petición de mejora
  • Para su análisis cuantitativo, esta variable tendrá que ser cuantificada de una forma u otra. Es conveniente por tanto, dotar la misma de una expresión numérica.

Root-cause Analysis

  • Una vez identificada la respuesta objeto de estudio o mejora, debe analizarse qué variables/factores pueden estar influyendo en el valor de la misma.
  • Para ello se usan distintas técnicas de tipo cualitativo que conforman lo que se conoce como RCA (Root-cause analysis). Todas ellas pretenden llegar a obtener un listado relativamente exhaustivo de aquello que pueda haber producido un determinado resultado o efecto o bien a la causa cuya eliminación permite evitar que pueda repetirse el problema.

Técnicas para el RCA

  • 5 Why’s
  • Diagrama de espina de pez, Fishbone diagram (or diagrama de Ishikawa)
  • FMEA/FMECA (Failure mode, effects and criticality analysis)

5 Why’s

https://www.youtube.com/watch?v=JmrAkHafwHI

5 Why’s

  • Establecer un equipo de trabajo.
  • Preguntarse el porqué hasta encontrar causas actuables (últimas).
  • Seguir varias causas si aparecen más de una.
  • Identificar actuaciones a los distintos niveles. Distribuir esfuerzos y costes en los distintos niveles.
  • NUNCA dejar como causas últimas errores individuales. Las causas siempre estan en los procesos.

Referencias adicionales

Diagrama de espina de pez

https://www.youtube.com/watch?v=RkPBiAUGo-M

Diagrama de espina de pez

https://sites.ualberta.ca/~yreshef/orga432/fishbone.html

Referencias adicionales

Priorización de causas o Criticality analysis

Estrategias como el diagrama de espina de pez generan un número generalmente importante de posibles causas ante un fenómeno. Es necesario a continuación priorizar de forma reflexiva su estudio y/o resolución.

Existen distintas estrategias de priorización:

MIL-STD-882E. System Safety.

MIL-STD-882E. System Safety.

MIL-STD-882E. System Safety.

Investigación

Necesidad de investigar

Una vez identificadas las causas potenciales de un determinado suceso o efecto a menudo es necesario recopilar más datos o más información para…

  • Determinar si una causa potencial tiene efecto real en el resultado
  • Establecer la importancia relativa de distintos factores
  • Determinar valores óptimos de cada factor

Ello implica investigar.

Tipos de investigación

En este curso se discutirán

  • Investigación experimental: Diseño de experimentos
  • Investigación ex-post-facto: Análisis correlacional

Investigación experimental

Objetivos en un diseño experimental

  • MAXIMIZAR el efecto
    • MAXIMIZAR la variabilidad de la variable independiente
  • MINIMIZAR el error de medida
    • Detallar el proceso de determinación de la variable dependiente
    • Usar instrumentos fiables
    • Tamaño de muestra grande
    • Homogeneidad de las muestras
  • CONTROLAR las variables intervinientes
    • CONSTANCIA
    • ALEATORIZACIÓN
    • BLOQUEO
    • TRATAMIENTO ESTADÍSTICO

Proceso de un diseño experimental

  • Identificar las variables experimentales
  • Establecer los niveles de las variables
  • Establecer el proceso experimental
  • Establecer la hipótesis experimental y las hipótesis estadísticas
  • Recoger datos
  • Ejecutar la prueba estadística más adecuada
  • Concluir

Identificar las variables experimentales

  • Pasos previos
    • Identificada la variable o función respuesta
    • Identificados los posibles factores
    • Priorizados los más importantes
  • De los factores priorizados
    • ¿Cuáles pueden ser controlados y van a ser incluidos en el diseño experimental?
    • ¿Cuáles pueden ser constantes?
    • ¿Cuáles pueden ser aleatorizados?
    • ¿Cuáles pueden bloquearse?

Establecer los niveles de las variables

  • Se denominan niveles los distintos valores de la variables experimental que van a ser incluidos en el experimento. Se suelen tratar como variable discreta (factor).

  • Debe considerarse:

    • El rango de validez del factor
    • El número de niveles a usar (habitualmente 2 a no ser que haya sospechas de no-linealidad)
    • El coste; da más información la realización secuencial de experimentos que la realización de un experimento con más niveles.
  • Si la variable es cualitativa, se usan los valores habituales (más comunes) de la variable.
  • Si la variable es cuantitativa,
    • Se suele establecer niveles equiespaciados (si son más de 2) y suficientemente separados en el dominio de validez del factor (MAX),
    • Es habitual evitar los extremos para minimizar el riesgo de estar fuera del dominio experimental.

Establecer el proceso experimental

  • El número de variables experimentales y bloqueadas (y el número de experiencias que es posible realizar) establecerá el tipo de diseño experimental a usar
  • Veremos en esta sesión y en las siguientes:
    • Diseños de un factor
    • Diseños factoriales completos de varios factores
    • Diseños factoriales fraccionados y saturados

Establecer las hipótesis y ejecutar la prueba estadística más adecuada

  • Para resolver el experimento, debe concretarse una hipótesis experimental.
  • Esta hipótesis experimental se traduce a dos hipótesis estadísticas:
    • la hipótesis nula, y
    • la hipótesis alternativa.
  • El diseño usado, las hipótesis estadísticas y la naturaleza de los datos, permiten establecer una prueba estadística adecuada.
  • Se comprueban los supuestos de la prueba y se lleva a cabo la misma (si los supuestos se cumplen) .

Diseños experimentales de un factor

Aspectos generales y tipos

  • Criterios generales
    • Con repetición
    • Balanceados
    • Completamente aleatorizados (orden aleatorio de los experimentos)
  • Diseños de un factor
    • Dos niveles con datos apareados
    • Dos niveles con muestras independientes
    • Más de dos niveles

Diseño de un factor con dos niveles - datos apareados

Corresponde a aquella situación en la que cada observación puede hacerse para los dos niveles del factor manteniéndose constantes todas las variables que corresponden al individuo evaluado. Ello permite reducir la variabilidad experimental.

El análisis de este diseño se realiza en dos pasos:

  1. Estudio de la normalidad de las diferencias
    • Prueba de Shapiro-Wilk, shapiro.test(...)
    • Gráfico QQ, ggplot(... aes(sample=...)) + geom_qq(...)
  2. Inferencia sobre la media (o la mediana) de la distribución de las diferencias
    • Prueba t (para variables normalmente distribuidas), t.test(...)
    • Prueba de Wilcoxon, wilcox.test(...)

Ejemplo

En el control de calidad de una industria de fabricación de jácenas, se ha decidido comparar dos métodos para determinar la resistencia a la cizalla de las bigas producidas.

De acuerdo con los datos que figuran en el fichero ‘vigas.txt’, determina si ambos métodos de determinación pueden considerarse equivalentes.

Viga Metodo1 Metodo2
1 0.986 1.061
2 0.951 0.992
3 1.122 1.063
4 1.139 1.062
5 1.000 1.065
6 1.202 1.178
7 1.165 1.037
8 1.337 1.086
9 1.359 1.052
datos$Dif <- datos$Metodo1 - datos$Metodo2
shapiro.test(datos$Dif)
## 
##  Shapiro-Wilk normality test
## 
## data:  datos$Dif
## W = 0.91678, p-value = 0.3663
ggplot(datos, aes(sample=Dif)) +
  geom_qq() + geom_qq_line() + theme_classic()

t.test(datos$Dif)
## 
##  One Sample t-test
## 
## data:  datos$Dif
## t = 1.6408, df = 8, p-value = 0.1395
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
##  -0.02995774  0.17773552
## sample estimates:
##  mean of x 
## 0.07388889
wilcox.test(datos$Dif)
## 
##  Wilcoxon signed rank exact test
## 
## data:  datos$Dif
## V = 34, p-value = 0.2031
## alternative hypothesis: true location is not equal to 0

Diseño de un factor con dos niveles - datos independientes

Corresponde a aquella situación en que las observaciones para un nivel no tienen relación con las observaciones para el segundo nivel.

En este caso, es frecuente querer comparar los valores centrales o/y las variabilidades correspondientes a ambos niveles de la variable independiente.

El análisis para la comparación de los valores centrales se realiza en dos pasos:

  1. Estudio de la normalidad para cada nivel
    • Prueba de Shapiro-Wilk, shapiro.test(...)
    • Gráfico QQ, ggplot(... aes(sample=...)) + geom_qq(...)
  2. Inferencia sobre las medias (o las medianas) de los niveles
    • Prueba t de Welch (para variables normalmente distribuidas), t.test(...)
    • Prueba de Mann-Whitney (o de Wilcoxon), wilcox.test(...)

Para la comparación de las variabilidades se procede del modo siguiente:

  1. Estudio de la normalidad para cada nivel
    • Prueba de Shapiro-Wilk, shapiro.test(...)
    • Gráfico QQ, ggplot(... aes(sample=...)) + geom_qq(...)
  2. Inferencia sobre las varianzas de los resultados de ambos niveles
    • Prueba F (para variables normalmente distribuidas), var.test(...)
    • Prueba de Levene (o de Brown–Forsythe), car::leveneTest(...)

Ejemplo

En una papelera, se ha decidido modificar la composición de las fibras usadas para la fabricación del papel para valorar si una mayor proporción de fibras de eucalipto, da lugar a un papel con mejores propiedades mecánicas (y menor variabilidad en las mismas).

Los resultados de la resistencia a la tracción para distintas producciones (en psi) se muestran en el fichero ‘papel.txt’.

¿Qué conclusiones puedes sacar de los mismos?

Prop Resist
5 7
5 10
5 11
5 9
5 11
5 7
5 6
5 8
5 14
5 10
5 12
Prop Resist
5 14
5 11
5 11
20 29
20 20
20 29
20 16
20 27
20 26
20 23
20 23
datos <- read.table("papel.txt", sep="\t", header=TRUE)
datos$Prop <- factor(datos$Prop)
ggplot(datos, aes(x=Prop,y=Resist)) +
  geom_boxplot() +
  theme_classic()

by(datos$Resist,datos$Prop,shapiro.test)
## datos$Prop: 5
## 
##  Shapiro-Wilk normality test
## 
## data:  dd[x, ]
## W = 0.9454, p-value = 0.4919
## 
## --------------------------------------------------------- 
## datos$Prop: 20
## 
##  Shapiro-Wilk normality test
## 
## data:  dd[x, ]
## W = 0.92599, p-value = 0.4803
t.test(datos$Resist ~ datos$Prop,
       alternative = "less")
## 
##  Welch Two Sample t-test
## 
## data:  datos$Resist by datos$Prop
## t = -8.0859, df = 9.4013, p-value = 7.818e-06
## alternative hypothesis: true difference in means between group 5 and group 20 is less than 0
## 95 percent confidence interval:
##       -Inf -10.88299
## sample estimates:
##  mean in group 5 mean in group 20 
##         10.07143         24.12500
var.test(datos$Resist ~ datos$Prop,
       alternative = "greater")
## 
##  F test to compare two variances
## 
## data:  datos$Resist by datos$Prop
## F = 0.29336, num df = 13, denom df = 7, p-value = 0.973
## alternative hypothesis: true ratio of variances is greater than 1
## 95 percent confidence interval:
##  0.08262762        Inf
## sample estimates:
## ratio of variances 
##          0.2933563

Conclusiones

Un mayor proporción de fibras de eucalipto parece dar lugar a un papel más resistente. La variabilidad del proceso, respecto a esta propiedad, no parece disminuir.

Diseño de un factor con más de dos niveles

Corresponde a aquella situación en que se desea establecer si más de dos valores de la variable independiente llevan a resultados equivalentes.

Estos resultados pueden ser equivalentes en cuanto a sus valores centrales o/y sus variabilidades.

El análisis para la comparación de los valores centrales se realiza en dos pasos:

  1. Estudio de la normalidad para cada nivel
    • Prueba de Shapiro-Wilk, shapiro.test(...)
    • Gráfico QQ, ggplot(... aes(sample=...)) + geom_qq(...)

Esta prueba se puede substituir por una prueba de normalidad de los residuales a posteriori.

  1. Inferencia sobre las medias (o las medianas) de los niveles
    • Anova de Welch (para variables normalmente distribuidas), oneway.test(...)
    • Prueba de Kruskal-Wallis, kruskal.test(...)

Para la comparación de las variabilidades se procede del modo siguiente:

  1. Estudio de la normalidad para cada nivel
    • Prueba de Shapiro-Wilk, shapiro.test(...)
    • Gráfico QQ, ggplot(... aes(sample=...)) + geom_qq(...)
  2. Inferencia sobre las varianzas de los resultados de ambos niveles
    • Prueba de Bartlett (para variables normalmente distribuidas), bartlett.test(...)
    • Prueba de Levene (o de Brown–Forsythe), car::leveneTest(...)

Ejemplo

En la empresa donde estás haciendo las prácticas, estan evaluando la posibilidad de cambiar el proveedor de los pernos que usáis en el proceso de fabricación.

Han recibido ofertas de tres proveedores y entre las distintas consideraciones a tener en cuenta está la resistencia a la tracción de los mismos. Hechos los experimentos pertinentes para muestras aleatorias de 12 pernos de cada proveedor, fichero ‘pernos.txt’, ¿se puede afirmar que tienen la misma resistencia a la tracción (en MN m-2)? ¿y la misma variabilidad en esta propiedad?

Diseños experimentales de más de un factor

Diseño factor a factor (OFAT)

El diseño consiste en realizar distintos experimentos de un factor manteniendo constantes los demás factores que desea estudiarse.

Diseño factor a factor - Problemas

Cuando el proceso tiene más de un factor identificado como variable experimental (o como bloqueo), el análisis factor a factor (diseños de 1 factor) resulta demasiado costoso y poco eficiente

  • Requiere demasiado experimentos
  • No aprovecha toda la experimentación para reducir el error de medida
  • No permite evaluar el efecto de las interacciones
  • No facilita la reutilización de experiencias para la ampliación de los estudios experimentales

Objetivos de los diseños factoriales

Se denominan diseños factoriales, aquellos diseños experimentales que incorporan más de un factor (variable experimental).

https://www.itl.nist.gov/div898/handbook/pri/section3/pri33.htm

Tipos de diseños factoriales

  • Diseños factoriales completos
    • … de 2 niveles, con y sin repetición
    • … con más de 2 niveles en algun factor
  • Diseños factoriales fraccionados
    • Diseños factoriales saturados
    • Diseños de Plackett-Burman
  • Diseños para superfícies de respuestas
    • Diseños centrales compuestos
    • Diseños de Box-Behnken

Diseños factoriales completos de dos niveles

Simbología y terminología

  • Se indican como 2k, donde k es el número de factores y el resultado de 2k, el número de experimentos a realizar.
  • Se suelen usar letras mayúsculas (A-Z) para identificar los factores.
  • Para cada factor, existe un nivel bajo (que no se indica) y un nivel alto (que se indica en minúsculas). Un conjunto de niveles para cada factor establece unas condiciones experimentales.

Matriz de diseño

  • Consiste en el conjunto de condiciones experimentales que deben ser experimentadas.
  • En un diseño factorial completo, corresponde a todas las combinaciones de niveles de los distintos factores.
  • Suele construirse de acuerdo con el orden de Yates…

Para 23

A B C
- - - -
a + - -
b - + -
ab + + -
c - - +
ac + - +
bc - + +
abc + + +

 

En estos diseños se cumple que

  • En el análisis de cada factor, es el resto de los factores están bloqueados.
  • Cada nivel de cada factor, se experimenta más de una vez.
  • Para cada factor, los dos niveles están balanceados.

Interacciones

  • Las interacciones corresponden a la presencia/ausencia simultánea de dos o más factores.
  • Se calculan multiplicando las columnas correspondientes a los factores implicados.
  • En un diseño factorial completo las columnas de los factores y de las interacciones son todas ortogonales entre sí. Es decir que puede estudiarse el efecto de todos los factores y de todas las interacciones.
  • El estudio de cada interacción también está balanceado, implica múltiples observaciones en cada nivel y mantiene bloqueados los demás factores e interacciones.

Diseño factorial - Realización de los experimentos

  • En orden aleatorio, para evitar problemas de autocorrelación
  • Si se hacen réplicas estas deben ser completamente genuinas. Deben abordarse como ensayos independientes

Los resultados se añaden a la matriz de diseño del diseño experimental.

Análisis de un diseño factorial - Método de los efectos

  • Para cada nivel de cada factor se calcula el promedio de los resultados experimentales
  • El efecto (de un factor, efecto principal, o de una interacción) se estima como

\[ \\ Ef_{FoI} = {\bar y}_{FoI+} - {\bar y}_{FoI-}\]

Para facilitar el análisis se suelen usar tres tipos de representaciones gráficas

  • Gráficos de los efectos (principales)
  • Gráficos de las interacciones de primer orden
  • Diagrama de Pareto

Análisis de un diseño factorial - Consideraciones

Son consideraciones habituales en el análisis de los diseños factoriales completos

  • Las interacciones de más de dos factores no son relevantes … aunque cuidado con las combinaciones críticas
  • Las interacciones de dos factores solo son relevantes si lo son los factores (principio de la herencia) … aunque cuidado con los óptimos
  • Cuando un efecto no es relevante puede excluirse del análisis y tratar los resultados como si se tratara de réplicas.

Ejemplo

Estudia el efecto de los distintos factores en el rendimiento de plantas de pallar (Phaseolus lunatus). Los datos están recogidos en el archivo ‘bean.csv’.

Los factores considerados son:

  • A: profundidad de plantado: -, 0,5 in; +, 1,5 in
  • B: número de riegos por día: -, 1; +, 2
  • C: tipo de semilla: -, baby; +, grande

Problema adaptado de Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.

A B C Rep1 Rep2 Rep3
-1 -1 -1 6 7 6
1 -1 -1 4 5 5
-1 1 -1 10 9 8
1 1 -1 7 7 6
-1 -1 1 4 5 4
1 -1 1 3 3 1
-1 1 1 8 7 7
1 1 1 5 5 4

Matriz de diseño con interacciones y respuestas

datos <- gather(datos,"rep","yield",Rep1:Rep3)

datos$AB <- datos$A * datos$B
datos$AC <- datos$A * datos$C
datos$BC <- datos$B * datos$C
datos$ABC <- datos$A * datos$B * datos$C

datos$rep <- NULL
datos <- cbind(datos[,-4],yield=datos[,4])
A B C AB AC BC ABC yield
-1 -1 -1 1 1 1 -1 6
1 -1 -1 -1 -1 1 1 4
-1 1 -1 -1 1 -1 1 10
1 1 -1 1 -1 -1 -1 7
-1 -1 1 1 -1 -1 1 4
1 -1 1 -1 1 -1 -1 3
-1 1 1 -1 -1 1 -1 8
1 1 1 1 1 1 1 5
-1 -1 -1 1 1 1 -1 7
1 -1 -1 -1 -1 1 1 5
-1 1 -1 -1 1 -1 1 9
1 1 -1 1 -1 -1 -1 7

Cálculo de los efectos

efectos <- datos[,1:7] * datos[,8]
efectos <- colSums(efectos) / 12
efectos
##          A          B          C         AB         AC         BC        ABC 
## -2.1666667  2.5000000 -2.0000000 -0.3333333 -0.1666667  0.1666667  0.0000000
mediasA <- datos %>% group_by(A) %>% summarise(media=mean(yield))
colnames(mediasA)[1] <- "nivel"
mediasA$factor <- "A"

mediasB <- datos %>% group_by(B) %>% summarise(media=mean(yield))
colnames(mediasB)[1] <- "nivel"
mediasB$factor <- "B"

mediasC <- datos %>% group_by(C) %>% summarise(media=mean(yield))
colnames(mediasC)[1] <- "nivel"
mediasC$factor <- "C"

medias <- rbind(mediasA,mediasB,mediasC)
ggplot(medias,aes(x=factor(nivel),y=media,group=1))+
  geom_point() +
  geom_line() +
  facet_grid(.~factor)+
  theme_classic()

interacciones <- datos %>% group_by(A,B) %>% 
  summarise(media=mean(yield))

ggplot(interacciones, 
       aes(x=factor(A),y=media,color=factor(B),group=factor(B))) +
  geom_point() +
  geom_line() +
  theme_classic()
## `summarise()` has grouped output by 'A'. You can override using the `.groups` argument.

efectosO <- efectos[order(abs(efectos))]
efectosO <- data.frame(variable=factor(names(efectosO),
                                       levels=names(efectosO)),
                       efecto=efectosO)

ggplot(efectosO,aes(x=variable,y=abs(efecto),fill=efecto>0)) +
  geom_bar(stat="identity",color="black")+
  coord_flip()+
  theme_classic()+
  theme(legend.position="none")

Estimación del error de los efectos

El error estándar de los efectos (\(\ s_{ef}\ \)) puede estimarse medinate distintas estrategias

  • media de las desviación estándar de las repeticiones, dividida por \(\ \sqrt{2^{k-2}·r} \ \)
  • desviación estandár de los residuales, dividido por \(\ \sqrt {2^{k-2}·r} \ \)
  • desviación estándar de los efectos menos significativos o de las interacciones de mayor orden
  • 1,5 veces la mediana del valor absoluto de los efectos cuyo valor absoluto es inferior a 3,75 (2,5 · 1,5) veces la mediana del valor absoluto de todos los efectos

https://onlinecourses.science.psu.edu/stat503/node/36/
https://www.weibull.com/hotwire/issue113/relbasics113.htm

Un efecto es significativo si es mayor, en valor absoluto, que

\[ \\ Ef_{c} = s_{ef} * t_{1-\frac{\alpha}{2}, r·2^k - 2^k}\]

(sef <- 1.5 * median(abs(efectos[abs(efectos) < 
          3.75 * median(abs(efectos))])))
## [1] 0.25
(efc <- sef * qt(0.975, 24 - 8))
## [1] 0.5299763
ggplot(efectosO,aes(x=variable,y=abs(efecto),fill=efecto>0)) +
  geom_bar(stat="identity",color="black")+
  geom_hline(yintercept=efc)+
  coord_flip()+
  theme_classic()+
  theme(legend.position="none")

Análisis de un diseño factorial - Regresión multilineal

Los mismos resultados que se obtienen por el método de los efectos se pueden obtener mediante una regresión lineal multivariante.

Si los factores se codifican como -1 y 1 (como enteros), los coeficientes que se obtienen son la mitad de los efectos correspondientes.

Las fórmulas más comunes son

  • y ~ A+B+C+... , solo efectos principales,
  • y ~ (A+B+C+...)^2 , efectos principales e interacciones de primer orden,
  • y ~ (A+B+C+...)^k , efectos principales e interacciones hasta orden k-1 (debe sustituirse k),
  • y ~ ...+A:B+... , incluir una interacción concreta

También puede analizarse el experimento mediante el uso de regresiones con variables ficticias, pero los resultados suelen ser más difíciles de interpretar debido al uso de referencias distintas al promedio experimental.

ajuste <- lm(yield~(A+B+C)^3,datos)
summary(ajuste)
## 
## Call:
## lm(formula = yield ~ (A + B + C)^3, data = datos)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -1.3333 -0.3333  0.1667  0.4167  1.0000 
## 
## Coefficients:
##               Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  5.667e+00  1.502e-01  37.720  < 2e-16 ***
## A           -1.083e+00  1.502e-01  -7.211 2.08e-06 ***
## B            1.250e+00  1.502e-01   8.321 3.32e-07 ***
## C           -1.000e+00  1.502e-01  -6.656 5.52e-06 ***
## A:B         -1.667e-01  1.502e-01  -1.109    0.284    
## A:C         -8.333e-02  1.502e-01  -0.555    0.587    
## B:C          8.333e-02  1.502e-01   0.555    0.587    
## A:B:C        1.133e-17  1.502e-01   0.000    1.000    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.736 on 16 degrees of freedom
## Multiple R-squared:  0.9128, Adjusted R-squared:  0.8746 
## F-statistic: 23.91 on 7 and 16 DF,  p-value: 2.437e-07
ajuste <- lm(yield~A+B+C,datos)
summary(ajuste)
## 
## Call:
## lm(formula = yield ~ A + B + C, data = datos)
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -1.33333 -0.50000  0.08333  0.54167  1.00000 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)   5.6667     0.1419  39.931  < 2e-16 ***
## A            -1.0833     0.1419  -7.634 2.39e-07 ***
## B             1.2500     0.1419   8.808 2.55e-08 ***
## C            -1.0000     0.1419  -7.047 7.81e-07 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.6952 on 20 degrees of freedom
## Multiple R-squared:  0.9027, Adjusted R-squared:  0.8881 
## F-statistic: 61.84 on 3 and 20 DF,  p-value: 2.691e-10

Ejemplo

Con el objetivo de estudiar el efecto de temperatura (A), pH (B) y velocidad de agitación (C) en el rendimiento de un proceso químico, el ingeniero de planta ha realizado un diseño factorial completo 23.

Los rendimientos obtenidos, en orden de Yates, son los siguientes: 60; 61; 54; 75; 58; 61; 55; 75.

Determina los efectos principales y las interacciones e interpreta los resultados obtenidos.

Problema adaptado de Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.

Diseños factoriales completos de más de 2 niveles por factor

La misma lógica de construcción usada para diseños factoriales completos de 2 niveles puede para diseños en los que intervienen factores con más niveles.

Sin embargo, el coste se incrementa de forma notable y el análisis suele ser algo más complejo.

Si las variables son cuantitativas, suelen evitarse y reservar el estudio de curvaturas para diseño experimental posterior, via diseños específicos o la adición de puntos centrales.

https://www.itl.nist.gov/div898/handbook/pri/section3/pri339.htm

Diseños factoriales fraccionados

Habida cuenta que en muchos casos consideramos como menos relevantes las interacciones, podemos usar las combinaciones de niveles asociadas a una interacción (ortogonales a los factores) para añadir un nuevo factor y determinar su efecto >>> DISEÑOS FRACCIONADOS

\[ \\ 2^{f-c}\\\]

f: factores, c: factores confundidos

Diseños factoriales fraccionados - Matriz del diseño

Ejemplo: 25-1

  • 5 factores
  • 1 de los cuales confundido
  • 24 condiciones experimentales: 16 experimentos, si no hay repetición
  • E = ABCD

Diseños factoriales fraccionados - Relación de definición

Al incorporar un factor como confundido, se producen efectos que no pueden ser diferenciados.

Relación de definición de un diseño fraccionado: Corresponde al producto de factores que da lugar al vector de unidades

  • Para 25-1 y E = ABCD, I = ABCDE
  • Para 25-2 y E = ABC y D = AB, I = ABD = ABCE = CDE
  • Para 25-2 y E = AB y D = AC, I = ABE = ACD = BCDE
  • Para 27-4 y E = AB, D = AC, F = BC, G = ABC, I = ABE = ACD = BCF = ABCG = BCDE = ACEF = ABDF = CEG = BDG = AFG

 

Resolución de un diseño fraccionado: Número de factores de la relación de definición del diseño más corta: III, IV, V…

 

III Factores principales confundidos con interacciones de dos factores
IV Factores principales confundidos con interacciones de tres factores. Las interacciones de dos factores estan confundidas entre sí.
V Factores principales confundidos son interacciones de cuatro factores. Las interacciones de dos factores pueden determinarse.

Diseños factoriales fraccionados - Principales diseños

Number of Factors, k
Design Specification
Number of Runs, N
3
2III3-1
4
4
2IV4-1
8
5
2V5-1
16
5
2III5-2
8
6
2VI6-1
32
6
2IV6-2
16
6
2III6-3
8
Number of Factors, k
Design Specification
Number of Runs, N
7
2VII7-1
64
7
2IV7-2
32
7
2IV7-3
16
7
2III7-4
8
8
2VIII8-1
128
8
2V8-2
64
8
2IV8-3
32
8
2IV8-4
16

https://www.itl.nist.gov/div898/handbook/pri/section3/pri3347.htm

Ejemplo

En un determinado proceso, se está estudiando el rendimiento de la reacción en función de los parámetros siguientes:

  • A: velocidad de alimentación (10 o 15 L/min)
  • B: catalizador (1 o 2 %)
  • C: velocidad de agitación (100 o 120 rpm)
  • D: temperatura (140 o 180 ºC)
  • E: concentración del reactivo (30 o 40 %)

 

Los valores de los distintos experimentos se encuentran en el archivo ‘reactor.csv’.

Selecciona, de estos experimentos, los que corresponden al mínimo diseño que permitiría realizar el estudio, analizalo y compara los resultados con los que se obtienen con el diseño factorial completo.

Problema adaptado de Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.

Diseños factoriales saturados

Son aquellos diseños factoriales fraccionados de resolución III construidos para la evaluación del mayor número posible de factores

  • 23-1 ⇒ 3 factores, 4 experimentos
  • 27-4 ⇒ 7 factores, 8 experimentos
  • 215-11 ⇒ 15 factores, 16 experimentos

Diseños de Plackett-Burman

Consisten en diseños saturados (solo permiten evaluar efectos principales) con 4 k experimentos

  • Se construyen a partir de columnas ortogonales
    • Balanceadas
    • Bloqueo de los demás factores
  • Permiten evaluar los efectos de de 4 k - 1 factores
  • Para números de experimentos que son potencias de 2, coinciden con los diseños factoriales fraccionados saturados
  • En aquellos diseños que no son potencias de 2, las interacciones no se confunden directamente con un factor sino con una combinación lineal de los mismos.

https://en.wikipedia.org/wiki/Plackett%E2%80%93Burman_design

Diseños factoriales fraccionados - Siguientes pasos

  • Eliminar los factores cuyo efecto no es diferenciable del ruido estadístico
  • Desplegar (foldover) el diseño fraccionado ampliando el número de experimentos para resolver las confusiones
    • En resolución III, imagen especular del diseño
    • Cambiar signos en columna/factor
  • Otros diseños más específicos

https://www.itl.nist.gov/div898/handbook/pri/section3/pri338.htm

Diseños para superfícies de respuesta

Adición de puntos centrales

Una recomendación habitual en los diseños factoriales (especialmente en los saturados) consiste en la adición de puntos centrales

  • Entre 3 y 7 puntos
  • Equiespaciados en la secuencia experimental. Si son 3, al principio, en el medio y al final.

Permiten

  • Comprobar la estabilidad del proceso. El resultado debe ser estable
  • Comprobar la existencia de curvatura. La media de los valores centrales debe coincidir con la media de los demás puntos
  • Estimar el error de los efectos (en diseños saturados)

Diseños centrales compuestos de Box-Wilson

Permiten reutilizar los experimentos del diseño factorial completo.

https://www.itl.nist.gov/div898/handbook/pri/section3/pri3361.htm

Diseños de Box-Behnken

Tienen un diseño independiente de los diseños factoriales completos.

https://www.itl.nist.gov/div898/handbook/pri/section3/pri3362.htm

Investigación ex-post-facto

Situación

Corresponde a aquellas investigaciones en las que no es posible modificar las variables influyentes. Parte de valores recogidos de distintas variables sin que se haya podido establecer un control experimental a través de un diseño concreto.

Los estudios se hacen entonces a partir de los datos ya disponibles.

Consideraciones

Estos análisis no permiten inferir causalidad ya que no hay una intervención experimental controlada.

Los análisis correlacionales se basan en observar las relaciones existentes entre variables a partir de

  • Diagramas de dispersión (small multiples)
  • Coeficientes de correlación
  • Modelos de regresión
  • Técnicas de aprendizaje automático (machine learning)

Diagramas de dispersión (small multiples)

http://dataremixed.com/2012/10/interactive-visualizations-or-small-multiples/

Coeficientes de correlación

http://www.sthda.com/english/wiki/visualize-correlation-matrix-using-correlogram

Modelos de regresión

Ya hemos visto durante el curso algunos usos de modelos de regresión (especialmente lineal). Las mismas ideas se aplican en este caso.

Técnicas de aprendizaje automático

El objetivo general de las técnicas de machine learning es poder predecir.

Las técnicas básicas suelen agruparse en

  • Clasificación. Establecer la pertenencia de un individuo a un grupo
  • Regresión. Determinar el valor de una propiedad cuantitativa
  • Clustering. Agrupar en grupos significativos

Referencias

  • ARP9136. Aerospace Series - Root Cause Analysis and Problem Solving (9S Methodology)
  • Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.
  • IEC 60812. Analysis techniques for system reliability – Procedure for failure mode and effects analysis (FMEA)
  • MIL-STD-1629A. Procedures for performing a failure mode, effects and criticality analysis . http://www.barringer1.com/mil_files/MIL-STD-1629RevA.pdf
  • MIL-STD-882E. System Safety. https://www.system-safety.org/Documents/MIL-STD-882E.pdf
  • Montgomery, D. C. (2017). Design and analysis of experiments. John Wiley & Sons.