https://sites.ualberta.ca/~yreshef/orga432/fishbone.html
Estrategias como el diagrama de espina de pez generan un número generalmente importante de posibles causas ante un fenómeno. Es necesario a continuación priorizar de forma reflexiva su estudio y/o resolución.
Existen distintas estrategias de priorización:
MIL-STD-882E. System Safety.
MIL-STD-882E. System Safety.
MIL-STD-882E. System Safety.
Una vez identificadas las causas potenciales de un determinado suceso o efecto a menudo es necesario recopilar más datos o más información para…
Ello implica investigar.
En este curso se discutirán
Se denominan niveles los distintos valores de la variables experimental que van a ser incluidos en el experimento. Se suelen tratar como variable discreta (factor).
Debe considerarse:
Corresponde a aquella situación en la que cada observación puede hacerse para los dos niveles del factor manteniéndose constantes todas las variables que corresponden al individuo evaluado. Ello permite reducir la variabilidad experimental.
El análisis de este diseño se realiza en dos pasos:
shapiro.test(...)ggplot(... aes(sample=...)) + geom_qq(...)t.test(...)wilcox.test(...)En el control de calidad de una industria de fabricación de jácenas, se ha decidido comparar dos métodos para determinar la resistencia a la cizalla de las bigas producidas.
De acuerdo con los datos que figuran en el fichero ‘vigas.txt’, determina si ambos métodos de determinación pueden considerarse equivalentes.
| Viga | Metodo1 | Metodo2 |
|---|---|---|
| 1 | 0.986 | 1.061 |
| 2 | 0.951 | 0.992 |
| 3 | 1.122 | 1.063 |
| 4 | 1.139 | 1.062 |
| 5 | 1.000 | 1.065 |
| 6 | 1.202 | 1.178 |
| 7 | 1.165 | 1.037 |
| 8 | 1.337 | 1.086 |
| 9 | 1.359 | 1.052 |
##
## Shapiro-Wilk normality test
##
## data: datos$Dif
## W = 0.91678, p-value = 0.3663
##
## One Sample t-test
##
## data: datos$Dif
## t = 1.6408, df = 8, p-value = 0.1395
## alternative hypothesis: true mean is not equal to 0
## 95 percent confidence interval:
## -0.02995774 0.17773552
## sample estimates:
## mean of x
## 0.07388889
##
## Wilcoxon signed rank exact test
##
## data: datos$Dif
## V = 34, p-value = 0.2031
## alternative hypothesis: true location is not equal to 0
Corresponde a aquella situación en que las observaciones para un nivel no tienen relación con las observaciones para el segundo nivel.
En este caso, es frecuente querer comparar los valores centrales o/y las variabilidades correspondientes a ambos niveles de la variable independiente.
El análisis para la comparación de los valores centrales se realiza en dos pasos:
shapiro.test(...)ggplot(... aes(sample=...)) + geom_qq(...)t.test(...)wilcox.test(...)Para la comparación de las variabilidades se procede del modo siguiente:
shapiro.test(...)ggplot(... aes(sample=...)) + geom_qq(...)var.test(...)car::leveneTest(...)En una papelera, se ha decidido modificar la composición de las fibras usadas para la fabricación del papel para valorar si una mayor proporción de fibras de eucalipto, da lugar a un papel con mejores propiedades mecánicas (y menor variabilidad en las mismas).
Los resultados de la resistencia a la tracción para distintas producciones (en psi) se muestran en el fichero ‘papel.txt’.
¿Qué conclusiones puedes sacar de los mismos?
| Prop | Resist |
|---|---|
| 5 | 7 |
| 5 | 10 |
| 5 | 11 |
| 5 | 9 |
| 5 | 11 |
| 5 | 7 |
| 5 | 6 |
| 5 | 8 |
| 5 | 14 |
| 5 | 10 |
| 5 | 12 |
| Prop | Resist |
|---|---|
| 5 | 14 |
| 5 | 11 |
| 5 | 11 |
| 20 | 29 |
| 20 | 20 |
| 20 | 29 |
| 20 | 16 |
| 20 | 27 |
| 20 | 26 |
| 20 | 23 |
| 20 | 23 |
## datos$Prop: 5
##
## Shapiro-Wilk normality test
##
## data: dd[x, ]
## W = 0.9454, p-value = 0.4919
##
## ---------------------------------------------------------
## datos$Prop: 20
##
## Shapiro-Wilk normality test
##
## data: dd[x, ]
## W = 0.92599, p-value = 0.4803
##
## Welch Two Sample t-test
##
## data: datos$Resist by datos$Prop
## t = -8.0859, df = 9.4013, p-value = 7.818e-06
## alternative hypothesis: true difference in means between group 5 and group 20 is less than 0
## 95 percent confidence interval:
## -Inf -10.88299
## sample estimates:
## mean in group 5 mean in group 20
## 10.07143 24.12500
##
## F test to compare two variances
##
## data: datos$Resist by datos$Prop
## F = 0.29336, num df = 13, denom df = 7, p-value = 0.973
## alternative hypothesis: true ratio of variances is greater than 1
## 95 percent confidence interval:
## 0.08262762 Inf
## sample estimates:
## ratio of variances
## 0.2933563
Un mayor proporción de fibras de eucalipto parece dar lugar a un papel más resistente. La variabilidad del proceso, respecto a esta propiedad, no parece disminuir.
Corresponde a aquella situación en que se desea establecer si más de dos valores de la variable independiente llevan a resultados equivalentes.
Estos resultados pueden ser equivalentes en cuanto a sus valores centrales o/y sus variabilidades.
El análisis para la comparación de los valores centrales se realiza en dos pasos:
shapiro.test(...)ggplot(... aes(sample=...)) + geom_qq(...)Esta prueba se puede substituir por una prueba de normalidad de los residuales a posteriori.
oneway.test(...)kruskal.test(...)Para la comparación de las variabilidades se procede del modo siguiente:
shapiro.test(...)ggplot(... aes(sample=...)) + geom_qq(...)bartlett.test(...)car::leveneTest(...)En la empresa donde estás haciendo las prácticas, estan evaluando la posibilidad de cambiar el proveedor de los pernos que usáis en el proceso de fabricación.
Han recibido ofertas de tres proveedores y entre las distintas consideraciones a tener en cuenta está la resistencia a la tracción de los mismos. Hechos los experimentos pertinentes para muestras aleatorias de 12 pernos de cada proveedor, fichero ‘pernos.txt’, ¿se puede afirmar que tienen la misma resistencia a la tracción (en MN m-2)? ¿y la misma variabilidad en esta propiedad?
El diseño consiste en realizar distintos experimentos de un factor manteniendo constantes los demás factores que desea estudiarse.
Cuando el proceso tiene más de un factor identificado como variable experimental (o como bloqueo), el análisis factor a factor (diseños de 1 factor) resulta demasiado costoso y poco eficiente
Se denominan diseños factoriales, aquellos diseños experimentales que incorporan más de un factor (variable experimental).
https://www.itl.nist.gov/div898/handbook/pri/section3/pri33.htm
Simbología y terminología
Matriz de diseño
Para 23…
| A | B | C | |
|---|---|---|---|
| - | - | - | - |
| a | + | - | - |
| b | - | + | - |
| ab | + | + | - |
| c | - | - | + |
| ac | + | - | + |
| bc | - | + | + |
| abc | + | + | + |
En estos diseños se cumple que
Los resultados se añaden a la matriz de diseño del diseño experimental.
\[ \\ Ef_{FoI} = {\bar y}_{FoI+} - {\bar y}_{FoI-}\]
Para facilitar el análisis se suelen usar tres tipos de representaciones gráficas
Son consideraciones habituales en el análisis de los diseños factoriales completos
Estudia el efecto de los distintos factores en el rendimiento de plantas de pallar (Phaseolus lunatus). Los datos están recogidos en el archivo ‘bean.csv’.
Los factores considerados son:
Problema adaptado de Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.
| A | B | C | Rep1 | Rep2 | Rep3 |
|---|---|---|---|---|---|
| -1 | -1 | -1 | 6 | 7 | 6 |
| 1 | -1 | -1 | 4 | 5 | 5 |
| -1 | 1 | -1 | 10 | 9 | 8 |
| 1 | 1 | -1 | 7 | 7 | 6 |
| -1 | -1 | 1 | 4 | 5 | 4 |
| 1 | -1 | 1 | 3 | 3 | 1 |
| -1 | 1 | 1 | 8 | 7 | 7 |
| 1 | 1 | 1 | 5 | 5 | 4 |
| A | B | C | AB | AC | BC | ABC | yield |
|---|---|---|---|---|---|---|---|
| -1 | -1 | -1 | 1 | 1 | 1 | -1 | 6 |
| 1 | -1 | -1 | -1 | -1 | 1 | 1 | 4 |
| -1 | 1 | -1 | -1 | 1 | -1 | 1 | 10 |
| 1 | 1 | -1 | 1 | -1 | -1 | -1 | 7 |
| -1 | -1 | 1 | 1 | -1 | -1 | 1 | 4 |
| 1 | -1 | 1 | -1 | 1 | -1 | -1 | 3 |
| -1 | 1 | 1 | -1 | -1 | 1 | -1 | 8 |
| 1 | 1 | 1 | 1 | 1 | 1 | 1 | 5 |
| -1 | -1 | -1 | 1 | 1 | 1 | -1 | 7 |
| 1 | -1 | -1 | -1 | -1 | 1 | 1 | 5 |
| -1 | 1 | -1 | -1 | 1 | -1 | 1 | 9 |
| 1 | 1 | -1 | 1 | -1 | -1 | -1 | 7 |
## A B C AB AC BC ABC
## -2.1666667 2.5000000 -2.0000000 -0.3333333 -0.1666667 0.1666667 0.0000000
mediasA <- datos %>% group_by(A) %>% summarise(media=mean(yield))
colnames(mediasA)[1] <- "nivel"
mediasA$factor <- "A"
mediasB <- datos %>% group_by(B) %>% summarise(media=mean(yield))
colnames(mediasB)[1] <- "nivel"
mediasB$factor <- "B"
mediasC <- datos %>% group_by(C) %>% summarise(media=mean(yield))
colnames(mediasC)[1] <- "nivel"
mediasC$factor <- "C"
medias <- rbind(mediasA,mediasB,mediasC)## `summarise()` has grouped output by 'A'. You can override using the `.groups` argument.
efectosO <- efectos[order(abs(efectos))]
efectosO <- data.frame(variable=factor(names(efectosO),
levels=names(efectosO)),
efecto=efectosO)
ggplot(efectosO,aes(x=variable,y=abs(efecto),fill=efecto>0)) +
geom_bar(stat="identity",color="black")+
coord_flip()+
theme_classic()+
theme(legend.position="none")El error estándar de los efectos (\(\ s_{ef}\ \)) puede estimarse medinate distintas estrategias
https://onlinecourses.science.psu.edu/stat503/node/36/
https://www.weibull.com/hotwire/issue113/relbasics113.htm
Un efecto es significativo si es mayor, en valor absoluto, que
\[ \\ Ef_{c} = s_{ef} * t_{1-\frac{\alpha}{2}, r·2^k - 2^k}\]
## [1] 0.25
## [1] 0.5299763
Los mismos resultados que se obtienen por el método de los efectos se pueden obtener mediante una regresión lineal multivariante.
Si los factores se codifican como -1 y 1 (como enteros), los coeficientes que se obtienen son la mitad de los efectos correspondientes.
Las fórmulas más comunes son
y ~ A+B+C+... , solo efectos principales,y ~ (A+B+C+...)^2 , efectos principales e interacciones de primer orden,y ~ (A+B+C+...)^k , efectos principales e interacciones hasta orden k-1 (debe sustituirse k),y ~ ...+A:B+... , incluir una interacción concretaTambién puede analizarse el experimento mediante el uso de regresiones con variables ficticias, pero los resultados suelen ser más difíciles de interpretar debido al uso de referencias distintas al promedio experimental.
##
## Call:
## lm(formula = yield ~ (A + B + C)^3, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.3333 -0.3333 0.1667 0.4167 1.0000
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 5.667e+00 1.502e-01 37.720 < 2e-16 ***
## A -1.083e+00 1.502e-01 -7.211 2.08e-06 ***
## B 1.250e+00 1.502e-01 8.321 3.32e-07 ***
## C -1.000e+00 1.502e-01 -6.656 5.52e-06 ***
## A:B -1.667e-01 1.502e-01 -1.109 0.284
## A:C -8.333e-02 1.502e-01 -0.555 0.587
## B:C 8.333e-02 1.502e-01 0.555 0.587
## A:B:C 1.133e-17 1.502e-01 0.000 1.000
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.736 on 16 degrees of freedom
## Multiple R-squared: 0.9128, Adjusted R-squared: 0.8746
## F-statistic: 23.91 on 7 and 16 DF, p-value: 2.437e-07
##
## Call:
## lm(formula = yield ~ A + B + C, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.33333 -0.50000 0.08333 0.54167 1.00000
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 5.6667 0.1419 39.931 < 2e-16 ***
## A -1.0833 0.1419 -7.634 2.39e-07 ***
## B 1.2500 0.1419 8.808 2.55e-08 ***
## C -1.0000 0.1419 -7.047 7.81e-07 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.6952 on 20 degrees of freedom
## Multiple R-squared: 0.9027, Adjusted R-squared: 0.8881
## F-statistic: 61.84 on 3 and 20 DF, p-value: 2.691e-10
Con el objetivo de estudiar el efecto de temperatura (A), pH (B) y velocidad de agitación (C) en el rendimiento de un proceso químico, el ingeniero de planta ha realizado un diseño factorial completo 23.
Los rendimientos obtenidos, en orden de Yates, son los siguientes: 60; 61; 54; 75; 58; 61; 55; 75.
Determina los efectos principales y las interacciones e interpreta los resultados obtenidos.
Problema adaptado de Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.
La misma lógica de construcción usada para diseños factoriales completos de 2 niveles puede para diseños en los que intervienen factores con más niveles.
Sin embargo, el coste se incrementa de forma notable y el análisis suele ser algo más complejo.
Si las variables son cuantitativas, suelen evitarse y reservar el estudio de curvaturas para diseño experimental posterior, via diseños específicos o la adición de puntos centrales.
https://www.itl.nist.gov/div898/handbook/pri/section3/pri339.htm
Habida cuenta que en muchos casos consideramos como menos relevantes las interacciones, podemos usar las combinaciones de niveles asociadas a una interacción (ortogonales a los factores) para añadir un nuevo factor y determinar su efecto >>> DISEÑOS FRACCIONADOS
\[ \\ 2^{f-c}\\\]
f: factores, c: factores confundidos
Ejemplo: 25-1
Al incorporar un factor como confundido, se producen efectos que no pueden ser diferenciados.
Relación de definición de un diseño fraccionado: Corresponde al producto de factores que da lugar al vector de unidades
Resolución de un diseño fraccionado: Número de factores de la relación de definición del diseño más corta: III, IV, V…
| III | Factores principales confundidos con interacciones de dos factores |
| IV | Factores principales confundidos con interacciones de tres factores. Las interacciones de dos factores estan confundidas entre sí. |
| V | Factores principales confundidos son interacciones de cuatro factores. Las interacciones de dos factores pueden determinarse. |
https://www.itl.nist.gov/div898/handbook/pri/section3/pri3347.htm
En un determinado proceso, se está estudiando el rendimiento de la reacción en función de los parámetros siguientes:
Los valores de los distintos experimentos se encuentran en el archivo ‘reactor.csv’.
Selecciona, de estos experimentos, los que corresponden al mínimo diseño que permitiría realizar el estudio, analizalo y compara los resultados con los que se obtienen con el diseño factorial completo.
Problema adaptado de Box, G. E., Hunter, J. S., & Hunter, W. G. (2005). Statistics for experimenters: design, innovation, and discovery. 2nd edition. New York: Wiley-Interscience.
Son aquellos diseños factoriales fraccionados de resolución III construidos para la evaluación del mayor número posible de factores
Consisten en diseños saturados (solo permiten evaluar efectos principales) con 4 k experimentos
https://en.wikipedia.org/wiki/Plackett%E2%80%93Burman_design
https://www.itl.nist.gov/div898/handbook/pri/section3/pri338.htm
Una recomendación habitual en los diseños factoriales (especialmente en los saturados) consiste en la adición de puntos centrales
Permiten
Permiten reutilizar los experimentos del diseño factorial completo.
https://www.itl.nist.gov/div898/handbook/pri/section3/pri3361.htm
Tienen un diseño independiente de los diseños factoriales completos.
https://www.itl.nist.gov/div898/handbook/pri/section3/pri3362.htm
Corresponde a aquellas investigaciones en las que no es posible modificar las variables influyentes. Parte de valores recogidos de distintas variables sin que se haya podido establecer un control experimental a través de un diseño concreto.
Los estudios se hacen entonces a partir de los datos ya disponibles.
Estos análisis no permiten inferir causalidad ya que no hay una intervención experimental controlada.
Los análisis correlacionales se basan en observar las relaciones existentes entre variables a partir de
http://dataremixed.com/2012/10/interactive-visualizations-or-small-multiples/
http://www.sthda.com/english/wiki/visualize-correlation-matrix-using-correlogram
Ya hemos visto durante el curso algunos usos de modelos de regresión (especialmente lineal). Las mismas ideas se aplican en este caso.
El objetivo general de las técnicas de machine learning es poder predecir.
Las técnicas básicas suelen agruparse en