Beispiele / 06

Wenn das Ergebnis kein Messwert ist: Schweißnähte mit ordinaler und nominaler Zielgröße

Nicht jede Zielgröße ist eine Zahl. Eine Schweißnaht wird angesehen und eingestuft: Wie viele Spritzer liegen daneben, und welcher Fehler steckt im Schliffbild? Die erste Antwort hat eine Reihenfolge, die zweite nicht. Hier werden 81 Proben bei drei Einstellgrößen geschweißt, die Spritzer mit einem ordinalen Modell und der Nahtfehler mit einem multinomialen Modell ausgewertet, und am Ende steht die Einstellung, bei der eine gute Naht am wahrscheinlichsten ist.

Versuchsplan
3³-Vollfaktorplan, je Einstellung 3 Proben = 81
Modelle
proportionale Odds (ordinal), multinomiales Logit
Faktoren
Strom, Vorschub, Schutzgas
Zielgrößen
2 mit je 4 Kategorien, Bestätigung mit 24 Proben

Die Urteile sind simuliert. Sie stammen aus zwei Modellen, die wir selbst festgelegt haben — für jede Probe wird aus den wahren Wahrscheinlichkeiten eine Kategorie gezogen. So lässt sich am Ende prüfen, ob die Auswertung findet, was wirklich drinsteckt. Alle Tabellen und Diagramme sind mit DoEStat gerechnet und gezeichnet.

Schritt 1 / Aufgabe

Eine Naht, zwei Urteile

Für eine Kehlnaht an Baustahl soll eine MAG-Einstellung gefunden werden, die möglichst oft eine fehlerfreie Naht mit wenig Spritzern liefert. Frei sind drei Größen:

FaktorEinheitniedrigMittehoch
SchweißstromA160200240
Vorschubcm/min304560
Schutzgasmengel/min81420

Jede Probe wird zweimal beurteilt: die Spritzer mit dem Auge auf einer vierstufigen Skala, der Nahtfehler im Schliffbild. Beide Zielgrößen haben vier Kategorien — aber nicht von derselben Art:

ZielgrößeArtKategorien
Spritzerordinal (geordnet)keine < wenige < mäßig < viele
Nahtfehlernominal (ohne Reihenfolge)keiner · Poren · Bindefehler · Einbrandkerbe

„Wenige“ Spritzer liegen zwischen „keinen“ und „mäßig“ — die Stufen sind geordnet, aber ihre Abstände sind nicht bekannt; aus „mäßig“ wird nicht „doppelt so viele wie wenige“. Die Nahtfehler dagegen sind nur benannt: Poren sind nicht „mehr“ als ein Bindefehler, sie haben eine andere Ursache. Diese Unterscheidung entscheidet über das Modell. In DoEStat legt man sie in der Definition der Zielgröße fest: Stufen auflisten, Häkchen „geordnet“ setzen oder nicht.

Auf diese Daten eine Regression zu legen, als wären die Kategorien die Zahlen 1 bis 4, wäre in beiden Fällen falsch: Beim Nahtfehler gibt es keine Reihenfolge, beim Spritzer keine gleichen Abstände. Was sich modellieren lässt, ist die Wahrscheinlichkeit jeder Kategorie in Abhängigkeit von der Einstellung.

Schritt 2 / Planung

Wie viele Proben braucht ein Urteil?

Eine Kategorie trägt weniger Information als ein Messwert. Eine einzelne Probe sagt nur „Poren“ oder „keine Poren“ — die Wahrscheinlichkeit dahinter erfährt man erst aus vielen. Ein Vollfaktorplan mit drei Stufen je Faktor hat 27 Einstellungen; die Frage ist, wie oft jede geschweißt werden muss.

Die Tabelle zeigt, wie oft die Auswertung brauchbar ist, wenn man die ganze Studie hundertmal aus den wahren Modellen zieht. „Auswertbar“ heißt: Das Modell konvergiert, jede Kategorie kommt vor, und keine Schätzung läuft ins Unendliche.

Proben je EinstellungProben gesamtSpritzer (ordinal): auswertbarNahtfehler (nominal): auswertbar
12799 %24 %
254100 %81 %
381100 %96 %
4108100 %97 %

Das ordinale Modell ist genügsam — es schätzt eine Steigung je Faktor, gleich für alle Stufen. Das nominale ist es nicht: Es schätzt für jeden der drei Fehler eigene Steigungen, zwölf Parameter statt sechs. Mit einer Probe je Einstellung ist es in drei von vier Studien nicht auswertbar, mit zwei noch in einer von fünf. Ab drei Proben je Einstellung sind es 96 %, und eine vierte bringt kaum noch etwas. Gewählt sind deshalb 81 Proben.

Was „ins Unendliche laufen“ heißt, ist Trennung: Kommt ein seltener Fehler bei einer Gruppe von Einstellungen nie vor, lässt sich seine Wahrscheinlichkeit dort beliebig nahe an null rücken, und die Schätzung wächst ohne Grenze. DoEStat meldet das in der Auswertung („Trennung vermutet“). Das Problem wird mit jedem zusätzlichen Term größer — ein quadratischer Schutzgas-Term, der in einem Plan mit drei Stufen naheliegt, lässt in derselben Simulation bei 81 Proben nur 45 von 100 nominalen Auswertungen brauchbar, statt 96. Das Modell hier hat deshalb nur Haupteffekte.

Diese Planungsrechnung macht das Beispiel selbst, indem es die Studie aus den wahren Modellen wiederholt. Die Teststärke-Analyse in DoEStat deckt numerische und binomiale Zielgrößen ab, kategoriale mit mehr als zwei Stufen nicht.

Schritt 3 / Versuche

81 Proben, zweimal beurteilt

Die 81 Proben werden in zufälliger Reihenfolge geschweißt. Von ihnen sind nur 22 gut im Sinn der Aufgabe — kein Nahtfehler und höchstens wenige Spritzer. Ausgezählt nach den Stufen jedes Faktors zeigt sich schon vor jedem Modell, wohin es geht:

EinstellungkeinerPorenBindefehlerEinbrandkerbe
Schweißstrom 160 A104130
Schweißstrom 200 A14472
Schweißstrom 240 A105012
Vorschub 30 cm/min16812
Vorschub 45 cm/min12375
Vorschub 60 cm/min62127
Schutzgasmenge 8 l/min9963
Schutzgasmenge 14 l/min11376
Schutzgasmenge 20 l/min14175

Bindefehler häufen sich bei niedrigem Strom und schnellem Vorschub — zu wenig Wärme, die Naht verbindet sich nicht mit dem Grundwerkstoff. Einbrandkerben kommen bei hohem Strom. Poren hängen am Schutzgas: Bei 8 l/min sind sie häufig, bei 20 l/min selten.

Einstellungkeinewenigemäßigviele
Schweißstrom 160 A161100
Schweißstrom 200 A8874
Schweißstrom 240 A09711
Vorschub 30 cm/min91125
Vorschub 45 cm/min7965
Vorschub 60 cm/min8865
Schutzgasmenge 8 l/min61038
Schutzgasmenge 14 l/min8856
Schutzgasmenge 20 l/min101061

Bei den Spritzern dominiert der Strom: Bei 160 A gibt es nie mehr als wenige, bei 240 A keine einzige Probe ohne Spritzer und in zwei Dritteln mäßig oder viele. Wenig Schutzgas macht den Lichtbogen unruhiger.

Alle 81 Proben
ProbeSchweißstrom [A]Vorschub [cm/min]Schutzgasmenge [l/min]SpritzerNahtfehler
12006014mäßigBindefehler
22403014vieleEinbrandkerbe
32406014vieleEinbrandkerbe
4240458vielePoren
52406020mäßigEinbrandkerbe
61603014wenigekeiner
71606020wenigeBindefehler
8240458wenigeEinbrandkerbe
9200308wenigePoren
10240608vieleEinbrandkerbe
11240458vielePoren
121606014keineBindefehler
131603020keinekeiner
14200608keinePoren
15160608keineBindefehler
16160308keinekeiner
171603020keinekeiner
18240308vielekeiner
191606014keineBindefehler
202403020wenigekeiner
211606020keineBindefehler
22160458wenigeBindefehler
232006014keinekeiner
242406020wenigeEinbrandkerbe
251604520keinekeiner
262406014wenigeEinbrandkerbe
272004520vieleBindefehler
281604514keineBindefehler
29200308wenigePoren
302406020mäßigEinbrandkerbe
312006020wenigekeiner
321604514keineBindefehler
332404514wenigeEinbrandkerbe
342003014wenigekeiner
352406014vielekeiner
36240608vieleEinbrandkerbe
372404520wenigePoren
382404520mäßigkeiner
391606020wenigekeiner
40160308keinekeiner
411603014keinePoren
421604520keinekeiner
432003020wenigeEinbrandkerbe
442004514keineEinbrandkerbe
452004514mäßigkeiner
462403020wenigekeiner
472004520mäßigBindefehler
482404520mäßigEinbrandkerbe
491606014keineBindefehler
502404514vielekeiner
51160458wenigeBindefehler
522404514mäßigEinbrandkerbe
53160458keinekeiner
54200308keinePoren
55200458wenigekeiner
562403020mäßigkeiner
57160308wenigePoren
58160608wenigePoren
592003020keinekeiner
602004520keinekeiner
612004514wenigekeiner
62200608vieleBindefehler
63200608mäßigBindefehler
642403014vielekeiner
652003014mäßigkeiner
66240308wenigekeiner
672403014wenigePoren
682006020wenigekeiner
691604514wenigekeiner
702003014vielekeiner
711603014wenigePoren
721604520wenigeBindefehler
731603020keineBindefehler
74160608wenigeBindefehler
752006020keineBindefehler
76240608mäßigkeiner
772006014mäßigBindefehler
78200458mäßigkeiner
79200458vielekeiner
80240308vielePoren
812003020keinekeiner

Schritt 4 / Spritzer

Geordnete Stufen: das Modell der proportionalen Odds

Für eine geordnete Zielgröße wählt DoEStat das kumulative Logit-Modell: Es beschreibt die Wahrscheinlichkeit, höchstens eine bestimmte Stufe zu erreichen. Man kann es sich so vorstellen, dass hinter den vier Stufen eine unsichtbare Spritzneigung steht, die von den Faktoren verschoben wird; drei Schwellen teilen sie in die Stufen ein. Jeder Faktor bekommt eine Steigung, die für alle drei Schwellen gilt — daher „proportionale Odds“.

TermSchätzungStandardfehlerzp-WertWahrer Wert
Schweißstrom1,880,335,73< 0,00011,50
Vorschub0,260,270,970,33420,30
Schutzgasmenge−0,720,27−2,630,0085−0,80

Eine positive Steigung schiebt die Naht zu mehr Spritzern. Der Strom wirkt stark (z = 5,7), das Schutzgas dämpft (p = 0,008), der Vorschub ist nicht nachweisbar (p = 0,33). Die Spalte „Wahrer Wert“ ist der Vergleich mit dem Modell, aus dem die Daten stammen — der Strom wird etwas überschätzt, Richtung und Rangfolge stimmen.

SchwelleSchätzungStandardfehlerWahrer Wert
keine | wenige−1,390,32−1,00
wenige | mäßig0,890,290,80
mäßig | viele2,180,372,40

Trägt die Annahme gleicher Steigungen?

Das Modell behauptet, ein Faktor wirke an jeder Schwelle gleich stark. Ob die Daten das hergeben, prüft der Brant-Test: Er schätzt die drei Schwellen getrennt und vergleicht die Steigungen. Ein kleiner p-Wert hieße, dass ein Faktor etwa zwischen „keine“ und „wenige“ anders wirkt als zwischen „mäßig“ und „viele“ — dann wäre das multinomiale Modell die ehrlichere Wahl.

Termχ²FGp-Wert
Schweißstrom0,0320,9836
Vorschub2,0720,3543
Schutzgasmenge2,7020,2594
Gesamt (Omnibus)5,1960,5198

Kein Faktor widerspricht (gemeinsam p = 0,52). Das ordinale Modell darf bleiben — und es braucht für drei Faktoren drei Steigungen statt neun.

Log-Likelihoodohne FaktorenLikelihood-Quotienten-Test χ² (FG)p-WertMcFadden-R²AIC
−85,8−108,845,9 (3)< 0,00010,211183,7
beobachtet ↓ / vorhergesagt →keinewenigemäßigvieleTreffer
keine1590015 / 24
wenige9130613 / 28
mäßig010040 / 14
viele0401111 / 15
Trefferquote48 %

Die Wahrheitsmatrix vergleicht die beobachtete Stufe mit der wahrscheinlichsten Stufe laut Modell. 48 % Treffer klingen wenig, sind aber das Wesen einer Wahrscheinlichkeit: Bei einer Einstellung mit 45 % „wenige“ und 35 % „keine“ ist „wenige“ die beste Vorhersage und trotzdem oft falsch. „Mäßig“ ist nie die wahrscheinlichste Stufe — sie liegt zwischen zwei Nachbarn, die jeweils häufiger sind. Was das Modell zuverlässig trennt, sind die Enden: Keine Probe mit „keinen“ Spritzern wird als „mäßig“ oder „viele“ vorhergesagt, und umgekehrt.

Schritt 5 / Nahtfehler

Benannte Kategorien: das multinomiale Logit

Ohne Reihenfolge gibt es keine gemeinsame Skala. Das multinomiale Logit vergleicht deshalb jeden Fehler einzeln mit einer Bezugskategorie — hier „keiner“ — und gibt jedem Fehler eigene Steigungen. So darf der Strom Bindefehler verhindern und zugleich Einbrandkerben verursachen, ohne dass sich das gegenseitig aufhebt.

Klasse gegen „keiner“TermSchätzungStandardfehlerp-WertWahrer Wert
PorenAchsenabschnitt−1,520,500,0021−1,20
PorenSchweißstrom0,150,470,74350,00
PorenVorschub−0,470,510,35660,00
PorenSchutzgasmenge−1,420,530,0075−1,60
BindefehlerAchsenabschnitt−1,450,510,0044−1,10
BindefehlerSchweißstrom−1,750,620,0045−2,00
BindefehlerVorschub1,780,530,00091,50
BindefehlerSchutzgasmenge−0,040,440,93010,00
EinbrandkerbeAchsenabschnitt−2,200,750,0032−1,70
EinbrandkerbeSchweißstrom2,350,830,00461,80
EinbrandkerbeVorschub1,050,510,03941,20
EinbrandkerbeSchutzgasmenge0,130,490,78630,00

Jeder Fehler hat seine eigene Ursache, und die Auswertung findet sie: Poren am Schutzgas (−1,42, wahr −1,6), Bindefehler an wenig Strom und schnellem Vorschub, Einbrandkerben an viel Strom und — schwächer — schnellem Vorschub. Alle Terme, die im wahren Modell null sind, bleiben unauffällig (p > 0,3).

Log-Likelihoodohne FaktorenLikelihood-Quotienten-Test χ² (FG)p-WertMcFadden-R²AIC
−71,2−105,869,3 (9)< 0,00010,327166,4
beobachtet ↓ / vorhergesagt →keinerPorenBindefehlerEinbrandkerbeTreffer
keiner1848418 / 34
Poren37217 / 13
Bindefehler3017017 / 20
Einbrandkerbe3101010 / 14
Trefferquote64 %

Bindefehler und Einbrandkerben erkennt das Modell am besten — sie haben klare, gegenläufige Ursachen. Am schwersten ist die fehlerfreie Naht vorherzusagen: Sie ist das, was übrig bleibt, wenn keiner der drei Fehler auftritt, und hat damit keine eigene Ursache.

KlasseAnzahlAUC95-%-Intervall
keiner340,7310,621 … 0,841
Poren130,7990,660 … 0,938
Bindefehler200,9080,847 … 0,970
Einbrandkerbe140,9000,810 … 0,989

Dasselbe zeigen die ROC-Kurven, die DoEStat für jede Kategorie gegen alle anderen zeichnet: Die Fläche unter der Kurve ist für Bindefehler 0,91, für die fehlerfreie Naht 0,73.

ROC-Kurve für Bindefehler gegen alle anderen Kategorien: die Kurve steigt steil an und erreicht die volle Richtig-Positiv-Rate bei rund 20 Prozent Falsch-Positiv-Rate; Fläche 0,908 mit Intervall 0,847 bis 0,970.
ROC: BindefehlerWenig Strom und schneller Vorschub — eine klare Ursache, gut erkennbar.
ROC-Kurve für die fehlerfreie Naht gegen alle Fehler: die Kurve liegt deutlich über der Diagonale, aber flacher als bei den Fehlern; Fläche 0,731 mit Intervall 0,621 bis 0,841.
ROC: kein NahtfehlerAm schwersten vorherzusagen — die fehlerfreie Naht hat keine eigene Ursache.

Schritt 6 / Prozessfenster

Wo eine gute Naht am wahrscheinlichsten ist

Der Wahrscheinlichkeits-Profiler zeigt für jede Kategorie, wie sich ihre Wahrscheinlichkeit ändert, wenn man einen Faktor verschiebt und die anderen festhält. Die vier Kurven einer Spalte addieren sich überall zu eins. In DoEStat zieht man die Linien mit der Maus und sieht beide Zielgrößen zugleich.

Wahrscheinlichkeits-Profiler des Nahtfehlers an der gewählten Einstellung, vier Zeilen für keiner, Poren, Bindefehler und Einbrandkerbe über Strom, Vorschub und Schutzgas: Poren fallen mit mehr Schutzgas, Bindefehler steigen mit schnellerem Vorschub und fallen mit mehr Strom, Einbrandkerben steigen mit dem Strom; an der Einstellung ist kein Fehler zu 85 Prozent wahrscheinlich.
Profiler: NahtfehlerJede Zeile eine Kategorie, jede Spalte ein Faktor. Die gestrichelten Linien stehen an der gewählten Einstellung.
Wahrscheinlichkeits-Profiler der Spritzer an der gewählten Einstellung, vier Zeilen für keine, wenige, mäßig und viele über Strom, Vorschub und Schutzgas: mit steigendem Strom verschiebt sich die Wahrscheinlichkeit von keine zu viele, mehr Schutzgas wirkt in die Gegenrichtung, der Vorschub kaum; an der Einstellung sind keine oder wenige Spritzer zu 94 Prozent wahrscheinlich.
Profiler: SpritzerEine Steigung je Faktor schiebt alle vier Stufen gemeinsam — das ordinale Modell.

Die Profiler stehen an der Einstellung, bei der eine gute Probe — kein Nahtfehler, höchstens wenige Spritzer — am wahrscheinlichsten ist. Gesucht wurde sie als Produkt der beiden Wahrscheinlichkeiten über ein Gitter des Versuchsraums:

FaktorEinstellungEinheitkodiert
Schweißstrom180A−0,50
Vorschub30cm/min−1,00
Schutzgasmenge20l/min1,00

Der Strom liegt im unteren Viertel des Bereichs: Mehr Strom bringt Spritzer und Einbrandkerben, weniger bringt Bindefehler. Vorschub und Schutzgas stehen am Rand des Versuchsraums — langsam schweißen und reichlich Gas sind hier schlicht besser. Wer jenseits davon sucht, verlässt den untersuchten Bereich; das Modell weiß dort nichts.

Schritt 7 / Bestätigung

24 Proben an der gewählten Einstellung

Eine Wahrscheinlichkeit bestätigt man nicht mit einer Probe. An der gewählten Einstellung werden 24 Proben geschweißt und beurteilt wie in der Studie:

ZielgrößeKategorieVorhersage des ModellsWahre WahrscheinlichkeitBestätigung (24 Proben)
Spritzerkeine63 %70 %18
wenige31 %23 %5
mäßig4 %5 %1
viele2 %1 %0
Nahtfehlerkeiner84 %78 %19
Poren7 %5 %2
Bindefehler8 %16 %3
Einbrandkerbe1 %2 %0

Ergebnis: 18 der 24 Proben sind gut (75 %) — in der Studie waren es 22 von 81 (27 %). Das Modell hatte 80 % versprochen; wahr sind 73 %. Die Lücke ist typisch: Wer unter allen Einstellungen die beste aussucht, sucht auch die aus, bei der das Modell zufällig zu optimistisch ist. Am deutlichsten bei den Bindefehlern — das Modell erwartet 8 %, wahr sind 16 %, beobachtet wurden 3 von 24.

Bilanz

Was die richtige Skala gebracht hat

Zwei Zielgrößen, die sich nicht messen, nur einstufen lassen, und für jede das Modell, das zu ihrer Art passt. Das ordinale Modell nutzt die Reihenfolge der Spritzerstufen und kommt mit drei Steigungen aus; der Brant-Test hat bestätigt, dass das genügt. Das multinomiale Modell lässt jedem Nahtfehler seine eigene Ursache — und genau das war nötig, denn der Strom verhindert den einen Fehler und verursacht den anderen.

Der Preis ist die Probenzahl. Kategoriale Daten brauchen Wiederholungen, und das nominale Modell braucht mehr als das ordinale. Die Planungsrechnung vorab hat gezeigt, dass 54 Proben in einer von fünf Studien zu keinem brauchbaren Ergebnis geführt hätten, und dass ein naheliegender quadratischer Term die Sache verschlimmert.

Gegen die Wahrheit: Alle Faktoren, die im wahren Modell wirken, sind gefunden, mit richtigem Vorzeichen; alle, die nicht wirken, sind unauffällig. Die Schätzungen weichen um bis zu gut ein halbes Logit von der Wahrheit ab — bei 81 Proben mit je einem Urteil ist das die Genauigkeit, die man erwarten kann. Und die Bestätigung zeigt, dass die Wahrscheinlichkeit an der besten Einstellung etwas überschätzt wird: Wer eine Zusage machen muss, nimmt das Ergebnis der Bestätigungsproben, nicht die Vorhersage.

Projektdateien

Selbst nachfahren

Das Beispiel liegt DoEStat als Projekt bei: Hilfe ▸ Beispielprojekt öffnen ▸ Sonstiges ▸ „Kategoriale Zielgrößen: Schweißnaht“, einmal nur mit den Daten (mit dem vollen quadratischen Modell, für das ein Plan mit drei Stufen gemacht ist) und einmal mit fertiger Auswertung (Haupteffekte). Dieselben Dateien gibt es hier zum Herunterladen.

Zurück: Simulation mit Gauß-Prozess Alle Beispiele

DoEStat kostenlos testen

30 Tage, voller Funktionsumfang, kein Zahlungsmittel. Den Download-Link senden wir per E-Mail, in der Regel am nächsten Werktag.

Testversion anfragen