Workflow-Überwachung im Betrieb: Ein Fall beginnt mit gültiger Anfrage und endet bei bestätigter Entscheidung im Zielsystem.; Offene Fälle müssen sichtbar sein; ein erfolgreicher Lauf ist kein fachlicher Abschluss.; Alarme müssen zugehörige Fälle, Reaktionsverantwortliche und Bearbeitungsorte festlegen.
Bild: Arbeitsfluss

Betrieb & Governance

Betrieb und Überwachung

So überwachen Sie automatisierte Workflows anhand fachlicher Ergebnisse, offener Fälle, belastbarer Messwerte und handlungsfähiger Alarme.

Entscheidend ist, ob ein Workflow den vereinbarten Geschäftsvorgang zum richtigen Ergebnis führt. Sichtbar sein müssen abgeschlossene, offene und ungeklärte Fälle.

Technische Läufe, Protokolle und Alarme unterstützen die Untersuchung, ersetzen aber nicht den Blick auf den fachlichen Stand.

Vom Geschäftsfall ausgehen

Definieren Sie für jeden wichtigen Ablauf, wann ein Fall beginnt und wann er fachlich endet. Bei einer hypothetischen Materialanforderung beginnt er mit einer gültig eingereichten Anfrage.

Er endet erst, wenn die Entscheidung im maßgeblichen System bestätigt ist und alle vereinbarten Schritte zum Abschluss erfüllt sind. Ein gestarteter Lauf oder eine angenommene API-Anfrage ist ein Zwischenstand.

Geben Sie dem Fall eine stabile Kennung und passende Zustände, etwa offen, in Bearbeitung, fachlich beendet und Ergebnis ungeklärt. Erfassen Sie Freigabe und Ablehnung getrennt, wenn sie unterschiedliche fachliche Ergebnisse sind. Mehrere technische Versuche bleiben demselben Fall zugeordnet.

Signale für den Betrieb wählen

BetriebsfrageGeeignete AnzeigeBei der Deutung beachten
Kommen Fälle an?Gültige Eingänge im gewählten ZeitraumBei seltenen Abläufen kann ein Zeitraum ohne Eingang normal sein.
Erreichen sie ein Ende?Bestätigte Endzustände und offene FälleEin erfolgreicher Workflow-Lauf ist kein fachlicher Abschluss.
Bleibt Arbeit liegen?Zahl und Alter offener FälleAuch wenige sehr alte Fälle können Handlungsbedarf zeigen.
Scheitert ein gemeinsamer Schritt?Fehler nach Schritt und KlasseMehrere Meldungen können zu einer Störung gehören.
Sind die Anzeigen belastbar?Letzte bestätigte Aktualisierung je DatenquelleFehlende Daten dürfen nicht als störungsfreier Betrieb erscheinen.

Aggregierte Messwerte zeigen Verlauf und Umfang. Für die Untersuchung eines einzelnen Falls brauchen Berechtigte dessen Zustand und Ereignisse. Eine einzelne Vorgangskennung als Metrikattribut kann sehr viele unterschiedliche Zeitreihen erzeugen; sie gehört gewöhnlich in eine Fallansicht oder ein geeignetes Protokoll.

Ein Überwachungsmodell sollte neben der Diagnose auch Trends und Änderungen sichtbar machen. Der Vergleich des Systemverhaltens vor und nach einer Anpassung kann zeigen, ob sich ein Ablauf verändert hat; bei einem Experiment lassen sich zwei Gruppen gegenüberstellen.

Welche Ansichten dafür nötig sind, richtet sich nach den priorisierten Betriebsfragen.

Ordnen Sie den Ablauf seinem Verarbeitungstyp zu. Bei einem Stapellauf ist nicht allein der einzelne Lauf entscheidend, sondern auch, wann zuletzt ein erfolgreicher Lauf abgeschlossen wurde.

Für einen kontinuierlichen mehrstufigen Prozess sind dagegen Eingänge, Zwischenstände und Ausgänge je Stufe aussagekräftiger.

Kernindikatoren für den Betrieb automatisierter Workflows

Gültige Eingänge im Zeitraum
Zeigt, ob Fälle ankommen
Bestätigte Endzustände & offene Fälle
Prüft, ob Fälle fachlich abgeschlossen sind
Anzahl und Alter offener Fälle
Identifiziert liegende Arbeit
Fehler nach Schritt und Klasse
Zeigt, wo gemeinsame Schritte scheitern
Letzte bestätigte Aktualisierung je Datenquelle
Sichert Belastbarkeit der Anzeigen

Messwerte passend zum Ablauf modellieren

Ein Messereignis verbindet den erfassten Wert mit dem Zeitpunkt der Erfassung und zugehörigen Metadaten. Für jedes Instrument sollten Name und Art feststehen; Einheit und Beschreibung können die Bedeutung zusätzlich klären.

So lässt sich im Dashboard unterscheiden, was gezählt oder als aktueller Stand angezeigt wird.

Ein Counter eignet sich für Werte, die sich im Zeitverlauf aufsummieren, etwa abgeschlossene Fälle. Für einen Bestand, der wachsen und schrumpfen kann, passt ein UpDownCounter, beispielsweise für gerade in Bearbeitung befindliche Arbeit.

Ein Gauge zeigt einen aktuellen Wert zum Zeitpunkt der Messung an.

Bei mehrstufiger Offline-Verarbeitung lässt sich jede Stufe anhand eingehender, laufender und ausgegebener Elemente sowie des letzten Verarbeitungszeitpunkts betrachten. Bei Stapelverarbeitung sind zusätzlich eingehende und ausgehende Stapel hilfreich.

Ein durchgängiger Heartbeat kann zeigen, wann ein Testelement zuletzt die einzelnen Stufen durchlaufen hat, besonders wenn regulär längere Pausen ohne Verarbeitung vorkommen.

Hinweise mit Bearbeitung verbinden

Legen Sie für jeden Alarm fest, welche Auswirkung er meldet, wer reagiert und wo betroffene Fälle zu finden sind. Eine gemeinsame Verbindungsstörung kann die technische Betreuung erfordern. Ein einzelner fachlich unvollständiger Fall gehört meist in eine zugewiesene Arbeitsliste.

Die Dringlichkeit ergibt sich aus der Wirkung und der vereinbarten Reaktionsfrist.

Das Dashboard sollte zuerst Ergebnisse, offene Fälle und den Datenstand zeigen. Von einer auffälligen Zahl muss ein Weg zu den betroffenen Vorgängen führen.

Kennzeichnen Sie fehlende Messung ausdrücklich; prüfen Sie auch, ob Erfassung und Alarmbewertung selbst funktionieren.

Richten Sie Alarme möglichst an einer spürbaren Auswirkung aus, nicht an jeder denkbaren technischen Ursache. Bei einem nutzerwirksamen Fehler oder einer zu langen Verarbeitung sollte die Konsole den Weg zur betroffenen Komponente erleichtern.

Mehrere Alarme für dieselbe Auswirkung schaffen dagegen unnötiges Rauschen; kleine, kurzzeitige Ausschläge müssen nicht automatisch eine sofortige Reaktion auslösen.

Prüfen Sie die gesamte Meldekette mit einem Ende-zu-Ende-Test: Ein erzeugter Hinweis muss über Erfassung und Alarmbewertung bis zum vorgesehenen Empfänger gelangen. So wird sichtbar, ob nicht nur der Workflow, sondern auch die Überwachung selbst handlungsfähig ist.

Den Messpfad mit überwachen

Metriken sind nicht das einzige Betriebssignal: strukturierte Ereignisprotokolle und verteilte Ablaufspuren können ergänzend zeigen, was während eines konkreten Vorgangs geschah. Metriken eignen sich für Überblick und Verlauf; Ereignisse und Ablaufspuren helfen, eine Auffälligkeit entlang der Verarbeitung einzuordnen.

Die Überwachung muss auch die eigene Datenaktualität und Abrufgeschwindigkeit berücksichtigen. Was als ausreichend aktuell gilt, hängt vom jeweiligen Betriebsbedarf ab.

Für Stapelläufe ist der Zeitpunkt des letzten erfolgreichen Laufs ein wichtiges Signal; Laufzeit und Dauer wichtiger Stufen können zusätzliche Hinweise geben.

Eine Abweichung verfolgen

  1. Bestimmen Sie Zeitraum, Ablauf und fachliche Auswirkung.
  2. Finden Sie die betroffenen Fälle und ihren letzten bestätigten Zustand.
  3. Ordnen Sie technische Fehler und Versuche diesen Fällen zu.
  4. Prüfen Sie bei unklarem Ausgang den Stand im maßgeblichen Zielsystem, bevor eine wirksame Aktion erneut ausgelöst wird.
  5. Weisen Sie offene Fälle zu und halten Sie ihre Klärung fest.

Prüfen Sie nach Änderungen am Workflow, ob Zustände, Anzeigen und Alarme noch dasselbe bedeuten. Fragen Sie bei wiederkehrenden Meldungen, welche Handlung sie ausgelöst haben und ob wichtige Fälle ohne Hinweis offen blieben.

In diesem Leitfaden

  1. Erfolgreiche Geschäftsergebnisse statt Aufrufe zählenDefinieren Sie fachlichen Erfolg pro Fall und einen passenden Nenner. Halten Sie offene Fälle und technische Versuche in der Auswertung getrennt.
  2. Fehler mit ausreichendem Kontext protokollierenErfassen Sie Vorgang, Versuch, Schritt und bekannten Ausgang eines Workflow-Fehlers, ohne Geheimnisse oder unnötige Rohdaten mitzuschreiben.
  3. Ein übersichtliches Betriebsdashboard erstellenGestalten Sie ein Betriebsdashboard mit Ergebnissen, offenen Fällen, Fehlerhinweisen und sichtbar aktuellem Datenstand.
  4. Alarmregeln nach wiederholten Fehlmeldungen bereinigenOrdnen Sie wiederholte Alarme nach Ursache und Auswirkung ein und prüfen Sie Zeitbedingung, Gruppierung, Zustellung und fehlende Messdaten.

Mehr aus Betrieb & Governance

Betrieb & Governance

Änderungen vor einer Veröffentlichung vergleichen

Vergleichen Sie produktive Fassung und Freigabefassung anhand von Auslösern, Zweigen, Feldzuordnungen und Zielwirkungen.

Betrieb & Governance

Ein übersichtliches Betriebsdashboard erstellen

Gestalten Sie ein Betriebsdashboard mit Ergebnissen, offenen Fällen, Fehlerhinweisen und sichtbar aktuellem Datenstand.