
Wie genau ist PFD Bench?
PFD Bench liest ein Fließbild (DXF) und erstellt eine strukturierte Gerätetabelle (SET): jede Einheit, ihren Typ und wie sie verbunden ist. Basierend auf dieser Tabelle wird anschließend eine schriftliche Prozessbeschreibung generiert. Die Qualität der SET ist entscheidend für das Ergebnis der Beschreibung: Macht man ein paar kritische Fehler in der SET, ist die gesamte Beschreibung falsch.
Aus diesem Grund verfügt PFD Bench direkt nach der SET-Extraktion über einen Human-In-The-Loop-Schritt, sodass der Benutzer die Möglichkeit hat, eventuelle Fehler der KI zu korrigieren. Darüber hinaus führen wir Bewertungsschleifen durch, um die Qualität der SET-Extraktion anhand von Referenztabellen zu messen, die von einem leitenden Prozessingenieur an 8 realen industriellen Fließbildern erstellt wurden. Zwar können wir die Diagramme nicht öffentlich zugänglich machen (diese unterliegen einer Vertraulichkeitsvereinbarung), wir können jedoch die Evaluierungsergebnisse und grobe Statistiken zur Komplexität der einzelnen Zeichnungen vorlegen.
Die Auswertung erfolgt, indem jede Zeichnung 10 Mal unabhängig voneinander verarbeitet wird (insgesamt 80 Durchläufe) bei denselben Einstellungen, die alle Benutzer im PFD Bench haben. Derzeit werden die SETs mit Google Gemini 2.5 Pro verarbeitet. Die Zahlen unten beinhalten die Streuung von Durchlauf zu Durchlauf, sodass man nicht nur die Extraktionsqualität im Durchschnitt, sondern auch deren Varianz sehen kann.
Die Zeichnungen
Komplexität in einfachen Worten: wie viele Ausrüstungseinheiten und wie viele dokumentierte Stromverbindungen zwischen ihnen. Die Dichte (Verbindungen pro Einheit) macht eine Zeichnung besonders schwierig. Stark vernetzte Anlagen sind schwerer nachzuvollziehen als lineare Stränge.
| Zeichnung | Ausrüstungseinheiten | Stream-Verbindungen | Dichte |
|---|---|---|---|
| pfd_03 | 8 | 20 | 2.5 |
| pfd_04 | 20 | 53 | 2.6 |
| pfd_05 | 18 | 46 | 2.6 |
| pfd_06 | 19 | 48 | 2.5 |
| pfd_07 | 33 | 175 | 5.3 |
| pfd_08 | 32 | 116 | 3.6 |
| pfd_09 | 29 | 69 | 2.4 |
| pfd_10 | 28 | 83 | 3.0 |
Ergebnisse
Die Spielstände sind F1 × 100 (see “How to read these numbers” below), one column per field of the extracted table: mean ± standard deviation over the 10 runs. The closer to 100, the better. Anything above 80 is already an excellent extraction with very few errors.
| Zeichnung | Tag | Gerätetyp | Zuflüsse | Einlass # | Abflüsse | Steckdose # |
|---|---|---|---|---|---|---|
| pfd_03 | 93 ± 8 | 90 ± 14 | 96 ± 6 | 93 ± 8 | 94 ± 7 | 93 ± 8 |
| pfd_04 | 96 ± 3 | 95 ± 5 | 94 ± 3 | 95 ± 5 | 89 ± 2 | 93 ± 5 |
| pfd_05 | 99 ± 3 | 98 ± 3 | 94 ± 6 | 94 ± 3 | 92 ± 5 | 92 ± 6 |
| pfd_06 | 93 ± 1 | 93 ± 1 | 92 ± 5 | 93 ± 2 | 92 ± 6 | 90 ± 3 |
| pfd_07 | 99 ± 1 | 97 ± 4 | 78 ± 9 | 83 ± 17 | 78 ± 9 | 88 ± 15 |
| pfd_08 | 99 ± 1 | 98 ± 2 | 76 ± 3 | 78 ± 9 | 80 ± 3 | 88 ± 10 |
| pfd_09 | 90 ± 7 | 90 ± 7 | 96 ± 5 | 88 ± 7 | 97 ± 2 | 88 ± 7 |
| pfd_10 | 94 ± 5 | 92 ± 9 | 90 ± 6 | 89 ± 7 | 85 ± 5 | 76 ± 7 |
| Alle Zeichnungen (zusammengefasst) | 96 | 95 | 86 | 88 | 86 | 88 |
In Worten: Die Geräteidentifizierung ist im Wesentlichen gelöst.. Equipment tags and types land at 95–96% across the set, and on clean drawings at 98–99%. Connectivity mapping runs at 86–90% on typical drawings; the densest, most interconnected plants (pfd_07, pfd_08) pull the stream columns toward 76–80%. Still very good, but it shows that tracing every branch of highly dense diagrams demands further improvements to the models and to how we pre-process the data the LLM is served.
Wie man diese Zahlen liest
Jedes Ergebnis ist eine F1-Score, was das Standard-Genauigkeitsmaß für Extraktionsaufgaben ist und Präzision sowie Recall in einer Zahl kombiniert (100 = perfekt). In unserem Kontext:
- Richtig positiv (TP): etwas, das sich auf der Zeichnung befindet, und die PFD-Bank hat es korrekt gemeldet.
- Falsch-Negativ (FN): etwas auf der Zeichnung, das von PFD Bench übersehen wurde, z. B. eine Einheit oder Verbindung, die in dessen Tabelle fehlt.
- Falsch-Positiv (FP): etwas, das PFD Bench berichtet hat, ist nicht on the drawing. This is also known as “hallucination” in the LLM world.
Präzision = von allem, was berichtet wurde, wie viel war Richtig. Erinnern = von allem auf der Zeichnung, wie viel war gefunden.
F1 ist ihr harmonisches Mittel
F1 = 2 × Precision × Recall / (Precision + Recall)
Ein System kann also weder durch das Raten von Dingen noch durch Stille gut abschneiden. Beide Fehler werden bestraft.
Methodik, kurz
- Referenztabellen: curated against the original drawings. Where several phrasings are equally correct (“Dryer” vs “Drier”, a tag vs its full name), the equivalence was adjudicated once, and applied consistently to every run.
- Bestimmte Bewertung: feste, versionsgesteuerte Regeln; hier bewertet keine KI eine andere. Eine identische Ausgabe liefert stets das identische Ergebnis, reproduzierbar zu jedem Zeitpunkt in der Projekthistorie.
- Jede rohe Modellantwort wird archiviert: Jede Zahl in dieser Tabelle kann auf die genaue Modellausgabe zurückgeführt werden, die sie erzeugt hat.
Letztes Update: 06.08.2026
