# M001 – Matching Phenomena Taxonomy v0.3

Status: Draft  
Scope: E002 / F01 – Expert feedback on OpenRefine object-type reconciliation

## Leitfrage

Nicht: **Welcher Fehler liegt vor?**  
Sondern: **Welche Matching-Konstellation bestimmt die fachliche Bewertung?**

Alternativen zum Begriff „Phänomen“:

- Matching-Konstellation
- Matching-Falltyp
- Matching-Befund
- Matching-Muster
- Matching-Situation
- Analyseklasse

Arbeitsbegriff: **Matching-Phänomen**. Für Tabellen bleibt **Analysis Classification** geeignet.

## Taxonomie v0.3

| Analysis Classification | Definition | Typische Beispiele | Betroffene Roadmap-Ebene |
|---|---|---|---|
| EXACT_MATCH | Der Candidate entspricht dem gesuchten kontrollierten Begriff fachlich direkt oder hinreichend direkt. | Altar → Altar; Altarkreuz → Altarkreuz | Scoring / Candidate Ranking |
| LEXICAL_VARIANT | Die Abweichung entsteht durch Plural, Flexion, Orthographie, Groß-/Kleinschreibung oder Sprachvariante. | Adlerpulte → Adlerpult; Altäre → Altar | Normalization |
| BOUND_OR_FRAGMENTED_TERM | Der Quellwert ist ein gebundener, fragmentierter oder syntaktisch unvollständiger Ausdruck, der dennoch auf einen Objekttyp verweist. | -kreuz → Kreuz; -leuchter → Leuchter | Normalization / Tokenization |
| COMPOSITE_TERM | Der Objekttyp ist als Bestandteil eines Kompositums oder einer zusammengesetzten Benennung enthalten. | Alabasterfigur → Figur; Apsisfenster → Fenster | Normalization / Compound Handling |
| SEMANTIC_GENERALIZATION | Der Quellwert ist spezifischer als das kontrollierte Zielvokabular und muss auf einen Ober- oder Normbegriff gemappt werden. | Anastasiusreliquiar → Reliquiar; Abendmahlstisch → Altarmensa | Semantic Interpretation / Vocabulary Mapping |
| MULTI_TYPE_EXPRESSION | Der Quellwert enthält mehrere mögliche Objekttypen oder ein zusammengesetztes Ensemble. | Altar-Kanzel-Orgelprospekt | Segmentation / Candidate Ranking |
| CONTEXT_DEPENDENT | Der Quellwert ist ohne Objektkontext nicht zuverlässig als Objekttyp interpretierbar. | Anna; Apostel; Arma Christi | Context Enrichment / TEI Evidence |
| NOT_AN_OBJECT_TYPE | Der Quellwert beschreibt keinen Objekttyp, sondern z. B. Datum, Zahl, Titel, ikonographisches Motiv oder sonstige Angabe. | 1509 | Pre-Filtering / Field Validation |
| WRONG_SEMANTIC_CLASS | Der vorgeschlagene Candidate gehört fachlich zu einer anderen Klasse als der gesuchte Objekttyp. | Large Two Forms → forms (benches) | Candidate Ranking / Semantic Type Filter |
| NO_SUITABLE_CONCEPT | Im Zielvokabular scheint kein geeigneter kontrollierter Begriff vorhanden zu sein. Wegen broadMatch sollte diese Klasse selten sein. | bisher kein sicherer Fall in den ersten 100 | Vocabulary Coverage / Mapping Policy |
| SOURCE_DATA_ISSUE | Der Quellwert wirkt fehlerhaft, vertippt, falsch segmentiert oder aus einem falschen Feld übernommen. | Altrarretabel | Data Quality / Pre-Processing |

## Beobachtungen zu NOT_AN_OBJECT_TYPE

Eine mögliche Vorregel ist: Werte mit Ziffern (`[0-9]`) sind verdächtig und sollten vor dem Matching geprüft werden. Sie können Jahreszahlen, Hausnummern, Inventarnummern oder Datierungsbestandteile sein.

Diese Regel darf nicht automatisch „ausschließen“, sondern sollte einen Review-Status erzeugen, weil Zahlen auch Teil legitimer Objektbezeichnungen sein können.

## Beobachtung zu TEI-Kontext

Bei vielen `CONTEXT_DEPENDENT`-Fällen kann der korrekte oWoT vermutlich nicht aus dem String selbst gewonnen werden. Dafür sind TEI- oder Strukturdaten erforderlich, etwa Objektbeschreibung, Ereignisstruktur, Material, Standort, Kontextabschnitt oder zugehöriges LIDO-Feld.

## Methodische Konsequenz

Reconcilix sollte Matching nicht als direkten Schritt `String → Concept` modellieren, sondern als Pipeline:

1. Pre-Filtering / Field Validation
2. Normalization
3. Compound Handling
4. Semantic Interpretation
5. Context Enrichment
6. Candidate Generation
7. Semantic Type Filtering
8. Candidate Ranking
9. Expert Review / Feedback Loop

