# MCT-MIN-001 – Ministral Closed Candidate Evaluation

**Status:** Experiment abgeschlossen  
**Version:** v0.2  
**Datum:** 11.09.2026  
**Kontext:** MCT / Reconcilix Candidate Discovery Evaluation

## 1. Ziel

MCT-MIN-001 untersucht explorativ, ob `Ministral 3 14B` als **Candidate Evaluator / Reranker** für bereits durch Qdrant ermittelte MCT Candidates geeignet ist.

Ministral wurde in diesem Experiment **nicht als Candidate Discovery Provider** eingesetzt. Ziel war ausschließlich die Frage, ob ein LLM innerhalb eines vorgegebenen Candidate Sets fachlich plausible Match Decisions treffen und ungeeignete Candidate Sets als `NO_MATCH` zurückweisen kann.

## 2. Testdesign

Aus den zuvor ausgeführten 200 MCT/Qdrant-Fällen wurden 20 erfolgreiche Qdrant-Fälle bewusst stratifiziert ausgewählt:

- 5 × `VALID_TOP1`
- 5 × `VALID_RANK_2_3`
- 5 × `VALID_RANK_4_10`
- 5 × `NO_VALID_TOP10`

Die Gruppierung basiert auf einer zuvor erzeugten **Working Semantic Adjudication**. Diese ist keine durch Domain Expert:innen bestätigte Ground Truth.

Ministral erhielt pro Fall ausschließlich:

```text
SourceValue
TEI item_discovery Context
Qdrant Top-10 Candidates
  - rank
  - label
  - URI
  - provider_score
```

RxStore bzw. `MAPPED_VOCABULARY` wurden bewusst nicht mitgegeben.

Ministral durfte ausschließlich einen vorhandenen Candidate auswählen oder `NO_MATCH` entscheiden. Freie Candidate-Erzeugung und externe Recherche waren ausgeschlossen.

## 3. Technischer Ablauf

Endpoint:

```text
POST /api/llm/v1/generate
```

Parameter:

```text
temperature = 0
max_tokens = 384   # v0.2
```

Erwartetes Response Schema:

```json
{
  "decision": "MATCH | NO_MATCH",
  "selected_rank": 1,
  "selected_uri": "...",
  "selected_label": "...",
  "confidence": 0.0,
  "semantic_role": "OBJECT_TYPE | ARCHITECTURAL_TYPE | FUNCTION | HISTORICAL_FUNCTION | COMPONENT | RELATED_OBJECT | UNKNOWN",
  "reason": "..."
}
```

Der erste Lauf zeigte Probleme mit formal ungültigem JSON durch Markdown Code Fences und Zeilenumbrüche in `reason`. In v0.2 wurde der Prompt verschärft und der Parser robuster gestaltet.

18 von 20 Responses des zweiten Laufs waren unmittelbar auswertbar. Zwei Fälle zeigten weiterhin Output-Control-Probleme durch wiederholte bzw. widersprüchliche JSON-Objekte.

Performance wurde im Experiment beobachtet, war jedoch ausdrücklich **kein Evaluation Criterion**. Gegenstand des Tests war ausschließlich die Decision Quality.

## 4. Formale Ergebnisse v0.2

Verglichen wurde zunächst mit der eingefrorenen Working Adjudication.

| Gruppe | Decision Agreement | Exact Rank Agreement |
|---|---:|---:|
| `VALID_TOP1` | 3/5 | 3/5 |
| `VALID_RANK_2_3` | 1/5 | 1/5 |
| `VALID_RANK_4_10` | 3/5 | 1/5 |
| `NO_VALID_TOP10` | 2/5 | 2/5 |
| **Gesamt** | **9/20 = 45 %** | **7/20 = 35 %** |

Diese Werte dürfen **nicht als Accuracy von Ministral interpretiert werden**. Die verwendete Working Adjudication ist keine Ground Truth und erwies sich bei mehreren Einzelfällen selbst als fachlich fragwürdig.

## 5. Qualitative Beobachtungen

### 5.1 Reranking ist grundsätzlich möglich

Ministral übernimmt nicht lediglich den Qdrant Rank 1, sondern bewertet das Candidate Set semantisch.

Ein besonders deutlicher Fall:

```text
SourceValue:
Friedhofskirche St. Stephanus

Ministral:
Friedhofskapelle
Qdrant Rank: 6
```

Damit zeigt das Experiment, dass ein fachlich plausibler Candidate auch aus tieferen Qdrant Ranks ausgewählt werden kann.

### 5.2 Ministral kann `NO_MATCH` verwenden

Ministral wählte in mehreren Fällen bewusst keinen der zehn Qdrant Candidates.

Damit ist grundsätzlich die für Reconcilix wichtige Trennung erkennbar:

```text
Candidate Discovery
        ≠
Match Decision
```

Das Modell verhält sich nicht ausschließlich als Candidate Picker.

### 5.3 Working Adjudication ist keine ausreichende Ground Truth

Bei mehreren Abweichungen erscheint die Ministral Decision mindestens ebenso plausibel oder plausibler als die automatische Working Adjudication.

Beispiele:

```text
Klinikum
Working Adjudication: Gebäude, Rank 7
Ministral: Universitätskrankenhaus, Rank 1
```

```text
Kath. Pfarrkirche Hl. Kreuz
Working Adjudication: Kreuz, Rank 8
Ministral: Kreuzkuppelkirche, Rank 1
```

Diese Fälle zeigen, dass die Qualität eines LLM Evaluators nicht seriös ausschließlich gegen die bisherige heuristische Referenz gemessen werden kann.

### 5.4 SourceValue und Context können konkurrieren

Der bekannte Fall

```text
Kath. Pfarrkirche St. Johann Bapt.
```

ist besonders aufschlussreich. Im TEI Context erscheint zusätzlich `ehem. Abteikirche`. Ministral reagierte darauf mit konkurrierenden Entscheidungen einschließlich `Abteikirche`.

Damit wird eine zentrale zukünftige Fragestellung sichtbar:

```text
SourceValue Semantics
        ↕
Context Semantics
        ↓
Candidate Evaluation
```

Für einen produktiven LLM Evaluator müsste die semantische Priorität von `SourceValue`, `Main Object` und zusätzlicher Context Evidence explizit definiert werden.

## 6. Architekturbeobachtung

Das Experiment liefert ein erstes positives Signal für folgende zukünftige Arbeitsteilung:

```text
Candidate Discovery
   │
   ├─ lexical / mapped discovery
   └─ vector discovery
             │
             ▼
      Candidate Set
             │
             ▼
        LLM Evaluation
             │
      ├─ Candidate Selection
      ├─ Reranking
      └─ NO_MATCH
```

Ministral sollte auf Basis dieses Experiments noch **nicht** als produktiver Bestandteil des aktuellen MCT Matching Path verstanden werden.

Interessant ist vielmehr die Perspektive, Evidence aus unterschiedlichen Discovery Methods später gemeinsam semantisch bewerten zu lassen.

## 7. Ergebnis

MCT-MIN-001 zeigt ausreichend positives Signal, um **LLM-based Candidate Evaluation / Reranking** als zukünftige Reconcilix-Perspektive weiterzuverfolgen.

Nachgewiesen wurde explorativ:

- Ministral kann Qdrant Candidates semantisch gegeneinander bewerten.
- Ministral kann Candidates aus tieferen Qdrant Ranks auswählen.
- Ministral kann `NO_MATCH` entscheiden.
- Provider Rank bzw. Provider Score werden nicht mechanisch als Match Decision übernommen.
- SourceValue-vs-Context Competition ist eine zentrale offene semantische Fragestellung.
- Eine belastbare Accuracy-Messung erfordert ein fachlich adjudiziertes Reference Set.

## 8. Entscheidung / Status

**MCT-MIN-001 wird mit v0.2 abgeschlossen und geparkt.**

Ministral wird nicht in den aktuellen operativen MCT Matching Path aufgenommen. Die Ergebnisse werden als Grundlage für eine spätere Evaluation von LLM-based Candidate Evaluation erhalten.

Der aktuelle MCT-Versuch wird zunächst mit klassischen Reconcilix Discovery Methods fortgesetzt:

```text
rx-p-0003
LEXICAL / EXACT_STRING
→ FULLTEXT / NATURAL

        ↓ Vergleich

rx-p-0004
MAPPED_VOCABULARY
→ LEXICAL / EXACT_STRING
→ FULLTEXT / NATURAL

        ↓ Vergleich

Qdrant
VECTOR_SIMILARITY + Context
```

Damit liegt der kurzfristige Fokus wieder auf reproduzierbaren Candidate Discovery Ergebnissen für den konkreten MCT-Auftrag. Die in MCT-MIN-001 sichtbaren LLM-Perspektiven werden zu einem späteren Zeitpunkt separat weiterverfolgt.
