Status: Beta — Antworten können gelegentlich fehlerhaft sein. Bitte prüfe wichtige Angaben gegen die offizielle taz-Hilfeseite.
Wie funktioniert es?
Der Chatbot arbeitet nach dem RAG-Prinzip (Retrieval-Augmented Generation). Deine Frage wird in drei Schritten beantwortet:
- Einbetten: Die Frage wird mit dem Embedding-Modell
bge-m3in einen Zahlenvektor umgewandelt. - Suchen: Der Vektor wird gegen eine Vektordatenbank
(Cloudflare Vectorize) abgeglichen, die die gechunkten FAQ-Inhalte der
taz-Hilfeseiten enthält. Zusätzlich werden passende FAQ-Fragen per
Schlagwort-Abgleich und eine Websuche als Nebenspur berücksichtigt.
Ein Reranker (
bge-reranker) sortiert die relevantesten Passagen auf Rang. - Generieren: Das Sprachmodell
Llama 3.2(3B-Instruct) formuliert aus diesem Kontext die Antwort — ohne etwas zu erfinden.
Die Antwort wird mit Links zu den jeweiligen taz-Seiten angezeigt. Für Folgefragen wird der bisherige Chat-Verlauf mitgesendet, damit sich der Bot auf vorherige Antworten beziehen kann.
Datenschutz
Das Backend läuft auf der Cloudflare-Plattform
(Workers, Workers AI, Vectorize, KV). Die taz-Hilfeseiten werden
automatisch durchgearbeitet: Ein Crawler tastet sich über die
/abo/-Unterseiten und speichert den Inhalt gechunked als
Vektoren.
- Deine Frage wird an die Cloudflare-Infrastruktur
gesendet. Zusätzlich kann eine Websuche über eine externe
SearXNG-Instanz (
search.inetol.net) zur Ergänzung der Antwort hinzugezogen werden. - Der Chat-Verlauf wird nur für die Dauer der Antwort an das Backend übermittelt und nicht dauerhaft gespeichert oder protokolliert.
- Es werden keine Beispiele an Dritte (z. B. Trainingsdaten-Plattformen) weitergegeben.
Die Modelle laufen direkt in der Cloudflare-Kante.
Open Source
Der komplette Stack ist frei zugänglich und selbst hostbar:
- Scraping & Chunking — TypeScript, taz.de als Quelle
- Embeddings —
BAAI bge-m3(Open Source) - Vektordatenbank — Cloudflare Vectorize
- LLM — Meta
Llama 3.2 3B(Open Weights) - Reranker —
BAAI bge-reranker-base - Frontend — statisches HTML/JS, gehostet auf GitHub Pages
- Websuche — über eine SearXNG-Instanz (selbst hostbar)
Alle Komponenten sind offene Standards — nichts Blackbox:
- Deployment auf Cloudflare
- Standard-API: Worker + AI + Vectorize