tazBot

BETA

Stelle deine Frage — der Chatbot antwortet dir auf Basis der offiziellen taz-Hilfeseite.

Hallo! Wie kann ich dir helfen?

Status: Beta — Antworten können gelegentlich fehlerhaft sein. Bitte prüfe wichtige Angaben gegen die offizielle taz-Hilfeseite.

Wie funktioniert es?

Der Chatbot arbeitet nach dem RAG-Prinzip (Retrieval-Augmented Generation). Deine Frage wird in drei Schritten beantwortet:

  • Einbetten: Die Frage wird mit dem Embedding-Modell bge-m3 in einen Zahlenvektor umgewandelt.
  • Suchen: Der Vektor wird gegen eine Vektordatenbank (Cloudflare Vectorize) abgeglichen, die die gechunkten FAQ-Inhalte der taz-Hilfeseiten enthält. Zusätzlich werden passende FAQ-Fragen per Schlagwort-Abgleich und eine Websuche als Nebenspur berücksichtigt. Ein Reranker (bge-reranker) sortiert die relevantesten Passagen auf Rang.
  • Generieren: Das Sprachmodell Llama 3.2 (3B-Instruct) formuliert aus diesem Kontext die Antwort — ohne etwas zu erfinden.

Die Antwort wird mit Links zu den jeweiligen taz-Seiten angezeigt. Für Folgefragen wird der bisherige Chat-Verlauf mitgesendet, damit sich der Bot auf vorherige Antworten beziehen kann.

Datenschutz

Das Backend läuft auf der Cloudflare-Plattform (Workers, Workers AI, Vectorize, KV). Die taz-Hilfeseiten werden automatisch durchgearbeitet: Ein Crawler tastet sich über die /abo/-Unterseiten und speichert den Inhalt gechunked als Vektoren.

  • Deine Frage wird an die Cloudflare-Infrastruktur gesendet. Zusätzlich kann eine Websuche über eine externe SearXNG-Instanz (search.inetol.net) zur Ergänzung der Antwort hinzugezogen werden.
  • Der Chat-Verlauf wird nur für die Dauer der Antwort an das Backend übermittelt und nicht dauerhaft gespeichert oder protokolliert.
  • Es werden keine Beispiele an Dritte (z. B. Trainingsdaten-Plattformen) weitergegeben.

Die Modelle laufen direkt in der Cloudflare-Kante.

Open Source

Der komplette Stack ist frei zugänglich und selbst hostbar:

  • Scraping & Chunking — TypeScript, taz.de als Quelle
  • Embeddings — BAAI bge-m3 (Open Source)
  • Vektordatenbank — Cloudflare Vectorize
  • LLM — Meta Llama 3.2 3B (Open Weights)
  • Reranker — BAAI bge-reranker-base
  • Frontend — statisches HTML/JS, gehostet auf GitHub Pages
  • Websuche — über eine SearXNG-Instanz (selbst hostbar)

Alle Komponenten sind offene Standards — nichts Blackbox:

  • Deployment auf Cloudflare
  • Standard-API: Worker + AI + Vectorize