# ===================================================================== # poeschlmed.at — Regeln für automatisierte Zugriffe # Stand: 31.08.2026 # # GRUNDSATZ: sichtbar sein, aber nicht zum Training beitragen. # # Das lässt sich trennen, weil die meisten Anbieter GETRENNTE Crawler # einsetzen: einen für den Suchindex bzw. für das Beantworten konkreter # Nutzerfragen (mit Quellenangabe und Verlinkung) und einen zweiten, der # Material für das Training von Modellen sammelt. Die erste Gruppe ist # erlaubt, die zweite ausgeschlossen. # # WICHTIG UND EHRLICH: robots.txt ist eine Bitte, keine technische Sperre. # Seriöse Anbieter halten sich daran, andere nicht. Und was bereits # gesammelt wurde, holt diese Datei nicht zurück. Rechtlich verbindlicher # ist der Nutzungsvorbehalt nach Art. 4 DSM-Richtlinie bzw. § 42h UrhG — # der steht maschinenlesbar in /.well-known/tdmrep.json und im Impressum. # # Die Namen der Crawler ändern sich. Diese Liste gehört etwa halbjährlich # nachgesehen. # ===================================================================== # --------------------------------------------------------------------- # KI-Dienste: TRAINING AUSGESCHLOSSEN # Diese Crawler sammeln Material für das Training von Modellen. # # REIHENFOLGE IST WICHTIG: dieser Block steht bewusst VOR den Freigaben. # Manche Auswerter ordnen einen Crawler der ersten Regel zu, deren Name # in seiner Kennung vorkommt. "Applebot" steckt in "Applebot-Extended" — # stünde die Freigabe für Applebot zuerst, wäre Apples Trainings-Crawler # damit versehentlich erlaubt. Genau das ist beim Nachprüfen mit einem # echten robots.txt-Parser aufgefallen und durch diese Reihenfolge # behoben. Umgekehrt ist kein gesperrter Name Bestandteil eines der # weiter unten freigegebenen — die Freigaben bleiben also wirksam. # # Zu Google-Extended: der Ausschluss betrifft ausschließlich die # Verwendung in Gemini. Ranking in der Google-Suche und das Erscheinen in # den KI-Übersichten der Suche bleiben unberührt — beides läuft über den # weiter unten freigegebenen Googlebot. # # Zu Applebot-Extended: dasselbe Prinzip. Applebot (Siri, Spotlight) # bleibt freigegeben, nur die Trainingsverwendung ist ausgeschlossen. # --------------------------------------------------------------------- User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: anthropic-ai Disallow: / User-agent: Claude-Web Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: meta-externalagent Disallow: / User-agent: meta-externalfetcher Disallow: / User-agent: FacebookBot Disallow: / User-agent: Bytespider Disallow: / User-agent: Amazonbot Disallow: / User-agent: Omgilibot Disallow: / User-agent: Omgili Disallow: / User-agent: Diffbot Disallow: / User-agent: ImagesiftBot Disallow: / User-agent: AI2Bot Disallow: / User-agent: Webzio-Extended Disallow: / User-agent: PanguBot Disallow: / User-agent: Timpibot Disallow: / User-agent: cohere-ai Disallow: / User-agent: cohere-training-data-crawler Disallow: / User-agent: SemrushBot-OCOB Disallow: / # --------------------------------------------------------------------- # Klassische Suchmaschinen — uneingeschränkt willkommen # --------------------------------------------------------------------- User-agent: Googlebot Allow: / User-agent: Bingbot Allow: / User-agent: DuckDuckBot Allow: / User-agent: Applebot Allow: / # --------------------------------------------------------------------- # KI-Dienste: SICHTBARKEIT ERLAUBT # Diese Crawler beliefern Suche und Antworten mit Quellenangabe. Sie # sorgen dafür, dass poeschlmed als Quelle genannt und verlinkt wird. # --------------------------------------------------------------------- User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: Bingbot-Chat Allow: / # --------------------------------------------------------------------- # Alle übrigen — erlaubt (u. a. gewöhnliche Suchmaschinen und Werkzeuge) # --------------------------------------------------------------------- User-agent: * Allow: / # --------------------------------------------------------------------- # Inhaltssignale (Content Signals). Maschinenlesbare Absichtserklärung # zusätzlich zu den Regeln oben: # search = ja — in Suchergebnisse aufnehmen und verlinken # ai-input = ja — als Quelle für eine konkrete Antwort verwenden, # sofern die Quelle genannt und verlinkt wird # ai-train = NEIN — nicht zum Training von Modellen verwenden # --------------------------------------------------------------------- Content-Signal: search=yes, ai-input=yes, ai-train=no Sitemap: https://www.poeschlmed.at/sitemap.xml