Ja, das würde das bedeuten. Bei Abakus gab es da ja schon mal so eine Diskussion und da habe ich mich vehement dagegen gewehrt und immer gesagt, das wird der nicht machen. Technisch möglich, aber zu aufwendig.
Fakt ist aber, der hat drauf zugegriffen und nur der. Kein anderer bisher, noch nicht mal ich selber. Hoffe auch, dass das jetzt keiner vom Forum hier macht. Möchte gerne noch sehen, ob die Seite in den Index kommt 
Würde mir nun auch eventuell erklären, warum Google diese Verbindung zwischen meiner Firmenseite und den Reiseportalen hat. Die Diskussion hatte ich hier ja auch schon. Da ist nichts, was auf eine Verbindung hindeutet, gar nichts.... Nach dem damaligen Stand jedenfalls. Auf der Firmenseite gibt es aber eine URL-Angabe "http://www.meine-domain.de" auch als Klartext, als Hinweis für Leser, was ich nun hauptsächlich mache.
Und wenn ich es mir recht überlege... Die beiden Dummy-Seiten, die nun seit ein paar Tagen in meinen WMT als "unbestätigt" erscheinen haben auch keine Verbindung (aber gleiches Thema), beide aber auch einen URL in Textform.
Letztes Beide (Firmenseite und unbestätigte Seiten) können Zufälle oder auch was ganz anderes sein, aber dass ich die Benachrichtigung über den Zugriff auf die Seite bekommen habe nicht. Die ist nagelneu, war nie verwendet, nie verlinkt und nie aufgerufen. Steht nur im Text der Startseite.
Zitat
Das würde ja bedeuten, das der bot den Text parst.
Wer parst denn Text?
Oder hat der jetzt nen Algo drinne, der URL aus Text extrahiert?
Text parsen stand für mich nie in Frage, das wird der schon machen. Muss ja schließlich auch wissen was da drinnen steht. Der kann ja nicht einfach bei einem <p> aufhören und alles bis zum </p> ignorieren. Und Parsen muss er in sowieso, sonst würde er ja auch nicht wissen was da steht 
Nur, dass der Webadressen herausfiltert scheint mir neu zu sein. Ich hielt das für zu aufwendig und "unsicher". Nicht jede "Adresse" ist auch eine. Vielleicht fehlt zwischen "satzende.de" auch einfach nur ein Leerzeichen und das ist keine deutsche TLD. Vielleicht erkennt er die aber auch nur, wenn www und http davor steht. In meinem Fall ist beides da und extra ein Leerzeichen davor und dahinter, also wirklich einfach gemacht.
Um, wenn ich mir das so recht überlege... Da finden sich bei mir noch viel mehr Punkte, die damit zu tun haben könnten. Auch der Piwik-Ordner, auf den Google immer zugreift. Der steht auch nur als Text im Quellcode.