In meinem Fotoarchiv schlummert ein Filmnegativ, das ich im Sommer 1992 während meiner fast dreimonatigen Reise durch die USA aufgenommen habe. Es zeigt eine Hausecke mit einem Gebäude links, das ein Hotel sein könnte, und einem etwas abgeranzten dreistöckigen Haus im Vordergrund. Warum habe ich es fotografiert? Und vor allem: Wo?
Aufgrund der Bilder vorher und nachher kommen zwei Städte infrage: Auf den früheren Bildern ist der Universal-Studios-Hollywood-Themenpark zu sehen, an den ich lebhafte Erinnerungen habe. Auf den Bildern nachher war ich in Washington, D. C.: das Weisse Haus, Pentagon, das Kapitol – bei den Bildern herrscht keinerlei Unklarheit, was das Motiv angeht.
Da dieses Bild nicht datiert ist, natürlich keine GPS-Koordinaten enthält und bei mir keinerlei Erinnerungen weckt, könnte es an beiden Orten entstanden sein. Wie könnte ich es verorten? Bei einem anderen Motiv aus meiner Sammlung war ich mit Google Lens erfolgreich gewesen. Doch nicht in diesem Fall; per Websuche war kein passendes Motiv aufzutreiben.
Vielversprechend wäre die Methode Vergrösserungsglas (respektive des Makroobjektivs) gewesen: Die besteht darin, einen Ausschnitt mit einer Beschriftung, einer Beschilderung o. Ä. sichtbar zu machen und danach zu suchen. Sie brachte mich bei den Recherchen zu einem Foto aus Szeged ans Ziel. Sie wäre auch hier erfolgversprechend gewesen, weil an der Überdachung des mutmasslichen Hoteleingangs eine Beschriftung zu erkennen ist, die in meinem schlechten Scan nicht entziffert werden kann. Ein schärferer Scan könnte der Schlüssel sein. Doch mein Anspruch war, das Rätsel mit den vorhandenen Mitteln zu lösen.
Für Gemini ein Klacks!
Zum Einsatz kommen sollten möglichst einfache Mittel; d. h., keine forensischen Spezialprogramme, sondern landläufige Anwendungen im Web. Ich habe es im Abstand von ungefähr sechs Monaten jeweils mit den aktuellen Versionen der multimodalen Sprachmodelle probiert, und zwar mit einem simplen Prompt, der die Umstände der Aufnahme schildert¹. Bis anhin war keines der Modelle erfolgreich: Die Auskünfte blieben jeweils vage. Eine Konstante war die Aussage, dass es sich um New York City handeln könnte, obwohl diese Stadt aufgrund der Umstände nicht zur Debatte stand. Ansonsten jeweils wortreiche Ratlosigkeit.
Mit wenig Hoffnung ging ich neulich daran, den Versuch zu wiederholen. Und siehe da: Gemini berichtete im Brustton der Überzeugung:
Das Foto lässt sich absolut exakt zuordnen! Es wurde in Washington, D. C. an der Kreuzung 11th Street NW und K Street NW aufgenommen. Deine Erinnerung bezüglich der nachfolgenden Bilder stimmt also haargenau – dieses Bild markiert den Beginn deines Aufenthalts in der US-Hauptstadt.
Mit den beiden Strassen gelange ich auf Google Maps zu einer Street-View-Aufnahme mit der fast exakten Perspektive meines Bildes. Das ist die Bestätigung: Gemini hat das Rätsel geknackt!

Zum Vergleich: Die anderen KIs (namentlich ChatGPT) tippten weiterhin auf New York.
Natürlich wollte ich wissen, wieso Gemini nun in der Lage war, den Aufnahmeort zu identifizieren. Ich fragte danach, und Gemini beschied, der entscheidende Hinweis sei eine Kombination aus OCR und Kontext gewesen, wobei der grüne Baldachin ausschlaggebend gewesen sei. Das ist bemerkenswert, denn in der Vergrösserung der hochgeladenen Aufnahme ist der Text definitiv nicht zu entziffern.
Konnte Gemini diesen Text wirklich entziffern?
An dieser Stelle kam ich nicht umhin, unbotmässig viel Zeit darin zu investieren, den Papierabzug und das Negativ herauszusuchen und zu versuchen, es in einer grösseren Auflösung einzuscannen. Da ich dafür keinen neuen Negativscanner anschaffen wollte, probierte ich es mit meinem digitalen Mikroskop. Das Resultat ist nur minimal besser.

Darum bleiben Zweifel an der Behauptung, Gemini habe den Text erkannt. Doch die KI erwähnt drei weitere Ansatzpunkte:
- Das Strassenschild an der Ampel im Vordergrund entspreche exakt dem Design, das im District of Columbia (D.C.) damals üblich gewesen sei: «Selbst wenn man den Strassennamen (11th St / K St) nur erahnen kann, schränkt das Design den Suchradius massiv ein.»
- In den historischen Berichten zur Stadtentwicklung sei die Häuserzeile (1011–1017 K Street) dokumentiert: «Dort findet man Beschreibungen wie vierstöckiger Eckturm mit Rundbogenfenstern, Erdgeschoss weiss gestrichen.»
- Und das «Moxy-Hotel»-Projekt: «Dass dieser Ort so leicht zu verifizieren ist, liegt an einem bekannten Architekturprojekt aus den 2010er Jahren. Die Häuserzeile rechts im Bild war 1992, wie man sieht, in einem maroden Zustand (teils entkernt, Fenster vernagelt).»
Die historische Fassade wurde erhalten (Facadism), und dahinter entstand ein Neubau, nämlich das besagte Hotel. Dieses ungefähr 2018 fertiggestellte Projekt sei in Geminis Datenbestand umfassend dokumentiert.
Auch anhand von Textmaterial lassen sich Bilder entschlüsseln
Mein Eindruck ist, dass die künstliche Intelligenz mit einer Kombination aus visueller Suche und Textrecherche ans Ziel kam. Anhand der Strassenschilder liess sich der Aufnahmeort auf Washington D.C. eingrenzen, und anhand der detaillierten Beschreibung der Architektur fanden sich Dokumente mit Hinweisen zum Moxy-Hotel und der Umgebung.

Fazit: Meine Neugierde ist befriedigt, ich habe etwas über Washington und vor allem über solche Recherchetechniken gelernt, und ich bin beeindruckt, wie gut die KI inzwischen ist, weit verstreute Puzzleteile zusammenzufügen.
Fussnoten
1) Das ist mein Prompt für die Suche:
Kannst du mir bei der Recherche zu diesem Foto helfen? Ich habe es 1992 aufgenommen, damals aber ohne GPS und ohne exakte Datierung. Die Bilder vorher stammen aus dem Universal Studios Hollywood-Themenpark und die Fotos danach aus Washington, D. C. Lässt sich die Hausecke identifizieren – oder gibt es Anhaltspunkte, wie und wo ich auf Streetmap suchen könnte? ↩