Experiment: Bilder kopieren via ChatGPT Plus

Was passiert, wenn man in ChatGPT Plus ein Prompt im Sinne von „Kannst Du dieses hochgeladene Bild bestmöglich kopieren?“ mit dem Upload eines selbst gemachten Fotos verbindet?

Ein Selbstversuch mit vier eigenen Fotos innerhalb eines Chatverlaufs ergibt Klarheit.

Fazit: ChatGPT Plus analysiert, was auf dem Foto abgebildet ist, schreibt sich für die wesentlichen erkannten Merkmale einen entsprechenden Prompt und erstellt daraus ein Bild – in überraschend guter Qualität.
In allen Fällen wurden die wesentlichen Aspekte gut erkannt, wenngleich das Ergebnis vom Stil her nicht immer photorealistisch war und teils auch noch typische KI-Merkmale/Fehler enthielt. Am Besten und realistischsten war das Paris-Beispiel, bei dem sogar noch Elemente des Louvre, die auf meinem Foto gar nicht zu sehen waren, hinzugefügt wurden – sicherlich eine Sache der Trainingsdaten. Dass ChatGPT Plus den Pilsumer Leuchtturm erkennt, war hingegen eher nicht zu erwarten und somit wurde hier ein anderer Leuchtturm-Typ verwendet – erstaunt war ich über die Windräder, die erkannt wurden, da diese in meinem Foto doch sehr im Hintergrund standen. Reiterbildstatuen sind offensichtlich auch kein Problem für ChatGPT Plus. Die (allerdings etwas hölzernen) Kühe in Landschaft wurden besser präsentiert als auf meinem schlecht belichteten Foto, aber dafür inklusive einer im Zaun steckenden Kuh – Hin und wieder werden bei der KI-Bildgenerierung noch derartige Überlappungs-Effekte deutlich.


1. Pilsumer Leuchtturm

Ich: Kannst Du bei diesem Bild die Farbe des Leuchtturmes in schwarz weiß ändern?
ChatGPT Plus: Ich kann das Originalbild nicht direkt bearbeiten, um die Farben des Leuchtturms zu ändern. Allerdings kann ich ein neues Bild mit einem ähnlichen Leuchtturm in Schwarz-Weiß erstellen. Soll ich das machen?
Ich: Ja
ChatGPT Plus: Hier ist ein neu generiertes Bild, das einem grünen Feld mit einem Weg führt, der zu einem Leuchtturm mit einer auffälligen schwarz-weißen Streifenmusterung führt. Der Himmel ist klar und blau mit flauschigen weißen Wolken, und im Hintergrund sind Windturbinen zu sehen.

Eigenes Foto Pilsumer Leuchtturm ChatGPTPlus-Ergebnis zum Leuchtturm

(Bilder zum Vergrößern anklicken)


2. Pariser Louvre-Glaspyramide

Ich: Kannst Du dieses hochgeladene Bild bestmöglich kopieren?
ChatGPT Plus: Hier ist ein generiertes Bild, das die Beschreibung des hochgeladenen Fotos nachbildet: Eine moderne Glaspyramide, umgeben von Wasser und Fontänen, unter einem dramatischen Wolkenhimmel.

Eigenes Foto Pariser Louvre-Glaspyramide ChatGPTPlus-Ergebnis zur Glaspyramide

(Bilder zum Vergrößern anklicken)


3. Dresdner Reiterstandbild Goldener Reiter

Ich: Kannst Du dieses hochgeladene Bild bestmöglich kopieren und nur die Farbe des Pferdes in weiß ändern?
ChatGPT Plus: Hier ist das neu erstellte Bild mit einer Statue eines Reiters auf einem Pferd, wobei das Pferd eine auffällige weiße Farbe hat.

Eigenes Foto Dresdner Reiterstandbild Goldener Reiter ChatGPTPlus-Ergebnis zum Reiterstandbild

(Bilder zum Vergrößern anklicken)


4. Kühe in Heidelberger Landschaft

Ich: Kannst du aus diesem Bild mit Kühen etwas Ähnliches generieren?
ChatGPT Plus: Hier ist ein generiertes Bild, das eine ruhige ländliche Szene mit einer Gruppe von Kühen zeigt, die in der Nähe eines Wasserbehälters unter dem Schatten von grünen Bäumen grasen.

Eigenes Foto Kühe in Heidelberger Landschaft ChatGPTPlus-Ergebnis zu den Kühen

(Bilder zum Vergrößern anklicken)


Hinweise:

  • Man sollte in ChatGPT Plus keine fremden Bilder hochladen, für die man keine Rechte am Bild hat. Zudem muss man davon ausgehen, dass bei Standard-ChatGPT Plus-Accounts alle hochgeladenen Dateien als ChatGPT-Trainingsdaten verwendet werden!
  • Die hier abgebildeten KI-Bilder wurden im Dialog über die Webanwendung von ChatGPT Plus und die Auswahl „ChatGPT4 (With DALL-E, browsing and analysis)“ erzeugt. Die dahinter liegende Version ist DALL-E3.

Literaturtipp: Generative KI im Musikbusiness

Die Popakademie Baden-Württemberg in Mannheim hat ein Whitepaper zu generativer KI im Musikbusiness veröffentlicht (s. Pressemeldung vom 19. Dezember 2023).


Whitepaper
https://www.popakademie.de/media/?file=889_popakademiedigital_06_generative_ki_im_musikbusiness_stammer2023.pdf&download


Toolboard
Zum Paper gehört ein Toolboard, das 50 aktuell verfügbare Anwendungen zur KI-gestützten Musikproduktion visualisiert: https://miro.com/app/board/uXjVM8uA-30=/


Tabellarische Übersicht
Die Tools werden zudem nach Anwendungsgebiet und Funktion beschrieben: https://docs.google.com/spreadsheets/d/1_rbSL_8EyeuX4BKmdiqk5G_4XhTEjoLBUfB69vLUbA0/edit#gid=0

KI-Bildgeneratoren

Die Thematik „KI-Bildgeneratoren“ („text-to-image-models“ als Teil von „generative artificial intelligence“) ist spannend und sehr dynamisch in der Entwicklung und Preisgestaltung. Im Folgenden eine Zusammenfassung der Basics aus meiner persönlichen Sicht mit Stand Anfang Dezember 2023.


Dreamstudio Beispiel RunwayML Beispiel ChatGPT Plus Beispiel Supermachine Beispiel  Bing Chat Beispiel


DALL-E, Midjourney und Stable Diffusion (incl. SDXL) sind die verbreitetsten und bekanntesten KI-Bildgenerator-Modelle. Im Unterschied zu DALL-E und Midjourney macht Stable Diffusion den Quellcode zugänglich. Unter der Funktion „KI-Bildgenerator“ verstehe ich zunächst grundlegend das Erstellen von fotorealistischen oder künstlerischen Bildern durch eine beschreibende Texteingabe (Prompt) – oft gibt es dabei Custom Models für das Generieren von Bildern in unterschiedlichen Stilen. Darüber hinaus bieten die KI-Bildgeneratoren noch viele weitere Funktionen.
KI-generierte Bilder sind manchmal nur schwer von echten Bildern zu unterscheiden – Indikatoren für KI-generierte Bilder können falsche/sinnlose Text-Beschriftungen sein, doppelte oder fehlerhafte Elemente und auch mit der Darstellung von Fingern/Haut gibt es oft sichtbare Probleme.

Die Prompts sollten die Szene und Eigeschaften beschreiben und können Anweisungen zu Handlung, Umgebung, Licht, Anordnung der Elemente, Stil, Blickwinkel und Emotion beinhalten.
Man könnte sich auch in ChatGPT Plus einen passenden Prompt erstellen lassen, indem man seine Wünsche dort kurz formuliert: „Erstelle mir einen Prompt für ein Bild, das (…) zeigt.“ und Inspiration für die Ausarbeitung erhält (s. ChatGPT Plus Panda-Beispiel).
Oder falls ChatGPT Plus durch diese Anforderung gleich ein Bild liefert, hinterher nachfragen „Wie lautet der für das Bild verwendete Prompt?“, um etwaige Änderungswünsche besser in Auftrag geben zu können.
Ausgefeilte Prompts werden von verschiedenen Diensten durchaus unterschiedlich interpretiert und dann ggf. in Teilen ignoriert/missverstanden. In der Regel gibt es auch ein Zeichenlimit. Daher ist es gut, darauf zu achten, was vom jeweiligen Dienst an Beispielen angeboten wird oder systemseitig an Ergebnis-Rückmeldungen erfolgt – bei ChatGPT Plus z. B. „Here is the icon symbolizing a teacher, designed with a minimalistic and expressive style“.
Stable Diffusion bietet einen „prompts search engine“ an: https://stablediffusionweb.com/prompts
Craiyon etwa zeigt unten immer einen Block „Inspirations“ mit Prompts und Ergebnissen an, die inhaltlich in Relation stehen zu der Eingabe, die man selbst oben gerade im Eingabefeld macht. Bzgl. Prompts bei Midjourney s.u. Artikel.
Während in ChatGPT Plus die Bilder rein per Textchat-Aufforderungen generiert und angepasst werden, ist es in KI-Bildgenerator-Programmen üblich, dass parallel zum Prompt viele weitere Einstellungen ausgewählt werden können.

DALL-E ist (wie ich hier schon beschrieben habe) über verschiedene Dienste/Webseiten nutzbar – in der derzeit aktuellsten Version DALL-E3 kostenlos m.W.n. nur über Microsoft-Account, entweder per https://www.bing.com/create oder direkt im Bing Chat, was ich bisher übersehen hatte (daher hier heute dieses Bing Chat Graureiher-Beispiel: Bild1, Bild2). Selbst nutze ich meinen kostenpflichtigen Zugang über die ChatGPT Plus-Integration, die den Riesenvorteil hat, dass im Rahmen von Textchat schon länger Bilder generiert und modifiziert werden können mit – wie ich finde – beeindruckender Output-Qualität und inzwischen sogar auch für eigene erstellte GPTs (s. mein GPT „Cheery Creator“: https://chat.openai.com/g/g-sQbPSW1Rx-cheery-creator).
Auffällig ist, dass bei ChatGPT Plus-Prompts durchaus Meldungen kommen im Sinne von „I’m sorry, but I’m unable to generate images that (…), as it goes against our content policy“. Eine Stärke von den Bildgeneratoren sind Bilder im Stile von berühmten Künstlern und da muss man dann – je nach Dienst – schon genau sein mit den Lebensdaten: „im Stile von Franz Marc“ ist auch bei ChatGPT Plus erlaubt.

Midjourney bietet leider keinen Testzugang und ist nur über kostenpflichtiges Abo nutzbar via https://www.midjourney.com/
Als Ersatz für einen persönlichen Test dient mir dieser Artikel: https://bootcamp.uxdesign.cc/the-ultimate-midjourney-cheat-sheet-2023-copy-paste-prompt-for-any-style-779049396dbe

Stable Diffusion wird in verschiedenen Diensten genutzt wie z. B. diesen beiden an der Entwicklung beteiligten Firmen, bei denen es nach Registrierung einige kostenlose Credits gibt. Zum Kurz-Test habe ich 3 verschiedene Prompt-Beispiele jeweils in die u.g. Dienste eingegeben und dann Screenshots der Oberfläche und ersten Ergebnisse erstellt, s.u. PDFs.
Prompt 1 = a teacher, modern line icon, cute young character avatar, smiling, icon design, minimalistic, black line on white background
Prompt 2 = a raccoon Franz Marc style
Prompt 3 = cute young female sitting on a beach reading a book, photo realistic style

Zum Vergleich mit Stable Diffusion hier die 3 Prompts, wie sie ChatGPT Plus mit DALL-E3 interpretiert hat (Testergebnis-PDF) (Einzelbild 1, Einzelbild 2, Einzelbild 3, Einzelbild 3a).

 

Abschließend noch der Hinweis auf von mir benutzte Bildgeneratoren ohne jegliche Registrierung und mit zumindest einigen kostenlosen Funktionen:

    • dream by Wombo: https://dream.ai/ Dieser Dienst war eine Empfehlung der c’t 2022, Heft25, und sorgte mit den damals erzeugten Bildern für einen privaten Waschbär-Kunst-Kalender schon Weihnachten 2022 für Begeisterung.

    • Craiyon (Modell DALL·E mini): https://www.craiyon.com/ Kostenlos für Privatzwecke und einfach nutzbar, benötigt ca. 1min.

    • (Update 2.1.24)
      Stable Diffusion Online: https://stablediffusionweb.com/
      Ohne Registrierung, ohne Anmeldung, allerdings aufwändige cookie policy und Generieren dauert einige Minuten. Ergebnisse in CC0 1.0 Lizenz

Cheery Creator – Chatbot GPT

Soeben habe ich meinen ersten Chatbot (powered by GPT-4) generiert und ich bin noch ganz hin und weg, wie einfach es war und wie beachtlich das Ergebnis ist! Kein Wunder, dass OpenAI momentan den Zugriff limitiert (keine neuen ChatGPT Plus-Kunden und zeitliche Limitierung bei Bestandskunden). Auch ich wurde kurz nach dem Fertigstellen meines GPTs und einigen Testläufen für einige Stunden „ausgesperrt“ – Das lässt Zeit für den folgenden Blogbeitrag.

Spoiler: Mein GPT ist inzwischen „Public“ und kann gerne getestet werden, s.u.

Das Erstellen eines Chatbots

Über den ChatGPT Plus-Menüpunkt „Explore“ kann man …

  • in wenigen Sätzen seine Idee für den Chatbot beschreiben
  • einen Titel vergeben (oder sich vorschlagen lassen)
  • ein Logo generieren lassen und per Chat anpassen
  • Beispiel-Prompts für die Startseite akzeptieren oder ändern
  • einfache Anpassungen machen, z. B. was in einem 2. Schritt passieren soll oder welche etwaigen Nachfragen immer oder zufällig gestellt werden sollen
  • uvm.

Beim Editieren ist der Bildschirm zweigeteilt: links der GPT Builder  mit Create-Chat zum Konfigurieren (inkl. einem Configure-Formular, in dem man auch Funktionen deaktivieren könnte) und rechts die große Vorschau mit dem Bereich zum sofortigen Testen.

Der Rest passiert automatisch und ChatGPT Plus generiert die Dialoge und Bilder dann wie üblich entsprechend seines Modells. Bei meiner Idee ist garantiert, dass die Ergebnisse nicht langweilig werden…

Freigabe: Den eigenen Chatbot kann man für ausgewählte Personen, die den Link kennen, freigeben (=Default) oder als Public. Den „Cheery Creator“ ausprobieren können allerdings nur Personen mit ChatGPT Plus-Account, denn der Link alleine und ein kostenloser OpenAI-Account reichen nicht.

Meine Idee: „Cheery Creator“

Die Zeiten sind düster genug, etwas verbale Aufheiterung per ganz kurzem Textchat kann nicht schaden und DALL-E3 generiert generell hervorragende Bilder. Warum also nicht Beides kombinieren und noch dazu mit der Idee von Ausmal-Motiven? Und natürlich immer mit Waschbär!

Beispiel Cheery Creator (zum Vergrößern anklicken)

 


Update: Inzwischen habe ich wieder Zugriff auf ChatGPT Plus und noch ein wenig getestet. Die Ergebnisse waren so schön, dass ich den „Cheery Creator“ nun als „Public“ freigegeben habe – wer mag (und ein ChatGPT-Plus-Abo hat), kann also gerne unter dem angegebenen Link testen.

Hier geht es zum „Cheery Creator“:
https://chat.openai.com/g/g-sQbPSW1Rx-cheery-creator

 

 

ChatGPT Plus und Bilderkennung

Und schon wieder hat sich ChatGPT Plus deutlich verändert: Endlich ist das Dropdown-Menü weg und die sonst nur alternativ auswählbaren Optionen „browse the web“, „analyze data“ und „generate images“ (= DALL-E3) sind jetzt direkt in GPT-4 enthalten. Lediglich die Plugins sind nun noch eine alternative Auswahloption. Btw, meine bisherigen Plugins sind aktuell weg – ob wegen des kürzlichen ChatGPT Plus-Updates oder anderer Gründe bleibt mir unklar.

chatgptplus-01.jpg   chatgptplus-02.jpg

Komplett neu in ChatGPT Plus ist die Möglichkeit, eigene GPTs zu erzeugen oder per „Explore“ von anderen bereits erstellte GPTs zu nutzen – doch das ist ein spannender Test für einen anderen Tag.

 

Test der Bilderkennungsfunktion per Upload eigener Fotos

Denn genauer anschauen möchte ich mir heute die viel gelobte Bilderkennungsfunktion, von der ich inzwischen annehme, dass ich sie noch gar nicht hatte, als ich versucht hatte, sie zu testen (s. Blogbeitrag vom 1.10.23). 

 

Beispiel 1: Gebäude „where is this?“

20231110-chatgptplus-03-chat.jpg

Ergebnis: Dieses Mal auf Anhieb korrekt erkannt (vgl. Blogbeitrag vom 1.10.23).

 

Beispiel 2: Geldsumme „what is the total?“

20231110-chatgptplus-04-chat.jpg

Ergebnis: Nicht schlecht, aber ChatGPT Plus machte bei der Erkennung aus einer 20 eine 50 – immerhin stimmte dann die Summe aus seinen erkannten Einzelpositionen.

 

Beispiel 3: Uhrzeit „what time is it?“

20231110-chatgptplus-05-chat.jpg

Ergebnis: Das scheint generell ein Problem zu sein, wie ich neulich in einem Artikel gelesen habe – wegen entsprechender Trainingsdaten kommt hier sowieso immer 10:10 Uhr heraus. Nunja, eine kleine Variation hat ChatGPT Plus bei mir ja zunächst versucht mit dem Ergebnis 10:09.

Da reizte es mich doch, den gleichen Prompt „what time is it?“ mit einem Foto einer digitalen Zeitanzeige zu probieren.

20231110-chatgptplus-06-chat.jpg

Ergebnis: Bei einem Uhrenfoto mit digitaler Anzeige war ChatGPT Plus wieder auf sicherem Terrain und lieferte korrekt die abgebildete Uhrzeit. Beim ersten Versuch gab es allerdings nur eine Fehlermeldung.

 

Auch heute finde ich die ChatGPT Plus-Ergebnisse beeindruckend, wenngleich man wirklich genau hinsehen muss (Geldsumme) und eben den Trainingsbesonderheiten eines LLM unterliegt (die man normalerweise ja nicht kennt), d.h. somit JEDES Ergebnis von ChatGPT Plus erst einmal kritisch hinterfragen sollte, wenn man nicht um Kreativität gebeten hat.