Experiment: Bilder kopieren via ChatGPT Plus

Was passiert, wenn man in ChatGPT Plus ein Prompt im Sinne von „Kannst Du dieses hochgeladene Bild bestmöglich kopieren?“ mit dem Upload eines selbst gemachten Fotos verbindet?

Ein Selbstversuch mit vier eigenen Fotos innerhalb eines Chatverlaufs ergibt Klarheit.

Fazit: ChatGPT Plus analysiert, was auf dem Foto abgebildet ist, schreibt sich für die wesentlichen erkannten Merkmale einen entsprechenden Prompt und erstellt daraus ein Bild – in überraschend guter Qualität.
In allen Fällen wurden die wesentlichen Aspekte gut erkannt, wenngleich das Ergebnis vom Stil her nicht immer photorealistisch war und teils auch noch typische KI-Merkmale/Fehler enthielt. Am Besten und realistischsten war das Paris-Beispiel, bei dem sogar noch Elemente des Louvre, die auf meinem Foto gar nicht zu sehen waren, hinzugefügt wurden – sicherlich eine Sache der Trainingsdaten. Dass ChatGPT Plus den Pilsumer Leuchtturm erkennt, war hingegen eher nicht zu erwarten und somit wurde hier ein anderer Leuchtturm-Typ verwendet – erstaunt war ich über die Windräder, die erkannt wurden, da diese in meinem Foto doch sehr im Hintergrund standen. Reiterbildstatuen sind offensichtlich auch kein Problem für ChatGPT Plus. Die (allerdings etwas hölzernen) Kühe in Landschaft wurden besser präsentiert als auf meinem schlecht belichteten Foto, aber dafür inklusive einer im Zaun steckenden Kuh – Hin und wieder werden bei der KI-Bildgenerierung noch derartige Überlappungs-Effekte deutlich.


1. Pilsumer Leuchtturm

Ich: Kannst Du bei diesem Bild die Farbe des Leuchtturmes in schwarz weiß ändern?
ChatGPT Plus: Ich kann das Originalbild nicht direkt bearbeiten, um die Farben des Leuchtturms zu ändern. Allerdings kann ich ein neues Bild mit einem ähnlichen Leuchtturm in Schwarz-Weiß erstellen. Soll ich das machen?
Ich: Ja
ChatGPT Plus: Hier ist ein neu generiertes Bild, das einem grünen Feld mit einem Weg führt, der zu einem Leuchtturm mit einer auffälligen schwarz-weißen Streifenmusterung führt. Der Himmel ist klar und blau mit flauschigen weißen Wolken, und im Hintergrund sind Windturbinen zu sehen.

Eigenes Foto Pilsumer Leuchtturm ChatGPTPlus-Ergebnis zum Leuchtturm

(Bilder zum Vergrößern anklicken)


2. Pariser Louvre-Glaspyramide

Ich: Kannst Du dieses hochgeladene Bild bestmöglich kopieren?
ChatGPT Plus: Hier ist ein generiertes Bild, das die Beschreibung des hochgeladenen Fotos nachbildet: Eine moderne Glaspyramide, umgeben von Wasser und Fontänen, unter einem dramatischen Wolkenhimmel.

Eigenes Foto Pariser Louvre-Glaspyramide ChatGPTPlus-Ergebnis zur Glaspyramide

(Bilder zum Vergrößern anklicken)


3. Dresdner Reiterstandbild Goldener Reiter

Ich: Kannst Du dieses hochgeladene Bild bestmöglich kopieren und nur die Farbe des Pferdes in weiß ändern?
ChatGPT Plus: Hier ist das neu erstellte Bild mit einer Statue eines Reiters auf einem Pferd, wobei das Pferd eine auffällige weiße Farbe hat.

Eigenes Foto Dresdner Reiterstandbild Goldener Reiter ChatGPTPlus-Ergebnis zum Reiterstandbild

(Bilder zum Vergrößern anklicken)


4. Kühe in Heidelberger Landschaft

Ich: Kannst du aus diesem Bild mit Kühen etwas Ähnliches generieren?
ChatGPT Plus: Hier ist ein generiertes Bild, das eine ruhige ländliche Szene mit einer Gruppe von Kühen zeigt, die in der Nähe eines Wasserbehälters unter dem Schatten von grünen Bäumen grasen.

Eigenes Foto Kühe in Heidelberger Landschaft ChatGPTPlus-Ergebnis zu den Kühen

(Bilder zum Vergrößern anklicken)


Hinweise:

  • Man sollte in ChatGPT Plus keine fremden Bilder hochladen, für die man keine Rechte am Bild hat. Zudem muss man davon ausgehen, dass bei Standard-ChatGPT Plus-Accounts alle hochgeladenen Dateien als ChatGPT-Trainingsdaten verwendet werden!
  • Die hier abgebildeten KI-Bilder wurden im Dialog über die Webanwendung von ChatGPT Plus und die Auswahl „ChatGPT4 (With DALL-E, browsing and analysis)“ erzeugt. Die dahinter liegende Version ist DALL-E3.

Literaturtipp: Generative KI im Musikbusiness

Die Popakademie Baden-Württemberg in Mannheim hat ein Whitepaper zu generativer KI im Musikbusiness veröffentlicht (s. Pressemeldung vom 19. Dezember 2023).


Whitepaper
https://www.popakademie.de/media/?file=889_popakademiedigital_06_generative_ki_im_musikbusiness_stammer2023.pdf&download


Toolboard
Zum Paper gehört ein Toolboard, das 50 aktuell verfügbare Anwendungen zur KI-gestützten Musikproduktion visualisiert: https://miro.com/app/board/uXjVM8uA-30=/


Tabellarische Übersicht
Die Tools werden zudem nach Anwendungsgebiet und Funktion beschrieben: https://docs.google.com/spreadsheets/d/1_rbSL_8EyeuX4BKmdiqk5G_4XhTEjoLBUfB69vLUbA0/edit#gid=0

AI Music Tools: Copilot & Songs with Suno

„Turn your ideas into songs with Suno on Microsoft Copilot“ – Das war eine Headline letzte Woche im Microsoft-Blog (Link Microsoft Blog).

Meine Tests basierten natürlich immer auf Waschbär-Prompts, meinem Markenzeichen für KI-Tests. Die schnell erzeugten Ergebnisse mit ihren jeweiligen Songausschnitten < 1min sind hier im Folgenden aufgelistet.

 

Beispiel 1 (Screenshot)
„Erstelle mir einen Pop-Song mit einem Waschbär, der in der Stadt Kassel auf Wohnungssuche ist.“

[Verse]
Ich bin ein kleiner Waschbär in der Stadt Kassel
Auf Wohnungssuche, doch es ist nicht einfach (nicht einfach)
Ich suche Wärme und ein gemütliches Zuhause
Doch immer wieder hör‘ ich ein trauriges „Nein“ (oh-oh-oh)

[Chorus]
Ich bin ein Waschbär in der Stadt (Stadt)
Suche nach einem Platz zum Leben (Leben)
Doch keiner lässt mich rein (rein)
Ich finde keinen Ort zum Verweilen (weilen)
Doch ich geb‘ nicht auf (nicht auf)
Ich bleibe stark und werd‘ nicht verzagen (ja, ja)
Ein kleiner Waschbär auf Wohnungssuche in Kassel (oh-oh-oh-oh)

MP3-Ergebnis Copilot&Suno – Beispiel 1:

 

Beispiel 2 (Screenshot)
„Erstell mir einen Song über einen Waschbär, der in Kassel eine Wohnung sucht. Country-Music-Style. Ironischer Text.“

Verse]
In Kassel da war ein Waschbär froh und munter
Er suchte ’ne Wohnung, doch er fand keine Winterunterkunft
Er fragte die Leute, ob sie ihm helfen könnten
Doch keiner will den Waschbär bei sich drinn haben

[Chorus]
Waschbär auf Wohnungssuche (Waschbär)
In Kassel keine Wohnung (oh nein)
Mit Fell so weich und süß (so süß)
Doch hier will ihn niemand (niemand)
Waschbär auf Wohnungssuche (Waschbär)
Oh bitte helft dem kleinen Kerl (bitte!)
Ein Leben ohne Heim ist nicht fair (nicht fair)
Oh bitte helft dem Waschbär, ja

MP3-Ergebnis Copilot&Suno – Beispiel 2:

 

Beispiel 3 (Screenshot)
„can you compose a song (text and audio) about a racoon looking for a flat in Kassel?“

[Verse]
In the city of Kassel, where the streets are so grand
There’s a raccoon on a mission, with a dream in his hand
He’s looking for a flat, a place to call his own
No dumpsters or trash cans, a cozy little zone

[Chorus]
Oh, raccoon in the city, with your furry little mask (ooh-yeah)
Searching high and low, for a home that’s gonna last
Through the hustle and bustle, you’re on a quest so true
Raccoon in the city, we’re all rooting for you (ooh-yeah)

MP3-Ergebnis Copilot&Suno – Beispiel 3:


Die in Copilot erzeugten Songbeispiele kann man dann auch als Link teilen wie hier z.B.
Anhören auf Microsoft/Suno https://sl.bing.net/jaK3AzD2Fci


Das im Handelsblatt KI Briefing vom 22.12.23 erwähnte Verfahren, direkt auf der Website Suno.ai einen Song erstellen zu lassen, habe ich nicht getestet. Und etwas überraschend für mich war, dass innerhalb ChatGPTPlus m.W.n. derzeit keine Möglichkeit existiert, Ideen in Songtexte und Songs zu verwandeln.

KI-Bildgeneratoren

Die Thematik „KI-Bildgeneratoren“ („text-to-image-models“ als Teil von „generative artificial intelligence“) ist spannend und sehr dynamisch in der Entwicklung und Preisgestaltung. Im Folgenden eine Zusammenfassung der Basics aus meiner persönlichen Sicht mit Stand Anfang Dezember 2023.


Dreamstudio Beispiel RunwayML Beispiel ChatGPT Plus Beispiel Supermachine Beispiel  Bing Chat Beispiel


DALL-E, Midjourney und Stable Diffusion (incl. SDXL) sind die verbreitetsten und bekanntesten KI-Bildgenerator-Modelle. Im Unterschied zu DALL-E und Midjourney macht Stable Diffusion den Quellcode zugänglich. Unter der Funktion „KI-Bildgenerator“ verstehe ich zunächst grundlegend das Erstellen von fotorealistischen oder künstlerischen Bildern durch eine beschreibende Texteingabe (Prompt) – oft gibt es dabei Custom Models für das Generieren von Bildern in unterschiedlichen Stilen. Darüber hinaus bieten die KI-Bildgeneratoren noch viele weitere Funktionen.
KI-generierte Bilder sind manchmal nur schwer von echten Bildern zu unterscheiden – Indikatoren für KI-generierte Bilder können falsche/sinnlose Text-Beschriftungen sein, doppelte oder fehlerhafte Elemente und auch mit der Darstellung von Fingern/Haut gibt es oft sichtbare Probleme.

Die Prompts sollten die Szene und Eigeschaften beschreiben und können Anweisungen zu Handlung, Umgebung, Licht, Anordnung der Elemente, Stil, Blickwinkel und Emotion beinhalten.
Man könnte sich auch in ChatGPT Plus einen passenden Prompt erstellen lassen, indem man seine Wünsche dort kurz formuliert: „Erstelle mir einen Prompt für ein Bild, das (…) zeigt.“ und Inspiration für die Ausarbeitung erhält (s. ChatGPT Plus Panda-Beispiel).
Oder falls ChatGPT Plus durch diese Anforderung gleich ein Bild liefert, hinterher nachfragen „Wie lautet der für das Bild verwendete Prompt?“, um etwaige Änderungswünsche besser in Auftrag geben zu können.
Ausgefeilte Prompts werden von verschiedenen Diensten durchaus unterschiedlich interpretiert und dann ggf. in Teilen ignoriert/missverstanden. In der Regel gibt es auch ein Zeichenlimit. Daher ist es gut, darauf zu achten, was vom jeweiligen Dienst an Beispielen angeboten wird oder systemseitig an Ergebnis-Rückmeldungen erfolgt – bei ChatGPT Plus z. B. „Here is the icon symbolizing a teacher, designed with a minimalistic and expressive style“.
Stable Diffusion bietet einen „prompts search engine“ an: https://stablediffusionweb.com/prompts
Craiyon etwa zeigt unten immer einen Block „Inspirations“ mit Prompts und Ergebnissen an, die inhaltlich in Relation stehen zu der Eingabe, die man selbst oben gerade im Eingabefeld macht. Bzgl. Prompts bei Midjourney s.u. Artikel.
Während in ChatGPT Plus die Bilder rein per Textchat-Aufforderungen generiert und angepasst werden, ist es in KI-Bildgenerator-Programmen üblich, dass parallel zum Prompt viele weitere Einstellungen ausgewählt werden können.

DALL-E ist (wie ich hier schon beschrieben habe) über verschiedene Dienste/Webseiten nutzbar – in der derzeit aktuellsten Version DALL-E3 kostenlos m.W.n. nur über Microsoft-Account, entweder per https://www.bing.com/create oder direkt im Bing Chat, was ich bisher übersehen hatte (daher hier heute dieses Bing Chat Graureiher-Beispiel: Bild1, Bild2). Selbst nutze ich meinen kostenpflichtigen Zugang über die ChatGPT Plus-Integration, die den Riesenvorteil hat, dass im Rahmen von Textchat schon länger Bilder generiert und modifiziert werden können mit – wie ich finde – beeindruckender Output-Qualität und inzwischen sogar auch für eigene erstellte GPTs (s. mein GPT „Cheery Creator“: https://chat.openai.com/g/g-sQbPSW1Rx-cheery-creator).
Auffällig ist, dass bei ChatGPT Plus-Prompts durchaus Meldungen kommen im Sinne von „I’m sorry, but I’m unable to generate images that (…), as it goes against our content policy“. Eine Stärke von den Bildgeneratoren sind Bilder im Stile von berühmten Künstlern und da muss man dann – je nach Dienst – schon genau sein mit den Lebensdaten: „im Stile von Franz Marc“ ist auch bei ChatGPT Plus erlaubt.

Midjourney bietet leider keinen Testzugang und ist nur über kostenpflichtiges Abo nutzbar via https://www.midjourney.com/
Als Ersatz für einen persönlichen Test dient mir dieser Artikel: https://bootcamp.uxdesign.cc/the-ultimate-midjourney-cheat-sheet-2023-copy-paste-prompt-for-any-style-779049396dbe

Stable Diffusion wird in verschiedenen Diensten genutzt wie z. B. diesen beiden an der Entwicklung beteiligten Firmen, bei denen es nach Registrierung einige kostenlose Credits gibt. Zum Kurz-Test habe ich 3 verschiedene Prompt-Beispiele jeweils in die u.g. Dienste eingegeben und dann Screenshots der Oberfläche und ersten Ergebnisse erstellt, s.u. PDFs.
Prompt 1 = a teacher, modern line icon, cute young character avatar, smiling, icon design, minimalistic, black line on white background
Prompt 2 = a raccoon Franz Marc style
Prompt 3 = cute young female sitting on a beach reading a book, photo realistic style

Zum Vergleich mit Stable Diffusion hier die 3 Prompts, wie sie ChatGPT Plus mit DALL-E3 interpretiert hat (Testergebnis-PDF) (Einzelbild 1, Einzelbild 2, Einzelbild 3, Einzelbild 3a).

 

Abschließend noch der Hinweis auf von mir benutzte Bildgeneratoren ohne jegliche Registrierung und mit zumindest einigen kostenlosen Funktionen:

    • dream by Wombo: https://dream.ai/ Dieser Dienst war eine Empfehlung der c’t 2022, Heft25, und sorgte mit den damals erzeugten Bildern für einen privaten Waschbär-Kunst-Kalender schon Weihnachten 2022 für Begeisterung.

    • Craiyon (Modell DALL·E mini): https://www.craiyon.com/ Kostenlos für Privatzwecke und einfach nutzbar, benötigt ca. 1min.

    • (Update 2.1.24)
      Stable Diffusion Online: https://stablediffusionweb.com/
      Ohne Registrierung, ohne Anmeldung, allerdings aufwändige cookie policy und Generieren dauert einige Minuten. Ergebnisse in CC0 1.0 Lizenz

Cheery Creator – Chatbot GPT

Soeben habe ich meinen ersten Chatbot (powered by GPT-4) generiert und ich bin noch ganz hin und weg, wie einfach es war und wie beachtlich das Ergebnis ist! Kein Wunder, dass OpenAI momentan den Zugriff limitiert (keine neuen ChatGPT Plus-Kunden und zeitliche Limitierung bei Bestandskunden). Auch ich wurde kurz nach dem Fertigstellen meines GPTs und einigen Testläufen für einige Stunden „ausgesperrt“ – Das lässt Zeit für den folgenden Blogbeitrag.

Spoiler: Mein GPT ist inzwischen „Public“ und kann gerne getestet werden, s.u.

Das Erstellen eines Chatbots

Über den ChatGPT Plus-Menüpunkt „Explore“ kann man …

  • in wenigen Sätzen seine Idee für den Chatbot beschreiben
  • einen Titel vergeben (oder sich vorschlagen lassen)
  • ein Logo generieren lassen und per Chat anpassen
  • Beispiel-Prompts für die Startseite akzeptieren oder ändern
  • einfache Anpassungen machen, z. B. was in einem 2. Schritt passieren soll oder welche etwaigen Nachfragen immer oder zufällig gestellt werden sollen
  • uvm.

Beim Editieren ist der Bildschirm zweigeteilt: links der GPT Builder  mit Create-Chat zum Konfigurieren (inkl. einem Configure-Formular, in dem man auch Funktionen deaktivieren könnte) und rechts die große Vorschau mit dem Bereich zum sofortigen Testen.

Der Rest passiert automatisch und ChatGPT Plus generiert die Dialoge und Bilder dann wie üblich entsprechend seines Modells. Bei meiner Idee ist garantiert, dass die Ergebnisse nicht langweilig werden…

Freigabe: Den eigenen Chatbot kann man für ausgewählte Personen, die den Link kennen, freigeben (=Default) oder als Public. Den „Cheery Creator“ ausprobieren können allerdings nur Personen mit ChatGPT Plus-Account, denn der Link alleine und ein kostenloser OpenAI-Account reichen nicht.

Meine Idee: „Cheery Creator“

Die Zeiten sind düster genug, etwas verbale Aufheiterung per ganz kurzem Textchat kann nicht schaden und DALL-E3 generiert generell hervorragende Bilder. Warum also nicht Beides kombinieren und noch dazu mit der Idee von Ausmal-Motiven? Und natürlich immer mit Waschbär!

Beispiel Cheery Creator (zum Vergrößern anklicken)

 


Update: Inzwischen habe ich wieder Zugriff auf ChatGPT Plus und noch ein wenig getestet. Die Ergebnisse waren so schön, dass ich den „Cheery Creator“ nun als „Public“ freigegeben habe – wer mag (und ein ChatGPT-Plus-Abo hat), kann also gerne unter dem angegebenen Link testen.

Hier geht es zum „Cheery Creator“:
https://chat.openai.com/g/g-sQbPSW1Rx-cheery-creator