AI Music Tools: Copilot & Songs with Suno

„Turn your ideas into songs with Suno on Microsoft Copilot“ – Das war eine Headline letzte Woche im Microsoft-Blog (Link Microsoft Blog).

Meine Tests basierten natürlich immer auf Waschbär-Prompts, meinem Markenzeichen für KI-Tests. Die schnell erzeugten Ergebnisse mit ihren jeweiligen Songausschnitten < 1min sind hier im Folgenden aufgelistet.

 

Beispiel 1 (Screenshot)
„Erstelle mir einen Pop-Song mit einem Waschbär, der in der Stadt Kassel auf Wohnungssuche ist.“

[Verse]
Ich bin ein kleiner Waschbär in der Stadt Kassel
Auf Wohnungssuche, doch es ist nicht einfach (nicht einfach)
Ich suche Wärme und ein gemütliches Zuhause
Doch immer wieder hör‘ ich ein trauriges „Nein“ (oh-oh-oh)

[Chorus]
Ich bin ein Waschbär in der Stadt (Stadt)
Suche nach einem Platz zum Leben (Leben)
Doch keiner lässt mich rein (rein)
Ich finde keinen Ort zum Verweilen (weilen)
Doch ich geb‘ nicht auf (nicht auf)
Ich bleibe stark und werd‘ nicht verzagen (ja, ja)
Ein kleiner Waschbär auf Wohnungssuche in Kassel (oh-oh-oh-oh)

MP3-Ergebnis Copilot&Suno – Beispiel 1:

 

Beispiel 2 (Screenshot)
„Erstell mir einen Song über einen Waschbär, der in Kassel eine Wohnung sucht. Country-Music-Style. Ironischer Text.“

Verse]
In Kassel da war ein Waschbär froh und munter
Er suchte ’ne Wohnung, doch er fand keine Winterunterkunft
Er fragte die Leute, ob sie ihm helfen könnten
Doch keiner will den Waschbär bei sich drinn haben

[Chorus]
Waschbär auf Wohnungssuche (Waschbär)
In Kassel keine Wohnung (oh nein)
Mit Fell so weich und süß (so süß)
Doch hier will ihn niemand (niemand)
Waschbär auf Wohnungssuche (Waschbär)
Oh bitte helft dem kleinen Kerl (bitte!)
Ein Leben ohne Heim ist nicht fair (nicht fair)
Oh bitte helft dem Waschbär, ja

MP3-Ergebnis Copilot&Suno – Beispiel 2:

 

Beispiel 3 (Screenshot)
„can you compose a song (text and audio) about a racoon looking for a flat in Kassel?“

[Verse]
In the city of Kassel, where the streets are so grand
There’s a raccoon on a mission, with a dream in his hand
He’s looking for a flat, a place to call his own
No dumpsters or trash cans, a cozy little zone

[Chorus]
Oh, raccoon in the city, with your furry little mask (ooh-yeah)
Searching high and low, for a home that’s gonna last
Through the hustle and bustle, you’re on a quest so true
Raccoon in the city, we’re all rooting for you (ooh-yeah)

MP3-Ergebnis Copilot&Suno – Beispiel 3:


Die in Copilot erzeugten Songbeispiele kann man dann auch als Link teilen wie hier z.B.
Anhören auf Microsoft/Suno https://sl.bing.net/jaK3AzD2Fci


Das im Handelsblatt KI Briefing vom 22.12.23 erwähnte Verfahren, direkt auf der Website Suno.ai einen Song erstellen zu lassen, habe ich nicht getestet. Und etwas überraschend für mich war, dass innerhalb ChatGPTPlus m.W.n. derzeit keine Möglichkeit existiert, Ideen in Songtexte und Songs zu verwandeln.

KI-Bildgeneratoren

Die Thematik „KI-Bildgeneratoren“ („text-to-image-models“ als Teil von „generative artificial intelligence“) ist spannend und sehr dynamisch in der Entwicklung und Preisgestaltung. Im Folgenden eine Zusammenfassung der Basics aus meiner persönlichen Sicht mit Stand Anfang Dezember 2023.


Dreamstudio Beispiel RunwayML Beispiel ChatGPT Plus Beispiel Supermachine Beispiel  Bing Chat Beispiel


DALL-E, Midjourney und Stable Diffusion (incl. SDXL) sind die verbreitetsten und bekanntesten KI-Bildgenerator-Modelle. Im Unterschied zu DALL-E und Midjourney macht Stable Diffusion den Quellcode zugänglich. Unter der Funktion „KI-Bildgenerator“ verstehe ich zunächst grundlegend das Erstellen von fotorealistischen oder künstlerischen Bildern durch eine beschreibende Texteingabe (Prompt) – oft gibt es dabei Custom Models für das Generieren von Bildern in unterschiedlichen Stilen. Darüber hinaus bieten die KI-Bildgeneratoren noch viele weitere Funktionen.
KI-generierte Bilder sind manchmal nur schwer von echten Bildern zu unterscheiden – Indikatoren für KI-generierte Bilder können falsche/sinnlose Text-Beschriftungen sein, doppelte oder fehlerhafte Elemente und auch mit der Darstellung von Fingern/Haut gibt es oft sichtbare Probleme.

Die Prompts sollten die Szene und Eigeschaften beschreiben und können Anweisungen zu Handlung, Umgebung, Licht, Anordnung der Elemente, Stil, Blickwinkel und Emotion beinhalten.
Man könnte sich auch in ChatGPT Plus einen passenden Prompt erstellen lassen, indem man seine Wünsche dort kurz formuliert: „Erstelle mir einen Prompt für ein Bild, das (…) zeigt.“ und Inspiration für die Ausarbeitung erhält (s. ChatGPT Plus Panda-Beispiel).
Oder falls ChatGPT Plus durch diese Anforderung gleich ein Bild liefert, hinterher nachfragen „Wie lautet der für das Bild verwendete Prompt?“, um etwaige Änderungswünsche besser in Auftrag geben zu können.
Ausgefeilte Prompts werden von verschiedenen Diensten durchaus unterschiedlich interpretiert und dann ggf. in Teilen ignoriert/missverstanden. In der Regel gibt es auch ein Zeichenlimit. Daher ist es gut, darauf zu achten, was vom jeweiligen Dienst an Beispielen angeboten wird oder systemseitig an Ergebnis-Rückmeldungen erfolgt – bei ChatGPT Plus z. B. „Here is the icon symbolizing a teacher, designed with a minimalistic and expressive style“.
Stable Diffusion bietet einen „prompts search engine“ an: https://stablediffusionweb.com/prompts
Craiyon etwa zeigt unten immer einen Block „Inspirations“ mit Prompts und Ergebnissen an, die inhaltlich in Relation stehen zu der Eingabe, die man selbst oben gerade im Eingabefeld macht. Bzgl. Prompts bei Midjourney s.u. Artikel.
Während in ChatGPT Plus die Bilder rein per Textchat-Aufforderungen generiert und angepasst werden, ist es in KI-Bildgenerator-Programmen üblich, dass parallel zum Prompt viele weitere Einstellungen ausgewählt werden können.

DALL-E ist (wie ich hier schon beschrieben habe) über verschiedene Dienste/Webseiten nutzbar – in der derzeit aktuellsten Version DALL-E3 kostenlos m.W.n. nur über Microsoft-Account, entweder per https://www.bing.com/create oder direkt im Bing Chat, was ich bisher übersehen hatte (daher hier heute dieses Bing Chat Graureiher-Beispiel: Bild1, Bild2). Selbst nutze ich meinen kostenpflichtigen Zugang über die ChatGPT Plus-Integration, die den Riesenvorteil hat, dass im Rahmen von Textchat schon länger Bilder generiert und modifiziert werden können mit – wie ich finde – beeindruckender Output-Qualität und inzwischen sogar auch für eigene erstellte GPTs (s. mein GPT „Cheery Creator“: https://chat.openai.com/g/g-sQbPSW1Rx-cheery-creator).
Auffällig ist, dass bei ChatGPT Plus-Prompts durchaus Meldungen kommen im Sinne von „I’m sorry, but I’m unable to generate images that (…), as it goes against our content policy“. Eine Stärke von den Bildgeneratoren sind Bilder im Stile von berühmten Künstlern und da muss man dann – je nach Dienst – schon genau sein mit den Lebensdaten: „im Stile von Franz Marc“ ist auch bei ChatGPT Plus erlaubt.

Midjourney bietet leider keinen Testzugang und ist nur über kostenpflichtiges Abo nutzbar via https://www.midjourney.com/
Als Ersatz für einen persönlichen Test dient mir dieser Artikel: https://bootcamp.uxdesign.cc/the-ultimate-midjourney-cheat-sheet-2023-copy-paste-prompt-for-any-style-779049396dbe

Stable Diffusion wird in verschiedenen Diensten genutzt wie z. B. diesen beiden an der Entwicklung beteiligten Firmen, bei denen es nach Registrierung einige kostenlose Credits gibt. Zum Kurz-Test habe ich 3 verschiedene Prompt-Beispiele jeweils in die u.g. Dienste eingegeben und dann Screenshots der Oberfläche und ersten Ergebnisse erstellt, s.u. PDFs.
Prompt 1 = a teacher, modern line icon, cute young character avatar, smiling, icon design, minimalistic, black line on white background
Prompt 2 = a raccoon Franz Marc style
Prompt 3 = cute young female sitting on a beach reading a book, photo realistic style

Zum Vergleich mit Stable Diffusion hier die 3 Prompts, wie sie ChatGPT Plus mit DALL-E3 interpretiert hat (Testergebnis-PDF) (Einzelbild 1, Einzelbild 2, Einzelbild 3, Einzelbild 3a).

 

Abschließend noch der Hinweis auf von mir benutzte Bildgeneratoren ohne jegliche Registrierung und mit zumindest einigen kostenlosen Funktionen:

    • dream by Wombo: https://dream.ai/ Dieser Dienst war eine Empfehlung der c’t 2022, Heft25, und sorgte mit den damals erzeugten Bildern für einen privaten Waschbär-Kunst-Kalender schon Weihnachten 2022 für Begeisterung.

    • Craiyon (Modell DALL·E mini): https://www.craiyon.com/ Kostenlos für Privatzwecke und einfach nutzbar, benötigt ca. 1min.

    • (Update 2.1.24)
      Stable Diffusion Online: https://stablediffusionweb.com/
      Ohne Registrierung, ohne Anmeldung, allerdings aufwändige cookie policy und Generieren dauert einige Minuten. Ergebnisse in CC0 1.0 Lizenz