RessourcenMusiktranskriptionAndrew Carlins•7 Min. Lesezeit

Können Gemini oder Claude aus einem Song Noten machen?

Viele bitten inzwischen Gemini und Claude, Aufnahmen in Noten zu verwandeln, so wie sie es früher bei ChatGPT versucht haben. Was diese KI-Assistenten mit Audio können, was nicht und womit wirklich genaue Noten entstehen.

Ob Google Gemini oder Anthropic Claude einen Song in Noten verwandeln können, was KI-Assistenten mit Audio anfangen können und was stattdessen funktioniert

Teil unseres Ratgebers zur Auswahl von Tools für Musiktranskription.

Allein nicht. Weder Gemini noch Claude kann sich eine Aufnahme anhören und daraus korrekte Noten schreiben, und keines der beiden liest gedruckte Noten Ton für Ton richtig ab. Beide können inzwischen deutlich mehr als ein reiner Text-Chatbot. Gemini nimmt Audio und Bilder an, Claude Bilder und Text, du kannst ihnen also mehr geben als nur Worte. Gebaut sind sie aber fürs Verstehen, also dafür, Sprache zu transkribieren, ein Bild zu beschreiben oder über einen Text nachzudenken. Die Signalverarbeitung, die Notation verlangt, gehört nicht dazu. Bittest du eines der beiden, einen Song zu transkribieren, bekommst du eine flüssige, selbstsichere Antwort voller Töne, die niemand gespielt hat.

Für Musik sind sie deshalb nicht nutzlos. Bei allem, was sich in Text abspielt, sind beide stark: Sie erklären Theorie, sprechen mit dir über Notation, die du einfügst, schlagen Akkordfolgen vor, skizzieren eine einstimmige Melodie oder stellen einen Übeplan auf. Du musst nur auseinanderhalten, welcher Teil der Arbeit mit Sprache zu tun hat und welcher aus Audio Noten macht. Beim ersten helfen dir die Chatbots, für den zweiten brauchst du ein eigenes Tool.

Was Gemini und Claude mit Musik können

Beide Modelle sind längst über reinen Text hinaus. Gemini ist von Grund auf multimodal. Du kannst eine Audiodatei hochladen, und Gemini transkribiert Sprache, fasst eine Aufnahme zusammen, erkennt, wer gerade spricht, und beantwortet Fragen zum Gesagten. Bilder nimmt es auch an. Claude verarbeitet Text und Bilder und liest ein Foto oder ein Dokument, das du ihm gibst. Zeigst du einem der beiden ein Bild von Noten, kann es sich das also ansehen und darauf antworten. Die Datei sehen oder hören können sie. Ob sie daraus korrekte Notation machen, ist eine andere Frage, und dafür braucht es eine viel speziellere Fähigkeit.

Solange es um Text und Theorie geht, helfen beide:

  • Theorie erklären. Frag, warum sich eine Akkordfolge genau so auflöst, was eine Tritonussubstitution ist oder wie man eine Molltonleiter harmonisiert, und du bekommst eine klare, meistens zuverlässige Erklärung.
  • Über Notation reden, die du als Text einfügst. Gib dem Modell ABC-Notation, ein Akkord-Sheet oder eine in Worten beschriebene Passage, und es benennt die Akkorde, erklärt, was da passiert, und schlägt Änderungen vor.
  • Akkordfolgen vorschlagen. Beschreib eine Stimmung oder eine Tonart, und es schlägt Akkordfolgen, Reharmonisierungen oder eine Basslinie zum Ausprobieren vor.
  • Eine einstimmige Melodie skizzieren. Wenn du eine Melodie in Worten beschreibst, schreibt es sie in einer Textnotation wie ABC auf, und die kannst du in ein Notationsprogramm einfügen.

Alle diese Beispiele fangen bei Text oder einer Beschreibung an, und was dabei herauskommt, ist wieder Text. Das Modell denkt über musikalische Symbole nach. Es wandelt weder Klang noch eine gedruckte Seite in exakte Töne um. Sobald die Aufgabe lautet „Hier ist eine Aufnahme, gib mir die Noten“, sind beide überfordert.

Warum sie keine Aufnahme transkribieren können

Aus Audio Notation zu machen ist ein Problem der Signalverarbeitung, und zwar ein schwieriges. Du musst die Tonhöhe jedes einzelnen Tons erkennen und genau bestimmen, wann er anfängt und aufhört. Töne, die sich überlagern, musst du voneinander trennen, etwa in einem Akkord oder in einem vollen Bandmix. Dann quantisierst du das Timing zu einem lesbaren Rhythmus, und erst danach kommt alles mit der richtigen Tonart und Taktart auf eine Notenzeile. Jeder dieser Schritte braucht ein eigenes, auf Audio trainiertes Modell. Geminis Audioverständnis ist auf Sprache ausgelegt, also auf die Worte, auf die Person, die spricht, und auf die Bedeutung. Gleichzeitig klingende Tonhöhen und Einsätze auseinanderzunehmen gehört nicht dazu. Claude nimmt gar keine Audiodateien an. Einen Song bekommt es nur über einen separaten Transkriptionsschritt mit.

Beim Lesen gedruckter Noten tappen die Modelle auf ihre eigene Art in dieselbe Falle. Wenn Forschende genau das in Benchmarks testen, erkennen die Modelle die Symbole auf der Seite sehr zuverlässig und machen daraus trotzdem meistens die falschen Töne. Sie greifen auf gleichmäßige Viertelnoten und tonleiterartige Läufe zurück, weil sich ihre Vermutungen auf Textmuster stützen und nicht auf die Musik, die tatsächlich dasteht. Selbst wenn ein Modell die Seite scheinbar klar „sieht“, weichen die Tonhöhen und Rhythmen, die es angibt, vom Notentext ab.

Fragst du trotzdem, machen beide, was Sprachmodelle bei Unsicherheit eben tun. Sie liefern eine flüssige, selbstsichere Antwort, die wie Notation aussieht und voller Töne ist, die niemand gespielt hat. Weil das Ergebnis so überzeugend wirkt, fallen die Fehler schwerer auf als eine offensichtliche Lücke. Schritt für Schritt erklärt unser Artikel darüber, wie KI-Musiktranskription funktioniert, was zu echter Transkription alles gehört. Warum gerade sich überlagernde Töne allgemeine Modelle aus dem Tritt bringen, liest du im Vergleich von einstimmiger und mehrstimmiger Transkription.

Was du stattdessen nimmst

Für den Schritt von Audio zu Noten nimmst du ein Tool, das genau dafür gebaut ist. Mit Songscription geht das so: Du lädst eine Audiodatei hoch oder fügst einen Link zu einem Video ein. Das Modell erkennt die Töne und gibt dir bearbeitbare Noten, dazu MIDI, MusicXML, Guitar-Pro-Tabs und eine interaktive Piano Roll, die du langsamer abspielen kannst, um das Ergebnis zu prüfen. Du gibst keine einzige Note von Hand ein, und falsche Töne korrigierst du im Browser, bevor du irgendetwas exportierst.

Nach dem ersten Durchgang sind ein paar Funktionen besonders nützlich. Eine Klavierstimme teilt Songscription automatisch auf zwei Hände auf, in Violin- und Bassschlüssel, statt alles in einen ungeordneten Strom zu packen. Es kann ein einzelnes Instrument aus einem vollen Mix herauslösen. Einen dichten Track transkribierst du deshalb am besten Instrument für Instrument. Im eingebauten Editor kannst du in jede Tonart transponieren, und ein Arrangement-Modus kann ein dichtes Stück auf ein leichteres Niveau vereinfachen oder eine einstimmige Melodielinie für ein Instrument schreiben, das im Original gar nicht vorkommt. Gemini und Claude geben dir einen Absatz über einen Song. Hier bekommst du Noten, nach denen du spielen und die du weiter bearbeiten kannst.

Bei der Genauigkeit solltest du realistisch bleiben. Zaubern kann auch dieses Tool nicht. Klares Solomaterial, etwa ein einzelnes Klavier, eine Sologitarre oder eine einzelne Gesangslinie, wird deutlich genauer transkribiert als ein dichter Bandmix, in dem viele Instrumente gleichzeitig klingen. Die automatische Transkription erledigt schnell den größten Teil der Arbeit. Danach gehst du das Ergebnis trotzdem durch und korrigierst die Stellen, an denen sie danebenlag. Für aufwendigen Notensatz exportierst du MusicXML und machst in einem Notationsprogramm wie MuseScore den Feinschliff. Warum manche Songs sauber durchlaufen und andere sich sträuben, ist ein eigenes Thema. Darum geht es im Artikel darüber, warum die Genauigkeit von KI-Transkription schwankt.

Wo Gemini und Claude trotzdem helfen

Sobald du die Noten hast, sind beide Modelle wieder nützlich, denn jetzt geht es um Text und ums Nachdenken. Liegen Noten, ein Akkord-Sheet oder die aus der MIDI-Datei abgeleiteten Akkorde vor dir, kann dir jedes der beiden weiterhelfen:

  • Einen schwierigen Akkord erklären. Füg das Akkordsymbol ein und frag, aus welchen Tönen er besteht, welche Funktion er hat und welche Tonleiter darüber passt.
  • Ideen für den Fingersatz liefern. Beschreib eine Passage und dein Instrument und frag nach einem sinnvollen Fingersatz oder einer Handposition zum Ausprobieren.
  • Einen Übeplan aufstellen. Nenn das Stück, dein Niveau und wie viel Zeit du hast, und du bekommst einen strukturierten Plan, wie du es dir erarbeitest.
  • Eine Melodie, die du kennst, als Text notieren. Wenn du die Melodie schon beschreiben oder singen kannst, schreibt das Modell sie in ABC auf, und du fügst sie in einen Editor ein.

Ein Transkriptionsmodell macht aus Klang Noten. Gemini und Claude helfen dir, diese Noten zu verstehen und zu üben, wenn du sie einmal hast. Nimmst du beides zusammen, wird aus der Aufnahme zuerst Notation, und danach bekommst du Hilfe beim Spielenlernen. Was eine KI dir über ein Stück sagen kann und was nicht, liest du im Artikel darüber, ob dir eine KI sagen kann, wie du einen Song spielst. Um die eng verwandte Frage zum Modell von OpenAI geht es im Artikel darüber, ob ChatGPT Noten erstellen kann.

Häufige Fragen

Kann Gemini Noten lesen?

Nur grob. Gemini nimmt Bilder an und kann sich deshalb ein Foto oder PDF von Noten ansehen, sie allgemein beschreiben, die Tonart nennen oder erkennen, dass eine Passage sehr dicht ist. Zuverlässig Ton für Ton von der Seite ablesen und dir die richtigen Tonhöhen und Rhythmen nennen kann es nicht. Benchmarks zu genau dieser Aufgabe zeigen, dass Modelle, die die Symbole gut erkennen, bei der eigentlichen Umwandlung in Töne trotzdem meistens danebenliegen und auf gleichmäßige Viertelnoten und tonleiterartige Läufe ausweichen. Was Gemini aus gedruckten Noten herausliest, taugt als grobe Zusammenfassung, nicht als genaue Transkription.

Kann Claude einen Song in Noten transkribieren?

Aus einer Aufnahme nicht. Claude arbeitet mit Text und Bildern. Es kann über Notation sprechen, die du als Text einfügst, etwa ABC oder ein Akkord-Sheet, Harmonik erklären und eine einfache einstimmige Melodie skizzieren, die du in Worten beschreibst. Eine Audiodatei nimmt es nicht entgegen und macht daraus auch keine genauen Noten. Klang in Töne umzuwandeln ist ein Problem der Signalverarbeitung. Dafür muss man erkennen, welche Tonhöhen klingen und wann jeder Ton einsetzt, und gleichzeitig klingende Töne voneinander trennen. Genau das macht ein eigens dafür gebautes Transkriptionstool, ein Chatmodell dagegen nicht.

Können Gemini oder Claude aus Audio eine MIDI-Datei machen?

Aus einer Aufnahme nicht. Keines der beiden Modelle erkennt die Töne in der Aufnahme, und genau das ist für eine MIDI-Datei nötig. Bittest du eines davon, sich einen Song anzuhören und MIDI auszugeben, bekommst du selbstsicher präsentierte, falsche Daten. Beschreibst du eine Melodie in Worten, schreibt ein Modell vielleicht eine kurze Textdarstellung, die du umwandeln könntest. Für eine echte MIDI-Datei aus einer echten Aufnahme nimmst du besser ein eigenes Audio-zu-MIDI-Tool, das die Töne erkennt und die Datei direkt exportiert.

Wie machst du aus einem Song am besten Noten?

Nimm ein KI-Transkriptionstool, das genau dafür gebaut ist. Es nimmt eine Audiodatei oder einen Link an und gibt bearbeitbare Noten, MIDI und eine Piano Roll aus. Das Ergebnis räumst du danach von Hand auf. Die automatische Transkription erledigt schnell den größten Teil der Arbeit, und bei klarem Solomaterial wird das Ergebnis genauer als bei einem dichten Mix mit der ganzen Band. Für den endgültigen Notensatz exportierst du MusicXML und machst in einem Notationsprogramm den Feinschliff.

Wenn du eine Aufnahme in Noten verwandeln willst, fang bei Audio zu Noten an. Lade den Song hoch oder füg einen Link ein und bearbeite das Ergebnis im Browser, bevor du exportierst.

Zur Person

Andrew Carlins

Geschrieben von

Andrew Carlins

Mitgründer und CEO von Songscription

Andrew hat Songscription in Stanford zusammen mit ein paar anderen Musiker:innen gegründet. Sie hatten es satt, die Noten zu den Songs, die sie spielen wollten, nirgends zu finden. Er ist mit Klavier und Baritonsaxofon aufgewachsen und stand in Musicals auf der Bühne. Das ist zwar schon Jahre her, aus dem Takt ist er nach eigener Einschätzung aber noch lange nicht. Hier schreibt er darüber, wie ein Song von der Aufnahme aufs Papier kommt.

Mehr über das Team

Hier findest du weitere Artikel zu denselben Themen.