Klänge
Beschreiben Sie einen Klang und Sie bekommen einen Clip. Beschreiben Sie eine ganze Szene und Sie bekommen sie in zeitlich angeordnete Ereignisse aufgeteilt, die Sie vor dem Erzeugen korrigieren können, und die dann gemischt werden.
Es ist für Menschen gebaut, die Video schneiden: was ihnen fehlt, ist keine Zeitleiste — die haben sie schon — sondern der konkrete Klang. Deshalb liefert dies Clips zurück, keine Projekte.
Die Ausgabe ist 48 kHz Stereo WAV, die Rate, mit der Video arbeitet. Das Modell erzeugt mit 44,1 kHz und wir tasten auf 48 hoch, bevor wir es übergeben; das Hochtasten verliert nichts von dem, was das Modell gemacht hat.
Eine Szene
Eine Szene braucht zwei Schritte, und der mittlere ist bewusst bearbeitbar:
- Der Plan. Sie beschreiben die Szene in einfacher Sprache — „ein Motorrad hält nach acht Sekunden an, der Fahrer steigt ab und geht zum Meer" — und ein Sprachmodell teilt sie in Ereignisse mit Startzeit und Länge auf. Hier wird kein Audio erzeugt.
- Die Erzeugung. Mit dem nach Ihrem Wunsch festgelegten Plan wird jedes Ereignis erzeugt und alle werden gemischt, unter Wahrung der Zeiten.
Zwei Schritte und nicht einer, weil sechs Ereignisse sechs Erzeugungen sind: sie für einen Plan auszugeben, der nicht das war, was Sie meinten, heißt sie wegzuwerfen. Und den Plan zu sehen zeigt, wie das Werkzeug denkt, was die halbe Miete beim Erlernen der Nutzung ist.
Ereignisse können sich überlappen, und das sollten sie: eine Hintergrundatmosphäre, die die ganze Szene über läuft, mit den Treffern obendrauf, klingt wie eine Szene; Clips, Ende an Ende geklebt, klingen wie eine Liste von Clips.
Über die API
Drei Routen. Alle brauchen einen kostenpflichtigen Tarif.
Ein Klang
POST /v1/audio/sfx — JSON-Body, gibt das WAV zurück.
| Feld | Typ | Was es ist |
|---|---|---|
prompt | text | Erforderlich. Der Klang, den Sie möchten. Das Modell versteht Englisch weit besser als andere Sprachen. |
seconds | number | Länge, 1 bis 30. Standardwert 10. |
seed | integer | Derselbe Seed mit derselben Beschreibung ergibt denselben Klang. Wenn Sie ihn weglassen, wählt die Engine einen und gibt ihn Ihnen zurück. |
guidance | number | Wie eng es sich an die Beschreibung hält, 1 bis 15. Standardwert 7. Niedrig (1-3) nimmt sich Freiheiten und klingt natürlicher; hoch (10-15) ist wörtlich, aber schroffer. Es wird auf dem Server begrenzt: eine 40 ergibt keinen „sehr wörtlichen" Klang, sie ergibt Rauschen. |
translate | boolean | true
übersetzt die Beschreibung vor dem Erzeugen ins Englische und teilt Ihnen in
X-Prompt mit, welcher Text tatsächlich verwendet wurde. |
curl -X POST https://api.uttera.ai/v1/audio/sfx \
-H "Authorization: Bearer $UTTERA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"prompt":"waves breaking on a pebble beach","seconds":12}' \
-o sound.wav
Antwort-Header: X-Seed (der tatsächlich verwendete Seed),
X-Seconds, X-Generations, X-Watermark,
X-Prompt und X-Translated.
Der Plan einer Szene
POST /v1/audio/sfx/plan — nimmt prompt und
segundos (4 bis 120) und gibt die Liste der Ereignisse zurück. Es erzeugt
kein Audio: Ihnen wird nur die Arbeit des Sprachmodells berechnet.
Die Szene
POST /v1/audio/sfx/scene — nimmt den Plan, falls gewünscht bearbeitet,
und gibt JSON mit der Mischung und den einzelnen Teilen zurück, alle als
base64-kodiertes WAV und alle mit Wasserzeichen.
{"seconds": 20,
"events": [{"start": 0.0, "duration": 20.0, "prompt": "quiet kitchen ambience"},
{"start": 4.0, "duration": 4.0, "prompt": "fridge door opening"}]}
Grenzen und Kosten
| Was | Wie viel |
|---|---|
| Länge eines Klangs | 30 s |
| Länge einer Szene | 120 s |
| Ereignisse pro Szene | 6, je 2 bis 30 s |
| Anfrage-Body | 64 kB (es ist JSON, keine Datei) |
| Plan | Kostenpflichtig. Nicht im kostenlosen Tarif. |
Berechnet pro Erzeugung, nicht pro Sekunde
Und das ist keine Rundung von uns: es ist Diffusion, und die Kosten werden von den Schritten des Samplers bestimmt, nicht von der Länge, die Sie anfordern. Auf unserem Knoten gemessen, brauchen ein 5-Sekunden-Clip und einer von 30 Sekunden dieselbe Zeit. Pro Sekunde zu berechnen würde den kurzen für genau dieselbe Arbeit sechsmal weniger kosten lassen.
Ein Klang ist pauschal 11,636 Credits, plus 0,026 pro Sekunde Audio, was das Wasserzeichen kostet. Ein 10-s-Clip kommt auf 11,90. Eine Szene sind so viele Erzeugungen, wie sie Ereignisse hat, plus die Tokens des Planers, berechnet wie die der Zusammenfassung.
503.