// Blog
Alle Artikel AI OpsBrandFintechLifestyleAI NewsTutorials
// amia.me
Über michModulesCVProjekteToolboxTeamNewsKontakt
// Tutorial · Case Study · ⏱ 12 Min · gegen E-Mail

€5K-Nebenjob mit KI-Airbnb-Videos? Ich bezweifle das.

17 Immobilienfotos, ein Prompt, ein fertiges cinematisches Walkthrough-Video — verkauft als Nebenjob. Ich habe es mit 17 echten Fotos einer Villa in Ičići, Kroatien getestet. So einfach ist es nicht.

🎬 17 Fotos → 1 Film 🧠 Generation ≠ Direction 💸 Echte Kosten, keine Fake-Earnings 🤖 Agent mit Regelhierarchie ⚠️ Inkl. Fehlversuch + Halluzination
AI
// Co-Authored · AI Disclosure

Co-authored mit Mike F. (Agent: head-of-video-and-animation) — Bildanalyse, Spatial Mapping, Generierung und QC im Experiment. Regie-Entscheidungen, Kosten-Take und Bewertung: Alex. Voller Kontext →

Cyberpunk-Illustration einer mediterranen Klippenvilla mit Infinity-Pool über dem Meer, überlagert von einer holografischen Kamera-Flugbahn mit Wegpunkten und Storyboard-Keyframes, acid-gelb und cyan auf Schwarz// AI-GENERATED · MAGNIFIC

Nein — man lädt nicht 17 Airbnb-Fotos hoch, tippt einen Prompt ein und bekommt einen fertigen cinematischen Immobilienfilm. Ein einzelnes Foto zu animieren ist erstaunlich einfach. Aber 17 einzeln beeindruckende Clips ergeben nicht automatisch einen zusammenhängenden Film. Was dazwischen fehlt, ist Regie: Reihenfolge, Raum, Kamera, Kontinuität, Schnitt und Ton. Genau das habe ich an einem realen Fall durchgespielt.

Auf TikTok sieht es aus wie ein Klick. In Wahrheit ist es ein Produktionsprozess.

Das virale Versprechen — und was wirklich passiert

Auf TikTok, Instagram und YouTube kursiert gerade dieselbe, fast schon dreiste Formel: Fotos → Prompt → cinematisches Airbnb-Video → an Vermieter verkaufen → Nebenjob. Manche Varianten versprechen daraus einen vierstelligen Monatsverdienst. Ich wollte wissen, wie viel davon reproduzierbar ist. Also habe ich 17 echte Fotos einer Villa in Ičići genommen und den Job an Mike gegeben — den KI-Video-Agenten im AMIA-Setup. Der Auftrag klang simpel: mach daraus einen 30–35-sekündigen Premium-Walkthrough, 16:9, mit Musik, als wäre eine echte Kamera durch die Villa gefahren.

Was dann passierte, ist der Grund, warum ich die „lade einfach deine Fotos hoch"-Version der Geschichte nicht mehr glaube.

// Das nimmst du mit
DAS VERSPRECHEN DER ECHTE WORKFLOW Fotos↓ PromptFertiges Video 3 Schritte · 1 Klick Fotos → Bildanalyse → Spatial Mapping → Route → Storyboard → Kameraregie → Regelhierarchie → Generierung → QC → Fehlversuch → Recherche → Pilot → V2 → Musik-Edit → Sounddesign → Human Review weniger viral · dafür reproduzierbar
// Der Unterschied zwischen dem TikTok-Hook und dem, was tatsächlich funktioniert

Der komplette Workflow — Raumkarte, Start-/Endframe, die siebenstufige Regelhierarchie, die vier Prompt-Vorlagen zum Nachbauen und der ehrliche Kostenteil — steht in der Vollversion:

// Weiterlesen

Vollversion gratis gegen E-Mail

Spatial Mapping, Start-/Endframe, die 7-stufige Regelhierarchie, alle vier Prompt-Vorlagen zum Selbstnachbauen und die echten Kosten — einmal eintragen, sofort frei.

Double-Opt-In via Brevo · jederzeit abbestellbar · Datenschutz

// Freigeschaltet — willkommen hinter der Kamera.

Warum das eigentliche Problem nicht die Generierung ist

Ein Foto zu bewegen, geht schnell: ein Dolly-in, etwas Parallaxe, ein sanfter Orbit — ein einzelnes Bild sieht rasch beeindruckend aus. Aber 17 beeindruckende Clips sind noch kein Film. Was fehlt, ist Kontext. Ein Mensch sieht eine Foto-Serie und baut sofort eine mentale Karte: Diese vier Bilder sind dasselbe Wohnzimmer aus anderen Winkeln. Dieses Bild ist oben. Diese zwei gehören ins selbe Bad. Ein Videomodell bekommt das nicht automatisch, nur weil du 17 Dateien hochlädst.

Es sieht Bilder und erkennt vielleicht die Objekte darin. Das ist nicht dasselbe, wie die Topologie des Gebäudes zu verstehen. Hier hilft ein präziser Prompt allein nicht weiter — es fehlt die Ebene darüber.

// Kernsatz

Bilderkennung ist nicht räumliches Verständnis. Ein Modell weiß, dass ein Sofa im Bild ist — nicht, dass hinter der Tür dasselbe Schlafzimmer liegt wie zwei Fotos später.

Grundriss einer Villa als leuchtender Knotengraph: Räume als verbundene Knoten (Wohnzimmer, Küche, Schlafzimmer, Bad, Pool) zu einer Route verknüpft — Visualisierung räumlicher Kontinuität
// Spatial Mapping: aus 17 losen Fotos wird eine begehbare Route — KI-generierte Illustration

Schritt 1: Erst die Raumkarte, dann das Video

Vor der Generierung bekommt jedes Bild eine Rolle. Die Route durch die Villa wurde: Außen → Wohnzimmer → Küche → oben → Schlafzimmer 1 → Bad → Schlafzimmer 2 → zurück → Pool/Blick. Erst nachdem diese Karte stand, ergab es überhaupt Sinn, Kamerabewegungen zu planen.

BilderBedeutungErzählfunktion
01AußenansichtVilla und Pool etablieren
02–05WohnzimmerDurch denselben zusammenhängenden Raum bewegen
06Wohnzimmer → KücheDen offenen Grundriss zeigen
07–08Küche / Ess-DetailErdgeschoss-Sequenz fortsetzen
09Oberer TreppenabsatzÜbergang nach oben
10–11Schlafzimmer 1Ankunft + Fenster/Blick
12–13BadKurzer Interior-Reveal
14–15Schlafzimmer 2Zweite Rückzugs-Sequenz
16Schlafzimmer 1, anderer WinkelLetzter Interior-Beat
17Pool / BlickFinale

Warum V1 jede QC bestand — und trotzdem langweilig war

Der erste Versuch war technisch ordentlich: Bilder analysiert, Shots geplant, Bewegungen generiert, Musik erstellt, Schnitt gebaut, technische Qualitätskontrolle durchgeführt. Ergebnis: rund 35 Sekunden — und trotzdem wirkte der Film wie eine Abfolge schön animierter Immobilienfotos.

Jeder Shot bestand die QC. Der Film gefiel mir trotzdem nicht.

Das war der Wendepunkt. Unsere QC prüfte, ob die KI Fehler gemacht hatte — nicht, ob wir einen guten Film gemacht hatten. Der strukturelle Grund: Jeder Clip wurde nur aus einem einzigen Startbild generiert. Innerhalb eines Fotos ließ sich Kamerabewegung simulieren, aber jeder Wechsel zum nächsten Foto blieb ein harter Schnitt. Das Problem war nicht primär der Prompt — die Produktionsarchitektur war falsch.

Der technische Wendepunkt: Start- und Endframe

Bei der Recherche zeigte sich, dass Kling v3 Pro über fal.ai neben dem Startbild auch ein end_image_url akzeptiert. Damit kann ein Segment von Referenz A zu Referenz B interpolieren — und das nächste Segment auf B aufsetzen. Statt harter Schnitte entstehen Übergänge.

Foto A Foto B Foto C Interpolation Interpolation
// Start-/Endframe: die KI interpoliert zwischen zwei echten Fotos statt hart zu schneiden
// Ehrlich bleiben

Das erzeugt keine physikalisch perfekte Kamerafahrt. Die KI interpretiert den Raum zwischen den Referenzen — und kann ihn auch halluzinieren. Mehr Freiheit heißt spektakulärere Fahrt, aber höheres Risiko, dass Architektur erfunden wird.

Zwei schwebende Referenzfotos eines Villa-Interieurs, verbunden durch einen morphenden Strom interpolierter Videoframes — Image-to-Video-Interpolation zwischen Start- und Endframe
// Zwischen zwei Referenzen entsteht Bewegung — und genau hier muss man die KI an der Leine halten

Was passiert, wenn der Agent deine Anweisung überstimmt?

Dann wurde es interessanter als die Video-Generierung selbst: Mike ignorierte eine meiner Anweisungen. Und er hatte recht. Ich hatte Bild 09 als Treppenaufgang beschrieben und die Kamera nach oben fahren lassen wollen. Das Foto zeigte aber keine Treppe, sondern den oberen Absatz — Geländer, Oberlicht, eine Tür zum Schlafzimmer. Eine Treppenfahrt zu erzwingen hätte bedeutet, dass das Modell Architektur erfindet, die es im Quellbild nicht gibt.

Mike hatte aber eine höherrangige Regel: Die echten Fotos sind die Wahrheit. Erfinde keine Architektur. Also verwarf er die konkrete Kameraanweisung und animierte das Bild als Ankunft oben an der Treppe. Das war die richtige Entscheidung.

// AI-Ops-Learning

Mein Briefing war falsch. Der KI-Agent hat es korrigiert. Das ist ein deutlich nützlicheres Verhalten als jede Anweisung blind zu befolgen — aber nur, wenn der Agent weiß, welche Regel schwerer wiegt.

Regelhierarchie: welche Anweisung verlieren darf

Zwei Anweisungen standen im Konflikt: „Kamera nach oben" gegen „erfinde keine Architektur". Die Regel gewinnt gegen die Aufgabe. Das ist ein kleines Beispiel für etwas, das entscheidend wird, sobald Agenten echte Arbeit machen. Ein nützlicher Agent braucht mehr als einen Aufgaben-Prompt — er braucht eine Prioritätenordnung:

REGEL-PRIORITÄT

1. Quell-Fotos sind die Wahrheit.
2. Keine Architektur, Räume, Türen, Fenster, Möbel oder Ausblicke erfinden.
3. Geometrie und räumliche Plausibilität wahren.
4. Kontinuität zwischen den Shots halten.
5. Dem Storyboard folgen — solange es 1–4 nicht widerspricht.
6. Zurückhaltende, realistische Kamera vor spektakulärer Halluzination.
7. Widerspricht das Skript dem Bild: Konflikt melden, Skript anpassen.

Regel 7 ist die, die den Treppen-Shot gerettet hat. Das ist einer der Unterschiede zwischen Prompting und echten AI Operations.

Pilot statt Full Build: Budget, Test, Stop-Condition

Vor dem vollständigen Neubau kam ein kleiner Test: rund 1,80 $ für zwei kritische Segmente statt sofort rund 8,40 $ für den kompletten Durchlauf. Erst wenn die zwei kritischen Legs überzeugten, ging es weiter. Das ist Agentic AI in der Praxis — nicht „lass die KI einfach laufen".

// Agentic AI in der Praxis

Autonomie + Budgetgrenze + Test + Bewertungskriterien + Stop-Condition + menschliche Freigabe = kontrollierte Ausführung. Genau diese Klammer trennt einen Agenten von einem teuren Zufallsgenerator.

V2: filmischer — aber mit einem neuen Problem

V2 ist rund 26 Sekunden lang und fühlt sich zum ersten Mal nach einem schnellen FPV-One-Take an. Gleichzeitig interpretiert die KI Teile der Villa stärker. Das ist kein Nebeneffekt, den man verstecken sollte — es ist eines der wichtigsten Ergebnisse des Experiments:

ReglerGewinnPreis
Mehr Constrainthöhere Faktentreueschneller statisch, slideshow-artig
Mehr kreative Freiheitspektakulärere Kamerafahrthöheres Halluzinationsrisiko

Fürs Finale kein Fake: Kein einziges Ausgangsfoto zeigt Pool und Meer gleichzeitig, also gab es kein künstliches Pool-plus-Meer-Compositing, das echt aussehen soll. Der reale Meerblick trägt das Ende.

Kann das ein €5K-Nebenjob werden?

Potenziell. Aber nicht, weil ein magischer Prompt aus Fotos fertige Werbespots macht. Die wertvolle Fähigkeit ist nicht das Drücken von „Generieren", sondern aus unordentlichem Rohmaterial einen zusammenhängenden Produktionsworkflow zu machen: Material verstehen, Geschichte planen, das Modell führen, Halluzinationen kontrollieren, die richtigen Generierungen auswählen, auf Rhythmus schneiden, etwas abliefern, das ein Kunde wirklich nutzen kann.

// Ehrliche Kostennote

Belastbar aus diesem Experiment: ~1,80 $ Pilot, ~8,40 $ Full Build an Generierungskosten, plus Musik/API. Die menschliche Arbeitszeit — Analyse, Regie, QC — ist der größere Posten. Keine Fake-Earnings: Die €5.000 sind die Behauptung, die wir testen, nicht das, was hier verdient wurde.

Wenn KI-Video-Generierung weiter zur Commodity wird, wird dieser Unterschied wichtiger, nicht unwichtiger. Die Generierung wird billiger. Geschmack, Regie und Workflow werden zum Produkt.

Bau es selbst nach: die Prompt-Vorlagen

Du brauchst Mike dafür nicht. Der Prozess läuft auch manuell — mit einem multimodalen Modell, einem Image-to-Video-Modell und einem Editor. Die vier Kern-Prompts:

A · Bildanalyse

Analysiere diese Immobilienfotos als Material für EINEN
durchgehenden Walkthrough. Bestimme pro Bild:
1. Raum / Ort   2. wahrscheinliche Beziehung zu Nachbarbildern
3. sichtbare Architektur-Anker   4. Vordergrund für Parallaxe
5. plausible Kamerabewegungen   6. was NICHT erfunden werden darf
Nimm nicht an, zwei Bilder seien verschiedene Räume, nur weil
die Perspektive wechselt. Markiere Unsicherheit explizit.

B · Spatial Mapping

Baue aus der Bildanalyse die plausibelste physische Route.
Gruppiere Bilder desselben Raums. Erkenne Übergänge zwischen
verbundenen Räumen. Erfinde keine fehlenden Räume/Türen/Flure.
Ausgabe: BILD-NR → ORT → VORHERIGER RAUM → NÄCHSTER RAUM → KONFIDENZ

C · Storyboard

Mach aus der Raumkarte einen 30–35s-Walkthrough. Pro Shot:
Quellbild, Erzählrolle, Kamerabewegung, Richtung, Tempo, Dauer,
Parallaxe-Chance, Übergang zum nächsten Shot.
Vermeide repetitive Push-ins. Realistische Architektur-Kamera
vor spektakulärer KI-Bewegung.

D · Regelhierarchie

Die sieben Prioritäten von oben gibst du dem System explizit mit. Die letzte Zeile — „widerspricht das Skript dem Bild, passe das Skript an" — ist die, die dich vor erfundener Architektur schützt.

// Zusammenarbeit

Willst du solche Video-Systeme im Unternehmen?

Ich baue solche Pipelines — von der Architektur bis zur laufenden, kontrollierten Produktion. Oder du willst die Operator-Notizen dazu: unregelmäßig, konkret, kein Spam.

Häufige Fragen

Wichtigste Erkenntnisse

Die technische Grundlage hinter dem Video-Stack: Vergiss Runway: dein eigenes AI Video Studio mit Claude Code erklärt die Infrastruktur — dieser Case die reale Produktion.

// Offenlegung: Dieser Artikel beschreibt ein reales Experiment. Mike F. ist — wie das gesamte AMIA Virtual Team — ein KI-Agent, keine reale Person. Cover, Spatial-Map und Interpolations-Bild sind KI-generierte Illustrationen, die Diagramme schematisch. Genannte Kosten sind Richtwerte, Stand 2026. Die €5.000-Schlagzeile ist bewusst die virale Behauptung, die getestet wird — kein typischer, garantierter oder in diesem Experiment erzielter Verdienst.