Relational Synthesis Demo

Introduction

In a realistic out-of-dataset setting, say we retrieve a shakuhachi track and a humpback whale track from external libraries:

Retrieved source and reference

ConditionAudio
Source S
Waveform
Reference R
Waveform

With Foley or creative intention, we want the shakuhachi to sing like a whale: it should follow the whale's temporal pattern while still sounding like authentic shakuhachi. We compare the following four methods, where the neural generator (pretrained Stable Audio 3) also receives the prompt shakuhachi sound effect.

Four-way OOD comparison

Conditionpre-neural synthneural output
Raw reference R
Waveform
Waveform
Raw R + S mixture
Waveform
Waveform
Pointwise concatenative
Waveform
Waveform
FO (relational)
Waveform
Waveform

As we can hear:

  1. Raw R, where the acoustic intent is mostly specified by the prompt, and raw R + S both suffer greatly from timbre leakage and persistent copying. Because the inputs are out-of-dataset, the generator also fails to repair raw R + S's temporal envelope.
  2. Pointwise concatenative synthesis struggles to match sounds across distinct acoustic spaces.
  3. The relational methods, exemplified here by FO, preserve the shakuhachi's acoustic identity while following the whale's temporal envelope relatively smoothly.

There is also the known out-of-dataset robustness issue, prevalent in modern AI generative models, where artifacts and unwanted acoustic-identity modifications become much more common under out-of-dataset conditions, as can be heard across all rows. This is, however, outside the scope of this paper/demo, as we focus on the capabilities of pre-neural synthesis and RAG conditioning.

Ablation and Model Comparisons

In this section, we provide samples for the ablation and model-comparison section. We obtain sources and targets from ESC-50 and references from ESC-50-Voice, with the references imitating the targets.

ConditionCRG example 1: car hornCRG example 2: catFO example 1: sheepFO example 2: cowFO example 3: frogVMO example 1: sirenVMO example 2: henVMO example 3: clock alarm
pre-neural synthneural outputpre-neural synthneural outputpre-neural synthneural outputpre-neural synthneural outputpre-neural synthneural outputpre-neural synthneural outputpre-neural synthneural outputpre-neural synthneural output
Source S
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Reference R
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Target T
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Text-only—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
—
Waveform
Raw source S
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Shuffled source
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Pointwise concatenative
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
CRG, without DAM
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
FO, without DAM
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
VMO, without DAM
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
CRG
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
FO
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
VMO
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform
Waveform

Bonus

Here we hold the humpback-whale reference from the introduction unchanged and use guqin, a Chinese instrument, and another humpback whale recorded under completely different conditions as the sources.

ConditionGuqin source → fixed humpback-whale referenceDifferent humpback-whale source → fixed humpback-whale reference
pre-neural synthneural outputpre-neural synthneural output
Source S
Waveform
—
Waveform
—
Reference R
Waveform
—
Waveform
—
Raw reference R
Waveform
Waveform
Waveform
Waveform
Raw R + S mixture
Waveform
Waveform
Waveform
Waveform
Pointwise concatenative
Waveform
Waveform
Waveform
Waveform
CRG (relational)
Waveform
Waveform
Waveform
Waveform
FO (relational)
Waveform
Waveform
Waveform
Waveform
VMO (relational)
Waveform
Waveform
Waveform
Waveform