Fish Audio haalt 50 miljoen dollar op voor AI-stemmodellen

Fish Audio heeft in een eerste investeringsronde 50 miljoen dollar opgehaald voor de ontwikkeling van AI-stemmodellen. Het bedrijf richt zich op makers en bedrijven die stemmen willen genereren, aanpassen of inzetten in klantenservice.

Kantoorgebouw van Fish Audio in Palo Alto
Kantoorgebouw van Fish Audio in Palo Alto · Beeld: Netgebeurd (AI-illustratie)

Fish Audio heeft 50 miljoen dollar, omgerekend ruim 46 miljoen euro, opgehaald in een seedronde. De investering moet de ontwikkeling versnellen van AI-modellen die spraak kunnen genereren en verwerken voor makers, gameontwikkelaars en bedrijven.

Coreline Ventures en Capital Today leidden de financieringsronde. Ook 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners en HF0 investeerden. Fish Audio is gevestigd in Palo Alto in de Amerikaanse staat Californië.

Het bedrijf biedt modellen waarmee gebruikers synthetische stemmen kunnen maken en aansturen met natuurlijke taal. De dienst bevat meer dan 15.000 instellingen om bijvoorbeeld de toon, expressie en snelheid van een stem te beïnvloeden. Fish Audio stelt dat inmiddels meer dan 8 miljoen mensen de open-source- of gehoste versies van zijn modellen gebruiken.

De jaarlijkse terugkerende omzet bedraagt volgens het bedrijf 21 miljoen dollar. Fish Audio verkoopt abonnementen aan makers en teams, met een vastgesteld aantal minuten aan gegenereerde audio en functies voor het klonen van stemmen. Daarnaast levert het bedrijf API's en een platform voor ondernemingen. HeyGen, Sanas en Plaud gebruiken die technologie al.

Open-source en betaalde modellen

Fish Audio begon als een project van voormalig NVIDIA-onderzoeker Shijia Liao. Hij ontwikkelde een model op één GPU omdat hij de beschikbare synthetische stemmen te weinig expressief vond. De code van het eerste spraakmodel werd openbaar gemaakt en de Fish Speech-opslagplaats op GitHub heeft inmiddels meer dan 31.000 sterren.

In het afgelopen jaar bracht het bedrijf vier modellen voor spraakgeneratie en één model voor spraak-naar-tekst uit. Drie spraakmodellen zijn open source beschikbaar. Het nieuwste model, S2.1 Pro, is alleen te gebruiken via een betaalde API.

Fish Audio wil dit jaar ook een model uitbrengen dat audio kan analyseren. Verder werkt het aan technologie die gesproken taal rechtstreeks kan omzetten in andere gesproken taal.

Sneller verwijderen van ongewenste stemmen

Het bedrijf bouwt een deel van zijn stemmenbibliotheek op met opnames die gebruikers aanleveren. Gebruikers kunnen worden betaald wanneer hun stem voor de modellen wordt gebruikt. Eerder meldden enkele makers dat stemmen zonder hun toestemming op het platform waren geplaatst.

Fish Audio had al een procedure voor het verwijderen van materiaal, maar die afhandeling duurde lang. Topvrouw en medeoprichter Rissa Cao zegt dat dit proces nu is geautomatiseerd. Makers kunnen met een kort stemfragment of een contract aantonen dat een stem van hen is, waarna die binnen drie minuten van het platform moet verdwijnen.

Die controle voorkomt niet dat anderen zonder toestemming een stem uploaden. Een stem kan daarom beschikbaar blijven totdat de rechthebbende de opname ontdekt en een verwijderverzoek indient.

Lees ook