Hoppa till innehållet

Fritt tal till text, direkt i din browser.

Tryck på mikrofonen, prata normalt och se hur den förvandlas till text. Talmodellen laddas ner en gång och körs sedan på din egen maskin, så inget ljud laddas upp, det finns inget konto och det finns ingen tidsbegränsning.

Körs på din maskin · Din röst lämnar aldrig den här enheten

Startar upp röstskrivning

Bara att ställa in...

0 words
Inget ännu - mikrofonen är ovan.

Om detta verktyg

Hur röstskrivning online fungerar utan att ladda upp din röst

När sidan laddas laddar den ner en taligenkänningsmodell som heter Whisper till din webbläsare. Det är basstorleken, kvantiserad till int8, och kommer till cirka 80 MB. En förloppsindikator visar nedladdningen. Modellen reser till dig istället för att din röst reser till en server.

Därefter är verktyget push to talk. Du trycker på mikrofonen, din webbläsare ber om mikrofontillstånd och en nivåmätare visar att den hör dig. Tryck igen och inspelningen går direkt till modellen som körs på samma flik. Ljudet hanteras i 30 sekunders fönster med en 5 sekunders överlappning, så att en lång sträcka av samtal inte hackas upp i mitten av meningen.

Där din webbläsare stöder WebGPU körs modellen på grafikkortet och är flera gånger snabbare. Där den inte gör det, faller den tillbaka till WebAssembly på processorn, som är långsammare men fortfarande fungerar. Din webbläsare cachar modellfilerna efter den första körningen, så senare besök startar omedelbart. En ordräkning och en grov siffra för ord per minut sitter ovanför textrutan.

Röstskrivning utan uppladdning, ingen registrering och inget konto

De flesta webbplatser för gratis röstinmatning har en av två former. Vissa spelar in ditt ljud och lägger upp det på sina servrar för transkription. Andra kallar taligenkänningen inbyggd i Chrome eller Edge, som skickar ljudet till webbläsarleverantörens tjänst. Hur som helst lämnar din röst din maskin och du litar på en integritetspolicy som du inte skrev.

Den här sidan har en annan form. Det finns ingen uppladdning, inget konto och ingen transkriptionsserver. Modellfilen är en statisk nedladdning, och transkriptionen körs på fliken framför dig. Det kan du kontrollera själv. Ladda sidan, vänta på att modellen kommer, stäng sedan av ditt wifi och fortsätt diktera. Det fortsätter att fungera, eftersom igenkänningen aldrig använde nätverket.

Den strukturen har också praktiska effekter. Ingenting mäts, så det finns inget minuttak, ingen daglig gräns och ingen vägg som ber dig att registrera dig halvvägs genom en inspelning. Det betyder också att vi inte kan läsa, lagra eller förlora din utskrift. Om du stänger fliken är texten borta, så kopiera eller ladda ner allt du vill behålla.

Hur man använder röstinmatningsverktyget, steg för steg

Vänta tills modellen har slutfört nedladdningen. Mikrofonknappen förblir inaktiv tills den är klar, eftersom det inte finns något att transkribera till innan dess. På en normal anslutning tar detta några sekunder, och det händer bara vid ditt första besök.

Tryck på mikrofonen. Första gången kommer din webbläsare att be om tillåtelse att använda mikrofonen. Tillåt det. Se nivåmätaren röra sig medan du talar, vilket är det snabbaste sättet att bekräfta att rätt inmatningsenhet är vald. Om mätaren är platt, ändra din ingång i dina systemljudinställningar och ladda om.

Prata i din vanliga takt. Det finns ingen anledning att sakta ner eller uttala sig för mycket, och att skrika gör resultaten sämre snarare än bättre. Tryck på mikrofonen igen när du är klar med en tanke. Texten visas i rutan nedan.

Du kan fortsätta. Varje ny inspelning läggs till i slutet av det som redan finns där, så att du kan diktera i korta skurar. Boxen är ett normalt redigerbart fält, så fixa vad du vill och kopiera det sedan eller ladda ner det som en .txt-fil.

Hur exakt är det, och vilka språk och accenter hanterar det?

Modellen är flerspråkig och känner av språket automatiskt, så att du kan börja prata utan att välja något från en meny. I praktiken täcker det de flesta större språk, och det är märkbart starkare på de med mest träningsdata, bland annat engelska.

Var realistisk om storleken på modellen. Det här är Whisper-basen, vald för att en nedladdning på 80 MB är något som en besökare faktiskt kommer att vänta på. Den är bra på vanligt uppkopplat tal och håller en rad olika accenter, men det är inte den största modellen som finns och den kommer att göra fler misstag än en som är tio gånger så stor. Egennamn, produktnamn, teknisk jargong och personers namn är där det glider oftast.

Ett tyst rum och en anständig mikrofon hjälper mer än något annat du kan ändra. Bärbara mikrofoner tar upp tangentbordsljud och rumeko, och båda gör texten värre. Om du dikterar mycket är ett billigt headset den enskilt största uppgraderingen som finns tillgänglig för dig.

Vad folk använder gratis röstinmatning till

Den vanligaste användningen är ett första utkast. Att prata är snabbare än att skriva för de flesta, och ett grovt talat utkast som du sedan redigerar tenderar att slå en tom sida. Uppsatser, blogginlägg, följebrev, långa e-postmeddelanden, journalanteckningar och mötesanteckningar fungerar alla bra på detta sätt.

Det är också ett enkelt tillgänglighetsverktyg. Om det är smärtsamt att skriva, om du har en skada, eller om ett tangentbord helt enkelt går långsamt för dig, behöver diktering i en webbläsarflik ingen installation, inga administratörsrättigheter och inget köp. Det spelar roll på en låst arbetsbärbar dator eller en delad biblioteksmaskin där du inte kan installera programvara.

Eleverna använder det för anteckningar och för att snabbt få ner långa citat. Människor som skriver på ett andra språk har ofta lättare att säga en mening än att skriva den. Och den är användbar som en scratchpad: fånga idén medan du har den, städa den senare.

Om det du har är en befintlig inspelning snarare än en levande röst, är det ett annat jobb. Använd verktyget ljud till text för det istället.

Röstskrivning offline, utan internetanslutning

När modellen väl finns i webbläsarens cache fortsätter den här sidan att fungera utan anslutning. Transkriptionen använde aldrig nätverket i första hand, så ett flygplan, ett tåg eller ett dött hotell-wifi stoppar det inte. Du behöver själva sidan för att ladda, så öppna den innan du tappar signalen.

Två saker skickar dig tillbaka till nedladdningen. Om du rensar webbläsarlagringen tas den cachade modellen bort, och ett privat eller inkognitofönster börjar vanligtvis med en tom cache, så det hämtar filen igen. Olika webbläsare har också separata cachar, så att byta från en till en annan innebär ytterligare en nedladdning.

Den första nedladdningen är det enda ögonblicket som detta verktyg behöver internet. Allt annat, inspelningen, igenkänningen och texten, sker på din egen hårdvara. Det är värt att säga rent ut eftersom det är ovanligt. De flesta gratis dikteringssajter slutar fungera i det ögonblick du går offline, eftersom igenkänningen sker någon annanstans.

Gränserna för röstinmatning i webbläsaren och vad skrivbordsappen lägger till

Detta verktyg skrivs in i en ruta på en webbsida. Det är den ärliga gränsen. Det kan inte lägga in text i din editor, din e-postklient, Slack eller ett dokument, så du kopierar ut resultatet för hand varje gång. Om du vill diktera till något annat är detta ett tvåstegsjobb.

Texten kommer också efter att du stannat, inte ord för ord medan du talar, eftersom inspelningen transkriberas i ett pass när du trycker på mikrofonen igen. Och det finns inget städpass. Vad du än sa är vad du får, inklusive ums, de falska startarna och meningen du övergav halvvägs.

Yaps skrivbordsappen är samma idé på enheten utan dessa gränser. Du håller en snabbtangent, talar in i vilken app du redan är i, och texten landar vid din markör. Det rensar upp utfyllnadsord och skiljetecken allt eftersom, och det fungerar offline när det väl har installerats. Det finns också ett Android-tangentbord, som passar mycket bättre för telefondiktering än en webbläsarflik.

Hur man använder röstinmatning i din webbläsare

  1. Vänta tills modellen laddas ner

    Vid ditt första besök hämtar sidan en taligenkänningsmodell på cirka 80 MB och visar en förloppsindikator. Mikrofonen förblir inaktiv tills den är klar. Din webbläsare cachar det, så detta händer bara en gång.

  2. Tryck på mikrofonen och tillåt åtkomst till mikrofonen

    Din webbläsare kommer att be om tillåtelse att använda mikrofonen första gången. Tillåt det och kontrollera sedan att nivåmätaren rör sig när du talar så att du vet att rätt inmatningsenhet är vald.

  3. Prata i din vanliga takt

    Tala som du skulle till en person. Det finns ingen anledning att sakta ner, uttala för mycket eller höja rösten. Ett tyst rum och ett headset ger bättre resultat än en bärbar mikrofon i ett ekoigt utrymme.

  4. Tryck på mikrofonen igen för att stoppa

    Inspelningen transkriberas på din enhet och texten visas i rutan nedan. Varje ny inspelning läggs till i slutet, så att du kan diktera i korta skurar snarare än en lång tagning.

  5. Redigera och kopiera eller ladda ner

    Textrutan är fullt redigerbar, så fixa allt som modellen har fel. Kopiera sedan texten till ditt urklipp eller ladda ner den som en .txt-fil. Inget sparas när du stänger fliken.

Frågor

Är det här röstskrivverktyget verkligen gratis?

Ja, och det finns inget att anmäla sig till. Verktyget körs på din egen maskin, så det finns ingen transkriptionsräkning för oss att skicka vidare till dig. Det finns inget minuttak, ingen daglig gräns och ingen provperiod som tar slut.

Laddas min röst upp någonstans?

Nej. Taligenkänningsmodellen laddas ner till din webbläsare första gången du besöker det, och allt efter det körs på din enhet. Ditt mikrofonljud lämnar aldrig din maskin. Det finns ingen transkriptionsserver som den ska skickas till. Du kan bekräfta det genom att stänga av ditt wifi när modellen har laddats ner och dikterar ändå.

Behöver jag installera något?

Nej. Det är en webbsida. Den enda nedladdningen är själva talmodellen, som din webbläsare hämtar och cachar automatiskt, och som du aldrig ser som en fil på din dator.

Varför väntar jag första gången jag öppnar sidan?

Verktyget laddar ner en taligenkänningsmodell på cirka 80 MB innan det kan transkribera något. En förloppsindikator visar hur långt det är. Din webbläsare cachar det efteråt, så varje senare besök börjar direkt.

Fungerar röstinmatning utan internetanslutning?

Ja, när modellen är cachad. Igenkänningen använde aldrig nätverket, så det fortsätter att fungera offline. Du behöver en anslutning för det första besöket och för att ladda själva sidan. Att rensa din webbläsardata eller använda ett privat fönster innebär att modellen laddas ner igen.

Varför visas inte texten medan jag fortfarande pratar?

Verktyget spelar in först och transkriberar när du trycker på mikrofonen igen, så att texten kommer på en gång snarare än ord för ord. Att diktera i korta skurar ger dig något som är nära att skriva live, eftersom varje ny inspelning läggs till i slutet av det som redan finns där.

Kan jag använda detta för att skriva i Google Dokument, Word eller min e-post?

Inte direkt. Den här sidan skriver bara in i sin egen textruta, så du kopierar ut resultatet för hand. Att diktera rakt in i vilken app som helst är vad skrivbordsappen Yaps gör: du håller en snabbtangent och texten hamnar vid markören var du än är.

Lägger det till skiljetecken och versaler?

Modellen skriver ut vad den hör, inklusive grundläggande interpunktion, men det finns inget korrigeringspass efteråt. Utfyllnadsord, upprepade ord och övergivna meningar kommer alla fram när du sa dem. Skrivbordsappen rensar upp det medan du pratar.

Hur länge kan jag prata på en gång?

Det finns ingen fastställd gräns. Långt ljud bearbetas i 30 sekunders fönster med en överlappning så att meningar inte halveras. Den praktiska gränsen är tålamodet: ju längre inspelningen är, desto längre blir pausen efter att du stoppat medan den transkriberas.

Vilka språk hanterar den?

Modellen är flerspråkig och känner av språket automatiskt, så du kan bara börja prata. Den är starkast på engelska och i de andra utbredda språken, och den gör fler misstag på språk med mindre träningsdata bakom sig.

Fungerar det på en telefon?

Den körs i mobila webbläsare, men modellnedladdningen och bearbetningen på enheten är märkbart långsammare än på en bärbar dator. På Android är tangentbordet Yaps en mycket bättre upplevelse eftersom diktering är inbyggt i själva tangentbordet.

Vad händer med min text när jag stänger fliken?

Det försvinner. Ingenting sparas på ett konto, eftersom det inte finns något konto och ingenstans för din text att skickas. Kopiera texten eller ladda ner den som en .txt-fil innan du lämnar sidan om du vill behålla den.

Börja japaMac · Windows · Linux · Android

Gör det nu everywhere.

En nyckel, vilken app som helst, rensas upp medan du pratar.

Ladda ner för Mac

Kräver macOS 13.0+ (Apple Silicon rekommenderas)iOS kommer snart