Iedomājieties, ka stāvat pilnā dzelzceļa stacijā ar austiņām un klausāties, kā svešinieka vārdi tiek pārtulkoti jūsu valodā gandrīz pirms viņš pabeidz teikumu. To sola Google ar Gemini 3.5 Tiešraides tulkošana, modelis, kas radīts, lai reāllaika runas tulkojums šķistu ne tik daudz kā mašīna, cik kā daudzvalodu draugs, kas tulko uz vietas.
Gemini 3.5 Tiešraides tulkošana var atpazīt un atveidot runu vairāk nekā 70 valodās, saglabājot runātāja ritmu, intonāciju un tempu, lai tulkojumi skanētu dabiski, nevis robotiski. Triks nav maģiska slēdžu pārslēgšana, bet straumēšanas pieeja, kas apstrādā audio tikmēr, kamēr tas tiek runāts, samazinot neveiklas pauzes, kas rodas vecākās sistēmās, kuras gaidīja, līdz runātājs pabeidzis, pirms atbildēt.
Latence ir maza. Ļoti maza. Google apgalvo, ka tulkojumi atpaliek no sākotnējā balss tikai par dažām sekundēm, radot plūdenāku sarunu ritējumu. Tas arī pārvalda jauktas valodas ievadi bez manuālām iestatēm — jūs varat būt ar daudzvalodu dalībniekiem un modelis tiks galā ar plūsmu. Nav jālauza galva par izvēlnēm zvana laikā. Nav jāmeklē režīmu pārslēgšana. Par to arī ir runa.
Pieejamība sākas Google Tulkošanas lietotnē Android un iOS. Lai to izmantotu, pieslēdziet austiņas un pieskarieties Tiešraides tulkošana opcijai apakšējā kreisajā stūrī. Ja jums nav austiņu, jaunais Klausīšanās režīms Android ierīcēs atskaņo tulkojumus caur telefona skaļruni: vienkārši turiet ierīci pie auss kā parastā zvana laikā un ļaujiet telefonam tulkot.

Sapulcēm tas var būt būtiskas pārmaiņas. Google sapulču rīka tiešraides subtitri iepriekš bija ierobežoti ar tikai piecām valodām tulkotai runai. Ar Gemini 3.5 atbalsts paplašinās uz vairāk nekā 70 valodām, ļaujot vienā sesijā iespējot vairāk nekā 2000 valodu kombināciju, kas nodrošina daudz plašāku pārklājumu globālām komandām, klases telpām un pasākumiem.
Tīmeklī Google ievieš viena pieskāriena vadību, lai uzreiz sāktu tiešraides tulkošanu. Šī vadība tiks izmēģināta šomēnes, kas norāda, ka uzņēmums vēlas, lai reāllaika tulkošana jutītos kā iebūvēta funkcija, nevis papildinājums.
Modelis ir izstrādāts, lai būtu izturīgs trokšņainā un neprognozējamā vidē. Fona sarunas, ielu troksnis vai pārklājošas balsis var rasties, taču Gemini 3.5 ir radīts, lai tiktu galā ar šādu nosacījumu izaicinājumiem. Izstrādātāji var sagaidīt, ka modelis parādīsies Google ekosistēmā, no Tulkošanas lietotnes līdz sapulču rīkam un API trešo pušu lietotnēm.
Visa audio, ko rada Google modeļi, saturēs neredzamu SynthID ūdenszīmi, kas iegultā izvades signālā ļauj atpazīt ar AI ģenerētu runu un palīdz mazināt ļaunprātīgu izmantošanu.
Joprojām ir jautājumi. Kā sistēma tiks galā ar reģionālajiem dialektiem, valodu pārslēgšanu vai valodām ar ierobežotām datu kopām? Kā tiks risināti privātuma un piekrišanas jautājumi, kad sarunas tiek transkribētas un tulkotas reāllaikā? Google atsaucas uz divdesmit gadu tulkošanas darbu un apgalvo, ka miljardi lietotāju jau paļaujas uz tā rīkiem, taču jaudīga straumēšanas modeļa ieviešana ikdienas lietošanā rada jaunus politikas un lietotāja pieredzes izaicinājumus.
Ikvienam, kas ceļo, māca vai vada globālas sapulces, Gemini 3.5 tiešraides tulkošana ir praktisks solis uz priekšu: mazāk berzes, vairāk tūlītības un balss, kas skan cilvēcīgi. Kad valoda pārstāj būt siena un kļūst par fona troksni, jautājums mainās no tā, kā mēs tulkojam, uz to, kā klausāmies citādi.




.webp)
Diskusija
Atstāt komentāru
Komentāri
Vēl nav komentāru. Esiet pirmais.