Si has fet servir una app de traducció fa poc i has pensat "espera, això realment ha sonat com una persona", és força probable que al darrere hi hagués un gran model d'IA. Aquest article explica, en llenguatge planer, què fa diferent la traducció amb la IA de Gemini respecte de la generació anterior d'eines — i per què aquesta diferència és una cosa que pots sentir, no només llegir en una fitxa tècnica.

Live Translator+ està construït sobre Google Gemini, així que el farem servir per als exemples concrets. Res d'argot més enllà del mínim imprescindible, promès.

Traducció clàssica vs. traducció basada en models

Els sistemes de traducció clàssics treballaven frase a frase, mapant paraules i expressions entre idiomes amb patrons apresos de textos paral·lels. Hi van arribar a ser impressionantment bons — però fonamentalment processaven *text*, despullat de situació.

Gemini pertany a una família diferent: els grans models multimodals. "Multimodal" vol dir simplement que es va entrenar amb text, parla i imatges alhora, de manera que el mateix sistema que tradueix la teva frase també pot sentir el to en un àudio i llegir un rètol escrit a mà en una foto. I com que modela el llenguatge en profunditat en lloc de mapar frases fetes, arrossega el *context* a través de la traducció.

Què t'aporta realment el context

El context sona abstracte fins que veus els errors que evita:

  • Les frases fetes sobreviuen. "It's on the house" es converteix en l'oferta d'una beguda gratis, no en una afirmació sobre arquitectura.
  • L'ambigüitat es resol amb seny. La paraula "bank" acaba sent la riba d'un riu o una entitat financera segons la frase que l'envolta, tal com ho decidiria un oient humà.
  • El to es manté. Una petició educada continua sent educada; un acudit conserva la seva forma. En idiomes amb nivells de formalitat — japonès, coreà, alemany — això és la diferència entre sonar respectuós i sonar estrany.
  • Els noms i els plats continuen sent ells mateixos. "Kuzu tandır" en un menú turc torna com a xai rostit a foc lent, no com un experiment de química.

En una conversa, aquestes petites correccions es van acumulant. Una traducció estranya per intercanvi fa que la gent es torni cauta; zero fan que oblidin que l'app hi és.

La veu és la meitat de la màgia

La generació de parla de Gemini està entrenada per produir prosòdia — les pujades, baixades i el ritme de la parla natural — en lloc de cosir fonemes a un to constant. Live Translator+ n'exposa 12 veus, i l'efecte pràctic es veu en el comportament dels altres: quan el mòbil parla amb naturalitat, la persona amb qui parles et respon a *tu*, manté el contacte visual i contesta a velocitat normal. Les veus robòtiques fan que la gent parli més a poc a poc i vocalitzi en excés, cosa que irònicament ho fa tot més difícil.

Això també explica per què l'entrada de veu funciona tan bé en l'altra direcció. El model gestiona els "ehm", les represes i les correccions a mitja frase — tal com parla la gent de debò — en lloc d'exigir una frase neta i dictada. Combinat amb la detecció automàtica d'idioma, vol dir que dues persones poden simplement parlar per torns i deixar que l'app esbrini qui parla què. Pots veure com funciona a la pràctica a la nostra guia sobre l'experiència del traductor de converses en temps real.

Les imatges es tradueixen entenent-les, no només amb OCR

La traducció amb càmera antiga executava primer un reconeixement òptic de caràcters i després traduïa els caràcters que havia extret. Si l'OCR llegia malament una lletra estilitzada, la traducció n'heretava les escombraries.

Un model multimodal mira la foto com un tot: llegeix el text *i* registra que això és un menú, que allò són preus, que el gargot de baix és el plat del dia. Per això la traducció amb la IA de Gemini se'n surt amb pissarres, rètols de cal·ligrafia a pinzell i etiquetes atapeïdes que haurien trencat la cadena de l'OCR. A Live Translator+, a més, pots retallar la foto fins a la secció rellevant, donant al model una vista neta i centrada.

El compromís honest: viu al núvol

Els models amb aquesta capacitat són massa grans per executar-se en un mòbil, així que la traducció passa en servidors i el teu dispositiu necessita connexió a internet. És una limitació real — els viatgers de zones molt remotes haurien de portar una reserva fora de línia — però també és precisament per què el sostre de qualitat és tan més alt. Els models fora de línia al dispositiu existeixen i milloren, però el 2026 la diferència en naturalitat i gestió del context encara se sent clarament.

El requisit d'ample de banda és modest: amb dades mòbils normals n'hi ha prou, perquè el que viatja és àudio comprimit i text, no el model.

Sentir-ho guanya a llegir-ne

Les explicacions tecnològiques arriben fins on arriben — la demo convincent dura trenta segons i s'executa al teu propi mòbil. Digues una frase feta, escolta la veu, fotografia alguna cosa amb una lletra horrorosa. Per a la visita completa a tot el que s'ha construït sobre aquesta tecnologia, comença per la nostra visió general del traductor de veu amb IA, o simplement descarrega Live Translator+ gratis i deixa que jutgin les teves orelles.

PMF

La traducció amb la IA de Gemini és prou precisa per a converses importants?

Per a viatges, família i converses de negocis quotidianes, sí — la gestió del context la fa notablement més fiable que les eines antigues. Per a documents legals o mèdics on els errors tenen conseqüències serioses, recorre a un traductor humà professional; això val per a qualsevol app.

Per què la traducció amb Gemini necessita internet?

El model és massa gran per executar-se en un mòbil. El teu àudio o la teva foto es processen en servidors i el resultat torna en segons; amb dades mòbils normals n'hi ha prou.

Quina diferència hi ha entre la traducció amb Gemini i la traducció automàtica normal?

Els sistemes normals mapen text entre idiomes frase a frase. Gemini modela llenguatge, parla i imatges alhora, així que preserva el context, el to i les frases fetes — i pot pronunciar el resultat amb una veu natural gairebé humana.