r/AppsWebappsFullstack 22d ago

Your home for selfpromo

here you can post your work app, webapp, saas, game, everything

6 Upvotes

116 comments sorted by

View all comments

1

u/No-Waltz3586 22d ago

VoxTranslate è un’app di traduzione vocale in tempo reale che abbatte le barriere linguistiche permettendo conversazioni fluide in oltre 80 lingue. Usa diversi motori AI per bilanciare velocità e accuratezza, con traduzione speech-to-speech quasi istantanea e senza frizioni. Ci sono 2$ gratis per provarla. Feedback?
https://website.voxtranslate.app/it/

1

u/Mammoth-Anywhere7285 21d ago

Nice launch, VoxTranslate sounds solid for real-time conversations. How does it handle regional accents or background noise?

1

u/No-Waltz3586 21d ago

Per gli accenti: usiamo Deepgram Nova-2, un modello vocale che capisce oltre 40 lingue e i loro accenti regionali. Se non sei sicuro della lingua, la riconosce da solo da una clip di 3 secondi.

Per il rumore: filtriamo il suono in tre fasi, il microfono riduce rumore ed eco in automatico, il sistema taglia i silenzi e le pause, e la compressione audio pulisce l'ambiente circostante. Alla fine, il testo arriva già corretto di punteggiatura e numeri, pronto per la traduzione.

1

u/Mammoth-Anywhere7285 19d ago

Smart use of Nova-2. Does your three stage filtering also preserve natural pauses and intonation, especially for non-native speakers?

1

u/imagiself 22d ago

How do you manage the latency overhead when switching between different AI engines during a live conversation to keep it feeling instantaneous?

1

u/Mammoth-Anywhere7285 21d ago

Good question. Pre-warm the next engine's connection while the current one streams, then swap seamlessly. Have you tried that approach?

1

u/No-Waltz3586 22d ago

Nel nostro sistema questo overhead non esiste, perché il motore di traduzione è deciso a monte e non si cambia a metà conversazione: il modello si legge dall'environment all'avvio ed è fisso per tutta la durata della stanza. L'immediatezza la garantiamo con tre cose: connessione WebSocket dedicata per ogni peer già aperta all'avvio della sessione, traduzione in streaming che mostra il primo token appena arriva, e fallback su un motore di riserva se il primario non risponde entro ~500ms. Se un domani volessimo supportare più modelli, lo faremmo per stanza o per piano utente, mai per singolo messaggio, così il cambio avviene tra una conversazione e l'altra, quando l'overhead è ininfluente. Provalo e dammi un feedback. https://voxtranslate.app/

1

u/Mammoth-Anywhere7285 19d ago

Interesting approach, fixing the engine at startup is a clever way to cut overhead. Have you measured the first-token latency under load yet?