Repository navigation
Espanol Referencia de ajustes
Abre Configuración con el botón de engranaje. Aceptar guarda los cambios; Cancelar los descarta. Los cambios que afectan a modelos, tiempos de ejecución, ubicaciones de almacenamiento o servicios de red pueden tardar un momento en aplicarse y pueden recargar un componente.
Esta referencia está destinada como una guía de ajuste, no solo como una lista de controles. Los valores predeterminados son un buen punto de partida para la mayoría de las instalaciones locales de Windows. Cambia un ajuste relacionado a la vez, pruébalo en la aplicación donde realmente dictas, y conserva el valor anterior hasta que el resultado sea claramente mejor.
| Objetivo | Punto de partida recomendado |
|---|---|
| Dictado confiable diario en aplicaciones de escritorio normales | Idioma de transcripción fijo, inserción en Portapapeles, restauración del portapapeles activada, retrasos predeterminados, normalización de audio activada |
| Dictado en un terminal o escritorio remoto | Pruebe primero Unicode si el reenvío del portapapeles no está disponible. De lo contrario, mantenga Portapapeles y seleccione el atajo de pegar aceptado por el destino remoto. Use Código de Escaneo para aplicaciones que solo responden de manera confiable a entradas similares a teclas físicas. |
| Documentos largos | Idioma fijo, puntuación hablada, formato encadenado, modo de tecla rápida de retención o híbrido, grabaciones WAV guardadas |
| Campos de búsqueda cortos, chats y comandos | Elimine el punto final; opcionalmente use formato con primera letra en minúscula; el modo de tecla rápida mantenida evita dejar la grabación activa accidentalmente |
| Uso silencioso o sensible a la privacidad | Desactivar grabaciones WAV guardadas, revisar la retención de transcripciones, desactivar la inserción en el portapapeles si hay aplicaciones que monitorean el portapapeles, y evitar entornos remotos | | Latencia percibida más baja | Desactivar la vista previa en tiempo real a menos que sea útil, usar un modelo/entorno de transcripción local rápido, mantener bajas las demoras de inserción, y no recopilar la salida de IA antes de la inserción |
- Idioma de transcripción: Seleccione el idioma que más utiliza al hablar. Un idioma fijo normalmente comienza más rápido y es más confiable que Automático, especialmente para dictados cortos, nombres y palabras que suenan de manera similar. Use la detección automática solo cuando realmente cambie de idioma entre grabaciones; la detección de idioma tiene menos evidencia en una frase corta y puede elegir incorrectamente.
- Términos y nombres especializados personalizados: Agregue nombres poco comunes, términos de productos, abreviaturas y la ortografía que desea que Whisper prefiera. Mantenga la lista enfocada: guía el reconocimiento pero no es una regla de búsqueda y reemplazo garantizada, y una lista larga de palabras comunes puede introducir un sesgo no deseado. Esta orientación está destinada a Whisper; otro motor de transcripción puede no usarla de la misma manera.
El mejor método de inserción depende de la aplicación objetivo. Pruébalo en el programa más difícil que uses, no solo en un editor simple.
-
Portapapeles: La mejor opción general en Windows y generalmente la más rápida para texto largo, caracteres especiales y Unicode complejo. Voice2Win reemplaza temporalmente el portapapeles, envía un comando de pegar y puede restaurar el contenido anterior. Los administradores de portapapeles u otras aplicaciones pueden observar el texto temporal, y el reenvío del portapapeles puede estar deshabilitado en una sesión remota.
-
Unicode: Independiente del diseño y una buena primera alternativa para sesiones remotas, sistemas que no son Windows y texto que contiene caracteres que no están presentes en el diseño de teclado actual. Algunos juegos, terminales, aplicaciones legadas y ventanas con privilegios elevados no aceptan Unicode simulado de manera confiable.
-
Código de escaneo: Se comporta más como la entrada de un teclado físico y puede ayudar con aplicaciones de destino antiguas o inusuales. Depende del diseño de teclado activo; un carácter que no tenga una tecla correspondiente en ese diseño puede faltar o estar equivocado. Por lo general, es más lento que un solo pegado desde el portapapeles para textos largos.
-
Retardo de simulación del teclado (0–50 ms): Déjelo bajo a menos que la inserción de Unicode o Código de escaneo pierda caracteres o cambie su orden. Auméntelo en pequeños pasos para aplicaciones lentas, máquinas virtuales o escritorios remotos. Esta configuración solo ralentiza las pulsaciones de teclas simuladas; no mejora el reconocimiento de voz.
-
Usar el portapapeles para aplicaciones problemáticas: Mantén esto habilitado al usar Unicode o Código de Escaneo a menos que el uso del portapapeles esté prohibido. Voice2Win puede entonces recurrir a las aplicaciones conocidas que no aceptan bien la entrada simulada. Desactívalo solo cuando la privacidad del portapapeles o el reenvío del portapapeles sea la razón por la que elegiste deliberadamente la simulación de teclado.
-
Tiempo de espera antes de la inserción (0–2000 ms, valor predeterminado 40 ms): Tiempo que tarda en estar disponible el nuevo valor del portapapeles antes de enviar el atajo de pegar. Auméntalo cuando el destino ocasionalmente pegue el valor anterior del portapapeles o no pegue nada en absoluto, especialmente a través de la sincronización remota del portapapeles. Un valor mayor añade el mismo retraso a cada inserción.
-
Combinación de teclas para pegar: Usa Ctrl+V para aplicaciones normales de Windows. Prueba Ctrl+Shift+V o Shift+Insert cuando un terminal, escritorio remoto o herramienta de IA trate a Ctrl+V como algo distinto de pegar texto plano. Elige el atajo que se espera en el destino final, no necesariamente en la ventana local del escritorio remoto.
-
Recopilar texto durante la mejora de IA e insertarlo en un solo paso: Habilítalo cuando la salida progresiva de la IA mueva el cursor, active el formato o la autocompletación, o cree varios pasos de deshacer. Desactívalo cuando sea más importante ver el resultado lo antes posible; la recopilación espera hasta que el resultado de la IA esté completo antes de insertar cualquier cosa.
-
Restaurar el portapapeles anterior: Mantén esto habilitado para el trabajo normal para que Voice2Win no destruya lo que copiaste antes de la dictado. Desactívalo solo si deseas intencionalmente que el resultado dictado permanezca en el portapapeles o si un objetivo específico lee el portapapeles después de que el atajo de pegado ya haya regresado.
-
Tiempo de espera antes de restaurar (0–2000 ms, predeterminado 120 ms): Auméntelo cuando el objetivo no inserte nada o solo parte del texto porque el valor anterior del portapapeles se restaura demasiado rápido. Manténgalo solo tan alto como sea necesario: durante este intervalo, el texto dictado permanece disponible para las aplicaciones que reconocen el portapapeles.
Estas opciones modifican el texto reconocido antes de su inserción. Son más útiles cuando sus dictados siguen un patrón consistente.
-
Puntuación hablada: Actívala para textos más largos cuando quieras que frases como “coma”, “signo de interrogación” o sus equivalentes en tu idioma se conviertan en puntuación. Déjala desactivada cuando esas palabras puedan ser contenido literal, o cuando prefieras la puntuación automática del modelo de transcripción.
-
Eliminar el punto final: Útil para campos de búsqueda, mensajes de chat, campos de formularios, nombres de archivos y comandos de voz donde un punto final agregado automáticamente no es deseado. Déjalo desactivado para oraciones completas en documentos y correos electrónicos.
-
Minúscula en la primera letra: Útil cuando la dictación normalmente se inserta en medio de una oración existente. Déjalo desactivado para nuevas oraciones, encabezados, nombres y mensajes independientes.
-
Conectar dictados consecutivos en la misma aplicación: Actívelo cuando construya un párrafo a partir de varias grabaciones; Voice2Win puede mantener el espacio y el contexto de las oraciones entre ellas. Desactívelo cuando las grabaciones consecutivas generalmente van a diferentes campos, o cuando mueve frecuentemente el cursor manualmente entre dictados.
-
Sensibilidad de detección de voz (0–100, valor predeterminado 35%): Valores más bajos aceptan voces más suaves, pero también pueden interpretar la respiración, los clics o el ruido de fondo como voz. Valores más altos filtran el ruido de manera más agresiva, pero pueden rechazar voces suaves o los finales de las palabras. Comienza con el valor predeterminado y cámbialo en pequeños pasos mientras observas el nivel de entrada; acercar el micrófono suele ser mejor que usar un valor extremo.
-
Limpiar el inicio de la grabación (0–500 ms, valor predeterminado 250 ms): Suprime el clic de la tecla rápida, el ruido de manipulación y el silencio inicial al comienzo. Auméntalo si la primera parte de las grabaciones contiene un clic de tecla; redúcelo si la primera sílaba se corta o dictas palabras muy cortas inmediatamente después de presionar la tecla rápida.
-
Normalizar la grabación (activado por defecto, objetivo 85%): Recomendado para micrófonos comunes y cuando cambia la distancia al hablar, ya que presenta un nivel más consistente al modelo. Desactívelo para una entrada de estudio/virtual ya normalizada, o cuando la normalización aumenta visiblemente el ruido de fondo constante. El objetivo no es un control de ganancia del micrófono y no puede recuperar audio saturado.
-
Guardar grabaciones WAV (activado por defecto): Manténgalo activado cuando quiera reproducción, retranscripción, comparación de calidad o evidencia diagnóstica. Desactívelo cuando el uso de almacenamiento o la confidencialidad sean más importantes. El audio normalmente consume mucho más espacio que el texto.
-
Eliminar grabaciones WAV guardadas: Elimina el audio almacenado mientras se conserva el texto de la transcripción. Úselo después de asegurarse de que ya no necesitará reproducción o retranscripción; la eliminación no puede recrear el audio original.
- Mantener: La grabación dura solo mientras se mantiene presionado el atajo. Es lo mejor para dictados cortos y frecuentes y el modo más seguro cuando se debe evitar la grabación accidental de fondo.
- Traba: Presiona una vez para empezar y otra vez para detener. Es ideal para pasajes largos, uso de accesibilidad o hablar sin usar las manos, pero requiere una acción deliberada para detener.
- Híbrido / doble toque: Mantén presionado para una grabación corta o toca dos veces para activar la traba. Esta es la opción predeterminada más flexible para trabajo mixto. Usa Mantener en su lugar si los toques dobles accidentales a veces dejan la grabación activa.
-
Asigne atajos separados para De voz a texto y Comando de voz. Prefiera combinaciones que no sean ya manejadas por el sistema operativo, el controlador del teclado, el escritorio remoto, o la aplicación de destino. Se rechazan los atajos duplicados de Voice2Win.
-
En Windows, Voice2Win usualmente no puede inyectarse en una aplicación que se esté ejecutando con privilegios elevados. Ejecute Voice2Win con permisos elevados solo cuando sea realmente necesario dictar en aplicaciones con privilegios elevados; el acceso global elevado aumenta el impacto de cualquier error de aplicación o configuración.
-
Silenciar la salida de audio global mientras se mantiene presionada la tecla de acceso rápido es útil con altavoces porque el audio del sistema no puede retroalimentarse en el micrófono. Desactívelo al usar auriculares o cuando sea necesario escuchar una reunión o fuente de medios durante la grabación.
-
Señales de inicio y detención separadas hacen que el estado de retención/híbrido sea claro cuando el indicador no es visible. Mantenga los sonidos cortos y suaves al usar altavoces para que el micrófono no los capture. Aumente la duración o el volumen para accesibilidad, no para resolver una detección de tecla rápida poco fiable.
- Idioma de la interfaz cambia solo los menús y etiquetas; no selecciona el idioma de transcripción.
- Tema oscuro es una preferencia visual y no afecta el reconocimiento ni el rendimiento.
- Estilo del indicador: una visualización simple de nivel resulta menos distractora; la forma de onda o las barras facilitan juzgar la actividad del habla; las visualizaciones tipo espectro muestran más detalles pero son visualmente más recargadas. Elige el estilo que te ayude a confirmar la actividad del micrófono sin cubrir la aplicación objetivo.
- Esquema de color, posición y tamaño: utiliza un esquema de alto contraste y una posición alejada de barras de herramientas, subtítulos y el cursor de texto. Un indicador más grande ayuda con la accesibilidad y el texto en tiempo real; uno más pequeño es mejor cuando solo importa el estado de grabación.
-
Inicio automático deshabilitado es lo mejor cuando Voice2Win se usa ocasionalmente. Inicio automático desde el registro es la opción normal de Windows para iniciar después del inicio de sesión. Programador de tareas es útil cuando se requiere el orden de inicio o la ejecución con privilegios elevados. En Linux, la aplicación usa el mecanismo de inicio automático por usuario del escritorio.
-
Ejecutar con privilegios elevados mediante el Programador de tareas debe permanecer apagado a menos que necesites dictar en aplicaciones de administrador. La elevación no es una opción de rendimiento; cambia el límite de seguridad del acceso global al teclado.
-
Mostrar cuadro de diálogo de confirmación de inicio automático es útil mientras se valida una nueva configuración de inicio automático o en un equipo compartido. Desactívalo solo cuando el inicio esté confiable y deba ser automático.
-
Mostrar pantalla de presentación ayuda cuando la inicialización del modelo/tiempo de ejecución toma un tiempo notable. Desactívalo para un inicio más silencioso al estilo bandeja.
-
Sonido de listo confirma que la inicialización y la preparación del modelo están completas, especialmente cuando Voice2Win se inicia minimizado. Desactívelo en entornos tranquilos; ajuste la duración y el volumen solo lo suficiente para ser reconocible.
-
Minimizar al cerrar (activado por defecto) mantiene los atajos globales disponibles después de cerrar la ventana principal. Desactívelo cuando el botón de cerrar de la ventana deba salir de la aplicación en su lugar.
-
Buscar actualizaciones automáticamente (activado por defecto) se recomienda para correcciones, compatibilidad de modelo/ejecución y actualizaciones de seguridad. Desactívelo solo para instalaciones deliberadamente gestionadas o sin conexión y revise manualmente en su lugar.
-
Desactivar el diálogo de información semanal oculta el aviso de información recurrente después de que ya no lo necesite; no desactiva mensajes funcionales o de error.
-
Estado de automatización de entrada en Linux es información de diagnóstico. Se admite la automatización de entrada compatible con X11; una sesión pura de Wayland puede restringir los atajos globales y la inyección de texto. Si no está disponible, use una sesión X11 o el modo de compatibilidad ofrecido por el entorno de escritorio.
-
Ruta de almacenamiento de transcripciones: Elija una carpeta local confiable. Use una ubicación encriptada para dictados sensibles y asegúrese de que el software de respaldo/sincronización no entre en conflicto con los archivos que aún se están escribiendo. Un disco de red lento o intermitente puede retrasar las operaciones de historial.
-
Eliminar transcripciones antiguas / edad máxima: Habilite la retención automática cuando importen la política de privacidad o el uso del disco. Elija una edad que aún cubra su ventana realista de corrección y retranscripción. Los archivos WAV guardados normalmente constituyen la mayor parte del historial.
-
Ruta de almacenamiento del modelo: Prefiera un SSD local rápido con suficiente espacio libre. Las unidades removibles y de red hacen que la carga del modelo sea menos confiable y pueden convertir una unidad desconectada en un modelo aparentemente perdido.
-
Usar una raíz de datos personalizada / mover todos los datos de la aplicación: Útil para configuraciones portátiles, copias de seguridad controladas o para mantener datos grandes fuera del disco del sistema. Seleccione una carpeta con permisos adecuados y espacio libre, luego reinicie cuando se le solicite. Esto reubica los datos locales; no los encripta ni los sube automáticamente.
La transcripción en tiempo real es una vista previa mientras aún está hablando. La transcripción final normal sigue siendo el resultado autorizativo. Deje deshabilitado el modo en tiempo real cuando una vista previa no sea útil: eso minimiza el uso de recursos y evita que las palabras preliminares cambien en la pantalla.
- Bloque ejecuta repetidamente el modelo principal de transcripción Whisper sobre audio superpuesto. Elígelo cuando quieras que la vista previa se parezca al resultado final de Whisper y tengas una GPU compatible con suficiente memoria. Proporciona más contexto pero genera un trabajo repetido considerable en la GPU.
- Transmisión utiliza un modelo de transmisión Sherpa-ONNX separado. Elígelo para la retroalimentación incremental más temprana o cuando el modo bloque no esté disponible. Su vista previa puede ser más aproximada y solo admite los idiomas listados en la configuración; la transcripción final normal aún puede diferir.
- Altura máxima de visualización limita cuánto de la pantalla puede ocupar la vista previa. Auméntala para el uso de accesibilidad de formato largo; redúcela cuando el indicador cubra la aplicación objetivo. No cambia la calidad del reconocimiento.
Los valores predeterminados están equilibrados e interdependientes. Restáuralos antes de solucionar problemas y cambia solo un parámetro a la vez.
-
Tamaño de ventana (predeterminado 10 s): Auméntalo cuando el contexto de la frase sea insuficiente o las frases largas cambien demasiado entre instantáneas. Las ventanas más grandes tardan más y utilizan más recursos de procesamiento/memoria. Redúcelo para actualizaciones individuales más rápidas en hardware capaz, aceptando menos contexto.
-
Intervalo de salto (predeterminado 3 s): Redúcelo para obtener actualizaciones de vista previa más frecuentes; aumentalo cuando la carga de la GPU sea demasiado alta. Un salto más pequeño inicia más ejecuciones de transcripción y no hace que cada ejecución sea más rápida.
-
Superposición / contexto (predeterminado 20 s): Auméntalo cuando las palabras en los límites de los bloques se dupliquen, se omitan o se junten incorrectamente. Redúcelo para disminuir el trabajo repetido. Muy poca superposición elimina evidencia necesaria para conciliar instantáneas adyacentes.
-
Retraso de estabilidad (predeterminado 6 s): Auméntalo cuando las palabras se confirmen demasiado pronto y el contexto posterior podría haberlas corregido. Redúcelo cuando el texto estable aparezca demasiado despacio, aceptando más revisiones.
-
Límite de tiempo de silencio (predeterminado 1000 ms): Redúcelo cuando el texto deba asentarse rápidamente después de una pausa. Auméntalo cuando las vacilaciones naturales dividan o finalicen los pensamientos demasiado pronto.
-
Comprobaciones adicionales de límite de oración (predeterminado 2): Auméntalas solo cuando las transiciones de oración sean repetidamente incorrectas y haya capacidad de GPU disponible. Cada transcripción adicional desplazada cuesta tiempo. Configúralo en 0 para desactivar las ejecuciones extra; la comprobación central del límite aún permanece.
-
Factor de desplazamiento (por defecto 20%): Controla qué tan lejos se mueven las ventanas de verificación adicionales en relación con el tamaño de la ventana. Aumentarlo cuando verificar un área más amplia alrededor de un límite ayuda; reducirlo cuando el contexto cercano es suficiente. Solo importa junto con verificaciones adicionales.
- Tiempo de ejecución: CPU ofrece la compatibilidad más amplia. DirectML puede reducir la latencia en GPUs de Windows compatibles, pero utiliza recursos de la GPU que también pueden ser necesarios para el modelo principal.
- Variante del modelo: Elige Rápido para baja latencia y menor uso de recursos. Elige Preciso cuando la calidad de la vista previa sea más importante que la velocidad.
- Ventana de refinamiento de oraciones (1–8, por defecto 2): Un valor de 1 da la finalización más rápida de la oración. Valores más altos conservan más contexto de la oración para el refinamiento, pero retrasan la resolución e incrementan el trabajo. El valor por defecto es un equilibrio práctico.
- Modelos en caché: Eliminar un modelo en caché no usado libera espacio en disco. Si esa combinación de idioma/tiempo de ejecución/modelo se selecciona más adelante, debe descargarse nuevamente antes de que la vista previa esté lista.
Consulta Transcripción en tiempo real para ver el flujo de trabajo completo y los requisitos de disponibilidad.
- Whisper es la elección general para soporte amplio de idiomas y variantes de modelos establecidas. Parakeet puede ser atractivo cuando sus idiomas soportados y el hardware disponible coinciden con tu caso de uso. Selecciona según tus grabaciones reales; las calificaciones con estrellas y las estimaciones de velocidad son una orientación, no un sustituto para probar tu micrófono, idioma y vocabulario.
- Los modelos más grandes o de mayor calidad generalmente necesitan más memoria y tiempo, pero pueden mejorar el audio difícil. Comienza con el modelo más pequeño que sea suficientemente preciso de manera confiable. Un modelo que causa presión de memoria o colas largas puede ser menos útil que un modelo ligeramente más pequeño que se complete de manera consistente.
- El gestor de modelos descarga y elimina archivos de modelos locales. No elimines un modelo que aún sea necesario para un motor seleccionado o un flujo de trabajo sin conexión.
-
Asignar transcripción de audio y mejora con IA de forma independiente. Una GPU suele ser la mejor opción para trabajos locales repetidos; la CPU es el recurso de compatibilidad, pero puede ser mucho más lenta. Dividir las dos tareas entre dispositivos puede evitar la contención de memoria de la GPU cuando se usan ambas al mismo tiempo.
-
Para Ollama o LM Studio, selecciona el tipo de servidor, la dirección, el puerto y el modelo cargado. Usa el descubrimiento solo en una red de confianza y verifica que el modelo elegido esté realmente disponible en el servidor.
-
Un servidor de IA remoto u otra computadora Voice2Win puede mover el trabajo lejos de una máquina más débil, pero introduce latencia de red y envía el audio o el texto de la tarea a ese sistema. Usa solo hosts y redes de confianza.
-
Compartir el tiempo de ejecución local solo cuando otra instalación confiable de Voice2Win lo necesite. Usa una contraseña, permite el puerto a través del firewall solo en el perfil de red previsto, y desactiva la compartición cuando ya no sea necesaria. Las advertencias de cliente conectado y de versión ayudan a identificar clientes inesperados o incompatibles.
-
Tamaño del contexto (predeterminado 4096): Auméntalo para texto seleccionado largo, instrucciones extensas o transformaciones que necesiten más contexto circundante. Un contexto más grande consume más memoria y puede ser más lento. No mejora automáticamente las correcciones cortas.
-
Máximo de tokens (predeterminado 512): Auméntalo cuando las reescrituras largas se corten. Redúcelo para acotar el tiempo de respuesta y prevenir resultados inesperadamente largos. La corrección normal de dictado rara vez necesita un valor muy grande.
-
Temperatura (predeterminado 0.2): Valores bajos son más repetibles y son mejores para corrección, formato y preservación del significado. Súbela solo para reescrituras deliberadamente creativas; valores más altos pueden cambiar la redacción o los hechos más libremente.
-
Longitud mínima de la transcripción para la mejora por IA (predeterminado 20 caracteres): Redúcela cuando incluso frases muy cortas deban ser procesadas. Auméntala para evitar la demora en el inicio del modelo y reescrituras inesperadas en entradas muy pequeñas, como “sí” o un nombre.
-
Indicaciones del sistema: Esta es la instrucción permanente para la mejora por IA predeterminada. Indica el idioma deseado, si se debe preservar el significado y el tono, y que solo se debe devolver el texto final. Prueba cambios en las indicaciones con textos no críticos: una instrucción demasiado amplia puede responder la dictación, traducirla o agregar explicaciones en lugar de corregirla.
-
Almacenamiento de modelos de IA alternativos: Utiliza una unidad local rápida con espacio adecuado. Copiar modelos existentes evita otra descarga; cambiar solo la carpeta no hace que un modelo faltante o incompatible sea utilizable.
Vea Modelos de IA y Hardware y Mejora de IA.
-
Calidad del modelo de reconocimiento de hablantes: Prefiera el modelo de mayor calidad cuando sea importante separar voces similares y la máquina tenga suficiente memoria/rendimiento. Use un modelo más ligero para sesiones largas en hardware limitado. Los modelos descargados se vuelven seleccionables inmediatamente.
-
Sensibilidad a la separación de hablantes: Comience con Predeterminado. Auméntela cuando dos voces diferentes pero similares se fusionen repetidamente; la compensación es que la voz cambiante de una persona, la distancia o el ángulo del micrófono pueden dividirse en hablantes adicionales. Redúzcala cuando una persona aparezca repetidamente como varios hablantes; la compensación es que voces genuinamente similares pueden fusionarse.
-
Sensibilidad de detección de voz: Auméntela cuando se transcriban clics, ruidos de la habitación o bloques silenciosos. Redúzcala cuando se omitan hablantes tranquilos. Esta puerta decide si un bloque se envía para transcripción; un bloque rechazado de manera agresiva no puede ser recuperado por un modelo de transcripción más preciso.
-
Pausa de finalización (predeterminada 10 s, en la página de Grabación de Conversaciones): Use una pausa más corta cuando las secciones deban cerrarse rápidamente después de que los hablantes dejen de hablar. Use una pausa más larga para discusiones reflexivas con largas hesitaciones; los resultados aparecerán más tarde, pero es menos probable que una contribución se divida.
-
Altavoces esperados (Automático por defecto, en la página de Grabación de Conversación): Mantén Automático cuando los participantes puedan unirse o salir. Configura el número conocido para una reunión fija cuando la agrupación automática produzca un número incorrecto. Un número fijo incorrecto puede forzar a voces no relacionadas a unirse o dividir una voz para satisfacer el conteo solicitado.
La separación de altavoces es probabilística. La distancia del micrófono, la superposición, los ecos y el ruido de fondo cambiante importan; la corrección manual de altavoces aún puede ser necesaria. Consulta Grabación de Conversación.
Esta sección solo para desarrolladores configura el cliente de escritorio separado que transmite un micrófono desde otra computadora en la misma red local.
-
Habilite el servicio solo mientras se necesiten los micrófonos del cliente. Elija el adaptador de red que sea accesible desde el cliente; las VPN y los adaptadores virtuales a menudo producen una dirección de emparejamiento que la otra computadora no puede alcanzar.
-
Mantenga el puerto predeterminado a menos que entre en conflicto con otro servicio. Si el cliente no puede conectarse, verifique el adaptador seleccionado, el firewall local y si ambos sistemas están en la misma red de confianza antes de cambiar a puertos aleatorios.
-
Trate la URL/token de emparejamiento como un secreto. Cualquier persona que pueda acceder al servicio y tenga un token válido puede intentar conectarse. Regenerar o redistribuir la URL después de cambiar el adaptador, la dirección, el puerto o el token.
-
El estado del cliente conectado muestra qué clientes están disponibles y sus capacidades. El audio se transmite desde el cliente seleccionado como dispositivo de grabación; simplemente conectar un cliente no hace que todos los micrófonos conectados graben al mismo tiempo.
-
No hay un relevo en la nube. Esto mejora la privacidad, pero significa que el enrutamiento, el firewall, el modo de suspensión y la calidad del Wi-Fi afectan directamente la disponibilidad y la latencia.
Consulte Cliente Compañero.
- Reproduce el problema en una aplicación de destino con la mejora de IA y la vista previa en tiempo real desactivadas.
- Para palabras incorrectas, ajuste el nivel/ruido del micrófono, seleccione un idioma fijo y pruebe otro modelo de transcripción antes de cambiar la configuración de inserción de texto.
- Para texto correcto que se inserta incorrectamente, cambie primero el método de inserción, luego el atajo de pegar, y luego aumente solo el retraso relevante.
- Para el habla baja que falta, disminuya ligeramente la sensibilidad de detección de voz; para el ruido interpretado como voz, aumente ligeramente.
- Para carga alta, desactive el modo en tiempo real o aumente su intervalo de salto antes de reducir la calidad final de la transcripción.
- Restaure los valores predeterminados en la sección afectada si varios cambios han hecho que el resultado sea difícil de interpretar.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động