Índice
Adaptation(interfaz)Speech(interfaz)CreateCustomClassRequest(mensaje)CreatePhraseSetRequest(mensaje)CustomClass(mensaje)CustomClass.ClassItem(mensaje)CustomClass.State(enum)DeleteCustomClassRequest(mensaje)DeletePhraseSetRequest(mensaje)GetCustomClassRequest(mensaje)GetPhraseSetRequest(mensaje)ListCustomClassesRequest(mensaje)ListCustomClassesResponse(mensaje)ListPhraseSetRequest(mensaje)ListPhraseSetResponse(mensaje)LongRunningRecognizeMetadata(mensaje)LongRunningRecognizeRequest(mensaje)LongRunningRecognizeResponse(mensaje)PhraseSet(mensaje)PhraseSet.Phrase(mensaje)PhraseSet.State(enum)RecognitionAudio(mensaje)RecognitionConfig(mensaje)RecognitionConfig.AudioEncoding(enum)RecognitionMetadata(mensaje) (obsoleto)RecognitionMetadata.InteractionType(enum)RecognitionMetadata.MicrophoneDistance(enum)RecognitionMetadata.OriginalMediaType(enum)RecognitionMetadata.RecordingDeviceType(enum)RecognizeRequest(mensaje)RecognizeResponse(mensaje)SpeakerDiarizationConfig(mensaje)SpeechAdaptation(mensaje)SpeechAdaptation.ABNFGrammar(mensaje)SpeechAdaptationInfo(mensaje)SpeechContext(mensaje)SpeechRecognitionAlternative(mensaje)SpeechRecognitionResult(mensaje)StreamingRecognitionConfig(mensaje)StreamingRecognitionConfig.VoiceActivityTimeout(mensaje)StreamingRecognitionResult(mensaje)StreamingRecognizeRequest(mensaje)StreamingRecognizeResponse(mensaje)StreamingRecognizeResponse.SpeechEventType(enum)TranscriptNormalization(mensaje)TranscriptNormalization.Entry(mensaje)TranscriptOutputConfig(mensaje)UpdateCustomClassRequest(mensaje)UpdatePhraseSetRequest(mensaje)WordInfo(mensaje)
Adaptación
Servicio que implementa la API Google Cloud Speech Adaptation.
| CreateCustomClass |
|---|
|
Crea una clase personalizada.
|
| CreatePhraseSet |
|---|
|
Crea un conjunto de sugerencias de frases. Cada elemento del conjunto puede ser una sola palabra o una frase de varias palabras. El modelo de reconocimiento favorece los elementos de PhraseSet cuando envías una llamada que incluye el objeto PhraseSet.
|
| DeleteCustomClass |
|---|
|
Eliminar una clase personalizada.
|
| DeletePhraseSet |
|---|
|
Elimina un conjunto de frases.
|
| GetCustomClass |
|---|
|
Obtener una clase personalizada.
|
| GetPhraseSet |
|---|
|
Obtener un conjunto de frases.
|
| ListCustomClasses |
|---|
|
Lista de clases personalizadas.
|
| ListPhraseSet |
|---|
|
Lista de conjuntos de frases.
|
| UpdateCustomClass |
|---|
|
Actualiza una clase personalizada.
|
| UpdatePhraseSet |
|---|
|
Actualizar un conjunto de frases.
|
Voz
Servicio que implementa la API Google Cloud Speech.
| LongRunningRecognize |
|---|
|
Realiza el reconocimiento de voz asíncrono: recibe los resultados a través de la interfaz google.longrunning.Operations. Devuelve un
|
| Reconocer |
|---|
|
Realiza reconocimiento de voz síncrono: recibe los resultados una vez que todo el audio se ha enviado y procesado.
|
| StreamingRecognize |
|---|
|
Realiza reconocimiento de voz bidireccional en streaming: recibe los resultados mientras se envía el audio. Este método solo está disponible a través de la API gRPC (no REST).
|
CreateCustomClassRequest
Mensaje enviado por el cliente para el método CreateCustomClass.
| Campos | |
|---|---|
parent |
Obligatorio. Recurso superior en el que se creará esta clase personalizada. Formato:
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
custom_class_id |
Obligatorio. El ID que se usará para la clase personalizada, que se convertirá en el componente final del nombre de recurso de la clase personalizada. Este valor debe contener letras, números y guiones. El primer carácter debe ser una letra, el último una letra o un número, y debe tener entre 4 y 63 caracteres. |
custom_class |
Obligatorio. Clase personalizada que se va a crear. |
CreatePhraseSetRequest
Mensaje enviado por el cliente para el método CreatePhraseSet.
| Campos | |
|---|---|
parent |
Obligatorio. El recurso superior en el que se creará este conjunto de frases. Formato:
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
phrase_set_id |
Obligatorio. ID que se usará para el conjunto de frases, que se convertirá en el componente final del nombre de recurso del conjunto de frases. Este valor debe contener letras, números y guiones. El primer carácter debe ser una letra, el último una letra o un número, y debe tener entre 4 y 63 caracteres. |
phrase_set |
Obligatorio. El conjunto de frases que se va a crear. |
CustomClass
Conjunto de palabras o frases que representan un concepto común que es probable que aparezca en el audio. Por ejemplo, una lista de nombres de barcos de pasajeros. Los elementos CustomClass se pueden sustituir por marcadores de posición que hayas definido en las frases de PhraseSet.
| Campos | |
|---|---|
name |
Nombre de recurso de la clase personalizada. |
custom_class_id |
Si esta clase personalizada es un recurso, custom_class_id es el ID de recurso de CustomClass. Se distingue entre mayúsculas y minúsculas. |
items[] |
Colección de elementos de clase. |
kms_key_name |
Solo de salida. El nombre de la clave de KMS con la que se cifra el contenido de ClassItem. El formato esperado es |
kms_key_version_name |
Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el contenido de ClassItem. El formato esperado es |
uid |
Solo de salida. Identificador único asignado por el sistema a CustomClass. Este campo no se usa. |
display_name |
Solo de salida. Nombre legible por humanos que se puede definir para CustomClass. Debe tener 63 caracteres como máximo. Este campo no se usa. |
state |
Solo de salida. El estado del ciclo de vida de CustomClass. Este campo no se usa. |
delete_time |
Solo de salida. Hora a la que se solicitó la eliminación de este recurso. Este campo no se usa. |
expire_time |
Solo de salida. La hora a la que se purgará este recurso. Este campo no se usa. |
annotations |
Solo de salida. Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. Este campo no se usa. |
etag |
Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. Este campo no se usa. |
reconciling |
Solo de salida. Indica si se está actualizando esta CustomClass. Este campo no se usa. |
ClassItem
Un elemento de la clase.
| Campos | |
|---|---|
value |
Valor del elemento de clase. |
Estado
Conjunto de estados que definen el ciclo de vida de un CustomClass.
| Enumeraciones | |
|---|---|
STATE_UNSPECIFIED |
Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos. |
ACTIVE |
El estado normal y el estado activo. |
DELETED |
Se ha eliminado este CustomClass. |
DeleteCustomClassRequest
Mensaje enviado por el cliente para el método DeleteCustomClass.
| Campos | |
|---|---|
name |
Obligatorio. Nombre de la clase personalizada que se va a eliminar. Formato:
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
DeletePhraseSetRequest
Mensaje enviado por el cliente para el método DeletePhraseSet.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del conjunto de frases que se va a eliminar. Formato:
Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
GetCustomClassRequest
Mensaje enviado por el cliente para el método GetCustomClass.
| Campos | |
|---|---|
name |
Obligatorio. Nombre de la clase personalizada que se va a obtener. Formato:
Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
GetPhraseSetRequest
Mensaje enviado por el cliente para el método GetPhraseSet.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del conjunto de frases que se va a obtener. Formato:
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
ListCustomClassesRequest
Mensaje enviado por el cliente para el método ListCustomClasses.
| Campos | |
|---|---|
parent |
Obligatorio. El elemento superior, que es el propietario de esta colección de clases personalizadas. Formato:
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
page_size |
Número máximo de clases personalizadas que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 50 clases personalizadas como máximo. El valor máximo es 1000; los valores superiores a este límite se convertirán a 1000. |
page_token |
Token de página recibido de una llamada Al hacer la paginación, todos los demás parámetros proporcionados a |
ListCustomClassesResponse
Mensaje devuelto al cliente por el método ListCustomClasses.
| Campos | |
|---|---|
custom_classes[] |
Las clases personalizadas. |
next_page_token |
Token que se puede enviar como |
ListPhraseSetRequest
Mensaje enviado por el cliente para el método ListPhraseSet.
| Campos | |
|---|---|
parent |
Obligatorio. El elemento superior, propietario de esta colección de conjuntos de frases. Formato:
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
page_size |
Número máximo de conjuntos de frases que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 50 conjuntos de frases como máximo. El valor máximo es 1000; los valores superiores a este límite se convertirán a 1000. |
page_token |
Token de página recibido de una llamada Al hacer la paginación, todos los demás parámetros proporcionados a |
ListPhraseSetResponse
Mensaje devuelto al cliente por el método ListPhraseSet.
| Campos | |
|---|---|
phrase_sets[] |
El conjunto de frases. |
next_page_token |
Token que se puede enviar como |
LongRunningRecognizeMetadata
Describe el progreso de una llamada LongRunningRecognize de larga duración. Se incluye en el campo metadata del Operation devuelto por la llamada GetOperation del servicio google::longrunning::Operations.
| Campos | |
|---|---|
progress_percent |
Porcentaje aproximado del audio procesado hasta el momento. Se garantiza que será 100 cuando el audio se haya procesado por completo y los resultados estén disponibles. |
start_time |
Hora en la que se recibió la solicitud. |
last_update_time |
Hora de la actualización de procesamiento más reciente. |
uri |
Solo de salida. El URI del archivo de audio que se está transcribiendo. Vacío si el audio se ha enviado como contenido de bytes. |
output_config |
Solo de salida. Una copia de TranscriptOutputConfig si se ha definido en la solicitud. |
LongRunningRecognizeRequest
Mensaje de nivel superior enviado por el cliente para el método LongRunningRecognize.
| Campos | |
|---|---|
config |
Obligatorio. Proporciona información al reconocedor que especifica cómo procesar la petición. |
audio |
Obligatorio. Los datos de audio que se van a reconocer. |
output_config |
Opcional. Especifica un destino opcional para los resultados del reconocimiento. |
LongRunningRecognizeResponse
Es el único mensaje que devuelve el método LongRunningRecognize al cliente. Contiene el resultado como cero o más mensajes secuenciales SpeechRecognitionResult. Se incluye en el campo result.response del Operation devuelto por la llamada GetOperation del servicio google::longrunning::Operations.
| Campos | |
|---|---|
results[] |
Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio. |
total_billed_time |
Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente. |
output_config |
Configuración de salida original, si está presente en la solicitud. |
output_error |
Si la salida de la transcripción no supera este campo, contendrá el error correspondiente. |
speech_adaptation_info |
Proporciona información sobre el comportamiento de la adaptación del habla en la respuesta. |
request_id |
ID asociado a la solicitud. Se trata de un ID único específico de la solicitud en cuestión. |
PhraseSet
Proporciona "sugerencias" al reconocedor de voz para favorecer palabras y frases específicas en los resultados.
| Campos | |
|---|---|
name |
Nombre de recurso del conjunto de frases. |
phrases[] |
Una lista de palabras y frases. |
boost |
Pista. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores de impulso negativos se corresponderían con la eliminación de sesgos. El ajuste para evitar sesgos no está habilitado, por lo que el aumento negativo se ignorará. Aunque |
kms_key_name |
Solo de salida. El nombre de la clave de KMS con la que se cifra el contenido de PhraseSet. El formato esperado es |
kms_key_version_name |
Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el contenido de PhraseSet. El formato esperado es |
uid |
Solo de salida. Identificador único asignado por el sistema al objeto PhraseSet. Este campo no se usa. |
display_name |
Solo de salida. Nombre legible por humanos que puede definir el usuario para el PhraseSet. Debe tener 63 caracteres como máximo. Este campo no se usa. |
state |
Solo de salida. El estado del ciclo de vida de CustomClass. Este campo no se usa. |
delete_time |
Solo de salida. Hora a la que se solicitó la eliminación de este recurso. Este campo no se usa. |
expire_time |
Solo de salida. La hora a la que se purgará este recurso. Este campo no se usa. |
annotations |
Solo de salida. Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. Este campo no se usa. |
etag |
Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. Este campo no se usa. |
reconciling |
Solo de salida. Indica si este PhraseSet se está actualizando o no. Este campo no se usa. |
Frase
Frases que contengan palabras y frases "sugerencias" para que el reconocimiento de voz tenga más probabilidades de reconocerlas. Esto se puede utilizar para mejorar la precisión de palabras y frases específicas, por ejemplo, si el usuario suele pronunciar comandos específicos. Esto también se puede usar para agregar palabras adicionales al vocabulario del reconocedor. Consulta los límites de uso.
Los elementos de lista también pueden incluir clases predefinidas o personalizadas que contengan grupos de palabras que representen conceptos comunes que se dan en el lenguaje natural. Por ejemplo, en lugar de proporcionar una sugerencia de frase para cada mes del año (por ejemplo, "i was born in january", "i was born in february", etc.), usar la clase $MONTH precompilada aumenta la probabilidad de transcribir correctamente el audio que incluye meses (por ejemplo, "i was born in $month"). Para hacer referencia a clases precompiladas, usa el símbolo de la clase precedido por $, por ejemplo, $MONTH. Para hacer referencia a las clases personalizadas que se han definido de forma insertada en la solicitud, asigna a custom_class_id de la clase una cadena única para todos los recursos de clase y las clases insertadas. A continuación, usa el ID de la clase entre ${...}, por ejemplo, "${my-months}". Para hacer referencia a recursos de clases personalizadas, usa el ID de la clase entre ${} (por ejemplo, ${my-months}).
Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.
| Campos | |
|---|---|
value |
La frase en sí. |
boost |
Pista. Anula el refuerzo definido a nivel de conjunto de frases. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. El aumento negativo se ignorará. Aunque |
Estado
Conjunto de estados que definen el ciclo de vida de un CustomClass.
| Enumeraciones | |
|---|---|
STATE_UNSPECIFIED |
Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos. |
ACTIVE |
El estado normal y el estado activo. |
DELETED |
Se ha eliminado este CustomClass. |
RecognitionAudio
Contiene datos de audio en la codificación especificada en RecognitionConfig. Se debe proporcionar content o uri. Si se proporcionan ambos o ninguno, se devuelve google.rpc.Code.INVALID_ARGUMENT. Consulta los límites de contenido.
| Campos | |
|---|---|
Campo de unión audio_source. La fuente de audio, que puede ser contenido insertado o un URI de Google Cloud Storage. audio_source solo puede ser una de estas dos opciones: |
|
content |
Los bytes de datos de audio codificados tal como se especifica en |
uri |
URI que apunta a un archivo que contiene bytes de datos de audio, tal como se especifica en |
RecognitionConfig
Proporciona información al reconocedor que especifica cómo procesar la petición.
| Campos | |||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
encoding |
Codificación de los datos de audio enviados en todos los mensajes |
||||||||||||||||||
sample_rate_hertz |
Frecuencia de muestreo en hercios de los datos de audio enviados en todos los mensajes |
||||||||||||||||||
audio_channel_count |
Número de canales de los datos de audio de entrada. SOLO se debe definir para el reconocimiento MULTICANAL. Los valores válidos de LINEAR16, OGG_OPUS y FLAC son de |
||||||||||||||||||
enable_separate_recognition_per_channel |
Este valor debe ser |
||||||||||||||||||
language_code |
Obligatorio. El idioma del audio proporcionado como etiqueta de idioma BCP-47. Por ejemplo: "en-US". Consulta la lista de códigos de idioma admitidos en Idiomas disponibles. |
||||||||||||||||||
alternative_language_codes[] |
Lista de hasta 3 etiquetas de idioma BCP-47 adicionales que indican posibles idiomas alternativos del audio proporcionado. Consulta la lista de códigos de idioma admitidos en Idiomas disponibles. Si se indican idiomas alternativos, el resultado del reconocimiento contendrá el reconocimiento en el idioma detectado más probable, incluido el idioma principal language_code. El resultado del reconocimiento incluirá la etiqueta de idioma del idioma detectado en el audio. Nota: Esta función solo se admite en los casos prácticos de comandos y búsqueda por voz, y el rendimiento puede variar en otros casos prácticos (por ejemplo, la transcripción de llamadas telefónicas). |
||||||||||||||||||
max_alternatives |
Número máximo de hipótesis de reconocimiento que se devolverán. En concreto, el número máximo de mensajes |
||||||||||||||||||
profanity_filter |
Si se define como |
||||||||||||||||||
adaptation |
La configuración de adaptación de voz mejora la precisión del reconocimiento de voz. Para obtener más información, consulta la documentación sobre adaptación del habla. Cuando se define la adaptación del habla, se sustituye el campo |
||||||||||||||||||
transcript_normalization |
Opcional. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales. |
||||||||||||||||||
speech_contexts[] |
Matriz de |
||||||||||||||||||
enable_word_time_offsets |
Si |
||||||||||||||||||
enable_word_confidence |
Si |
||||||||||||||||||
enable_automatic_punctuation |
Si es "true", añade signos de puntuación a las hipótesis de los resultados del reconocimiento. Esta función solo está disponible en algunos idiomas. Si se define este valor para solicitudes en otros idiomas, no tendrá ningún efecto. El valor predeterminado "false" no añade signos de puntuación a las hipótesis de resultados. |
||||||||||||||||||
enable_spoken_punctuation |
Comportamiento de la puntuación hablada de la llamada. Si no se define, se usa el comportamiento predeterminado en función del modelo elegido. Por ejemplo, command_and_search habilitará la puntuación hablada de forma predeterminada. Si se define como "true", se sustituirá la puntuación hablada por los símbolos correspondientes en la solicitud. Por ejemplo, "how are you question mark" (¿cómo estás?) se convierte en "how are you?" (¿cómo estás?). Consulta https://cloud.google.com/speech-to-text/docs/spoken-punctuation para obtener ayuda. Si es "false", no se sustituye la puntuación hablada. |
||||||||||||||||||
enable_spoken_emojis |
Comportamiento de los emojis hablados en la llamada. Si no se define, se usa el comportamiento predeterminado en función del modelo elegido. Si se define como "true", se añade el formato de los emojis hablados a la solicitud. De esta forma, los emojis que digas se sustituirán por los símbolos Unicode correspondientes en la transcripción final. Si es "false", los emojis hablados no se sustituyen. |
||||||||||||||||||
enable_speaker_diarization |
Si es "true", habilita la detección de interlocutor para cada palabra reconocida en la alternativa principal del resultado del reconocimiento mediante una speaker_label proporcionada en WordInfo. Nota: Usa diarization_config en su lugar. |
||||||||||||||||||
diarization_speaker_count |
Si se define, especifica el número estimado de participantes en la conversación. El valor predeterminado es "2". Se ignora a menos que enable_speaker_diarization se defina como true. Nota: Usa diarization_config en su lugar. |
||||||||||||||||||
diarization_config |
Configuración para habilitar la diarización del interlocutor y definir parámetros adicionales para que la diarización se adapte mejor a tu aplicación. Nota: Cuando esta opción está habilitada, enviamos todas las palabras desde el principio del audio de la mejor alternativa en cada respuesta STREAMING consecutiva. Esto se hace para mejorar nuestras etiquetas de interlocutor a medida que nuestros modelos aprenden a identificar a los interlocutores de la conversación con el tiempo. En las solicitudes que no son de streaming, los resultados de la diarización solo se proporcionarán en la alternativa principal de FINAL SpeechRecognitionResult. |
||||||||||||||||||
metadata |
Metadatos sobre esta solicitud. |
||||||||||||||||||
model |
Qué modelo se debe seleccionar para la solicitud dada. Selecciona el modelo que mejor se adapte a tu dominio para obtener los mejores resultados. Si un modelo no está especificado de forma explícita, entonces seleccionamos automáticamente un modelo basado en los parámetros en RecognitionConfig.
|
||||||||||||||||||
use_enhanced |
Introduce el valor "true" para usar un modelo mejorado de reconocimiento de voz. Si Si |
||||||||||||||||||
AudioEncoding
La codificación de los datos de audio enviados en la petición.
Todas las codificaciones solo admiten audio de 1 canal (mono), a menos que se definan los campos audio_channel_count y enable_separate_recognition_per_channel.
Para obtener los mejores resultados, la fuente de audio debe capturarse y transmitirse mediante una codificación sin pérdida (FLAC o LINEAR16). La precisión del reconocimiento de voz puede reducirse si se utilizan códecs con pérdida para capturar o transmitir audio, sobre todo si hay ruido de fondo. Los códecs con pérdida incluyen MULAW, AMR, AMR_WB, OGG_OPUS, SPEEX_WITH_HEADER_BYTE, MP3 y WEBM_OPUS.
Los formatos FLAC y WAV de archivos de audio incluyen un encabezado que describe el contenido de audio incluido. Puedes solicitar el reconocimiento de archivos WAV que contengan audio codificado en LINEAR16 o MULAW. Si envía el formato de archivo de audio FLAC o WAV en su solicitud, no es necesario que especifique un AudioEncoding. El formato de codificación de audio se determina a partir del encabezado del archivo. Si especificas un AudioEncoding al enviar audio FLAC o WAV, la configuración de codificación debe coincidir con la codificación descrita en el encabezado de audio. De lo contrario, la solicitud devolverá un código de error google.rpc.Code.INVALID_ARGUMENT.
| Enumeraciones | |
|---|---|
ENCODING_UNSPECIFIED |
Sin especificar. |
LINEAR16 |
Muestras de little endian firmadas de 16 bits sin comprimir (Linear PCM). |
FLAC |
FLAC (códec de audio sin pérdida) es la codificación recomendada porque no tiene pérdidas, por lo que el reconocimiento no se ve comprometido, y solo requiere aproximadamente la mitad del ancho de banda de LINEAR16. La codificación de flujo FLAC admite muestras de 16 y 24 bits, pero no todos los campos de STREAMINFO. |
MULAW |
Muestras de 8 bits que comparan muestras de audio de 14 bits utilizando G.711 PCMU/mu-law. |
AMR |
Códec de banda estrecha de tasa múltiple adaptativa. sample_rate_hertz debe ser 8000. |
AMR_WB |
Códec de banda ancha de tasa múltiple adaptativa. sample_rate_hertz debe ser 16000. |
OGG_OPUS |
Marcos de audio codificados en Opus en un contenedor Ogg (OggOpus). sample_rate_hertz debe ser uno de los siguientes valores: 8000, 12000, 16000, 24000 o 48000. |
SPEEX_WITH_HEADER_BYTE |
Aunque no se recomienda el uso de codificaciones con pérdida, si se requiere una codificación de tasa de bits muy baja, se da mucha más prioridad a OGG_OPUS sobre la codificación Speex. La codificación Speex compatible con la API Cloud Speech tiene un byte de encabezado en cada bloque, como en el tipo MIME audio/x-speex-with-header-byte. Es una variante de la codificación RTP Speex definida en RFC 5574. El flujo es una secuencia de bloques, un bloque por paquete RTP. Cada bloque comienza con un byte que contiene la longitud del bloque, en bytes, seguido de uno o más cuadros de datos de Speex, asignados a un número integral de bytes (octetos) como se especifica en RFC 5574. En otras palabras, cada encabezado RTP se reemplaza con un solo byte que contiene la longitud del bloque. Solo se admite Speex de banda ancha. sample_rate_hertz debe ser 16000. |
MP3 |
Audio MP3. La codificación MP3 es una función beta y solo está disponible en la versión 1.1 beta 1. Admite todas las tasas de bits MP3 estándar (que van de 32 a 320 kbps). Cuando se usa esta codificación, sample_rate_hertz debe coincidir con la frecuencia de muestreo del archivo que se esté usando. |
WEBM_OPUS |
Marcos de audio codificados en Opus en un contenedor WebM (WebM). sample_rate_hertz debe ser uno de los siguientes valores: 8000, 12000, 16000, 24000 o 48000. |
ALAW |
Muestras de 8 bits que companden muestras de audio de 13 bits mediante G.711 PCMU/a-law. |
RecognitionMetadata
Descripción de los datos de audio que se van a reconocer.
| Campos | |
|---|---|
interaction_type |
El caso práctico que mejor describa el contenido de audio que se va a reconocer. |
industry_naics_code_of_audio |
El vertical de sector al que se aplica más esta solicitud de reconocimiento de voz. Esto es lo que mejor indica los temas que contiene el audio. Usa el código NAICS de 6 dígitos para identificar el sector vertical. Consulta https://www.naics.com/search/. |
microphone_distance |
El tipo de audio que más se ajusta al audio que se está reconociendo. |
original_media_type |
El medio original en el que se grabó el discurso. |
recording_device_type |
El tipo de dispositivo con el que se grabó el discurso. |
recording_device_name |
El dispositivo que se ha usado para hacer la grabación. Por ejemplo, "Nexus 5X", "Polycom SoundStation IP 6000", "POTS", "VoIP" o "Micrófono cardioide". |
original_mime_type |
Tipo MIME del archivo de audio original. Por ejemplo, |
obfuscated_id |
ID ofuscado (protegido por la privacidad) del usuario para identificar el número de usuarios únicos que utilizan el servicio. |
audio_topic |
Descripción del contenido. Por ejemplo, "Grabaciones de las audiencias del Tribunal Supremo Federal del 2012". |
InteractionType
Categorías de casos prácticos que pueden describir la solicitud de reconocimiento de audio.
| Enumeraciones | |
|---|---|
INTERACTION_TYPE_UNSPECIFIED |
El caso práctico es desconocido o no es ninguno de los otros valores que se indican a continuación. |
DISCUSSION |
Varias personas en una conversación o debate. Por ejemplo, en una reunión con dos o más personas que participan activamente. Normalmente, todas las personas que hablan principalmente están en la misma sala (si no es así, consulta PHONE_CALL). |
PRESENTATION |
Una o varias personas dan una charla o una presentación a otras, casi siempre sin interrupciones. |
PHONE_CALL |
Llamada telefónica o videoconferencia en la que participan activamente dos o más personas que no están en la misma sala. |
VOICEMAIL |
Un mensaje grabado para que lo escuche otra persona. |
PROFESSIONALLY_PRODUCED |
Audio producido por profesionales (por ejemplo, Serie de televisión o pódcast. |
VOICE_SEARCH |
Transcribir en texto las preguntas y consultas habladas. |
VOICE_COMMAND |
Transcribir comandos de voz, como los que se usan para controlar un dispositivo. |
DICTATION |
Transcribir la voz a texto para crear un documento escrito, como un mensaje de texto, un correo o un informe. |
MicrophoneDistance
Enumera los tipos de ajustes de captura que describen un archivo de audio.
| Enumeraciones | |
|---|---|
MICROPHONE_DISTANCE_UNSPECIFIED |
No se conoce el tipo de audio. |
NEARFIELD |
El audio se ha captado con un micrófono colocado cerca. Por ejemplo, un teléfono, un dictáfono o un micrófono de mano. Por lo general, si el altavoz está a menos de 1 metro del micrófono. |
MIDFIELD |
El altavoz está a menos de 3 metros del micrófono. |
FARFIELD |
El altavoz está a más de 3 metros del micrófono. |
OriginalMediaType
El medio original en el que se grabó el discurso.
| Enumeraciones | |
|---|---|
ORIGINAL_MEDIA_TYPE_UNSPECIFIED |
Tipo de contenido multimedia original desconocido. |
AUDIO |
Los datos de voz son una grabación de audio. |
VIDEO |
Los datos de voz grabados originalmente en un vídeo. |
RecordingDeviceType
El tipo de dispositivo con el que se grabó el discurso.
| Enumeraciones | |
|---|---|
RECORDING_DEVICE_TYPE_UNSPECIFIED |
Se desconoce el dispositivo de grabación. |
SMARTPHONE |
El discurso se grabó en un smartphone. |
PC |
El discurso se grabó con un ordenador personal o una tablet. |
PHONE_LINE |
El discurso se grabó a través de una línea telefónica. |
VEHICLE |
Se ha grabado una conversación en un vehículo. |
OTHER_OUTDOOR_DEVICE |
La conversación se grabó en exteriores. |
OTHER_INDOOR_DEVICE |
La voz se grabó en interiores. |
RecognizeRequest
Mensaje de nivel superior enviado por el cliente para el método Recognize.
| Campos | |
|---|---|
config |
Obligatorio. Proporciona información al reconocedor que especifica cómo procesar la petición. |
audio |
Obligatorio. Los datos de audio que se van a reconocer. |
RecognizeResponse
Es el único mensaje que devuelve el método Recognize al cliente. Contiene el resultado como cero o más mensajes secuenciales SpeechRecognitionResult.
| Campos | |
|---|---|
results[] |
Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio. |
total_billed_time |
Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente. |
speech_adaptation_info |
Proporciona información sobre el comportamiento de adaptación en respuesta |
request_id |
ID asociado a la solicitud. Se trata de un ID único específico de la solicitud en cuestión. |
using_legacy_models |
Indica si la solicitud ha usado modelos de ASR antiguos (no se ha migrado automáticamente para usar modelos conformer). |
SpeakerDiarizationConfig
Configuración para habilitar la diarización del interlocutor.
| Campos | |
|---|---|
enable_speaker_diarization |
Si es "true", habilita la detección de interlocutor para cada palabra reconocida en la alternativa principal del resultado del reconocimiento mediante una speaker_label proporcionada en WordInfo. |
min_speaker_count |
Número mínimo de participantes en la conversación. Este intervalo te ofrece más flexibilidad, ya que permite que el sistema determine automáticamente el número correcto de altavoces. Si no se define, el valor predeterminado es 2. |
max_speaker_count |
Número máximo de participantes en la conversación. Este intervalo te ofrece más flexibilidad, ya que permite que el sistema determine automáticamente el número correcto de altavoces. Si no se define, el valor predeterminado es 6. |
speaker_tag |
Solo de salida. Sin usar. |
SpeechAdaptation
Configuración de la adaptación de voz.
| Campos | |
|---|---|
phrase_sets[] |
Una colección de conjuntos de frases. Para especificar las sugerencias insertadas, deja en |
phrase_set_references[] |
Colección de nombres de recursos de conjuntos de frases que se van a usar. |
custom_classes[] |
Una colección de clases personalizadas. Para especificar las clases insertadas, deja el campo |
abnf_grammar |
La notación aumentada de Backus-Naur (ABNF) es una notación de gramática estandarizada que consta de un conjunto de reglas de derivación. Consulta las especificaciones en https://www.w3.org/TR/speech-grammar. |
ABNFGrammar
| Campos | |
|---|---|
abnf_strings[] |
Todas las declaraciones y reglas de una gramática ABNF divididas en varias cadenas que se concatenarán. |
SpeechAdaptationInfo
Información sobre el uso de la adaptación de voz en los resultados
| Campos | |
|---|---|
adaptation_timeout |
Si se ha agotado el tiempo de espera al aplicar la adaptación de voz. Si es true, la adaptación no ha tenido ningún efecto en la transcripción de la respuesta. |
timeout_message |
Si se define, devuelve un mensaje que especifica qué parte de la solicitud de adaptación de voz ha agotado el tiempo de espera. |
SpeechContext
Proporciona "sugerencias" al reconocedor de voz para favorecer palabras y frases específicas en los resultados.
| Campos | |
|---|---|
phrases[] |
Lista de cadenas que contienen "sugerencias" de palabras y frases para que el reconocimiento de voz tenga más probabilidades de reconocerlas. Esto se puede utilizar para mejorar la precisión de palabras y frases específicas, por ejemplo, si el usuario suele pronunciar comandos específicos. Esto también se puede usar para agregar palabras adicionales al vocabulario del reconocedor. Consulta los límites de uso. También se pueden asignar clases a los elementos de la lista para grupos de palabras que representen conceptos comunes que aparecen en el lenguaje natural. Por ejemplo, en lugar de proporcionar sugerencias de frases para cada mes del año, usar la clase $MONTH aumenta la probabilidad de transcribir correctamente el audio que incluye meses. |
boost |
Pista. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores de impulso negativos se corresponderían con la eliminación de sesgos. El ajuste para evitar sesgos no está habilitado, por lo que el aumento negativo se ignorará. Aunque |
SpeechRecognitionAlternative
Hipótesis alternativas (también conocidas como lista de mejor N).
| Campos | |
|---|---|
transcript |
Texto de transcripción que representa las palabras que el usuario habló. En los idiomas que usan espacios para separar las palabras, es posible que la transcripción tenga un espacio inicial si no es el primer resultado. Puedes concatenar cada resultado para obtener la transcripción completa sin usar un separador. |
confidence |
La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define en la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que |
words[] |
Una lista de información específica de la palabra para cada palabra reconocida. Nota: Cuando |
SpeechRecognitionResult
Un resultado de reconocimiento de voz correspondiente a una parte del audio.
| Campos | |
|---|---|
alternatives[] |
Puede contener una o varias hipótesis de reconocimiento (hasta el máximo especificado en |
channel_tag |
Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. Si audio_channel_count = N, sus valores de salida pueden oscilar entre "1" y "N". |
result_end_time |
Desfase de tiempo del final de este resultado con respecto al inicio del audio. |
language_code |
Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio. |
StreamingRecognitionConfig
Proporciona información al reconocedor que especifica cómo procesar la petición.
| Campos | |
|---|---|
config |
Obligatorio. Proporciona información al reconocedor que especifica cómo procesar la petición. |
single_utterance |
Si se incluye Si El campo
|
interim_results |
Si |
enable_voice_activity_events |
Si |
voice_activity_timeout |
Si se define, el servidor cerrará automáticamente el flujo una vez transcurrido el tiempo especificado después de que se haya enviado el último evento de voz VOICE_ACTIVITY. El campo |
VoiceActivityTimeout
Eventos en los que se puede definir un tiempo de espera para la actividad de voz.
| Campos | |
|---|---|
speech_start_timeout |
Duración del tiempo de espera de la emisión si no se empieza a hablar. |
speech_end_timeout |
Duración del tiempo de espera de la emisión después de que termine la voz. |
StreamingRecognitionResult
Resultado de reconocimiento de voz en streaming correspondiente a una parte del audio que se está procesando.
| Campos | |
|---|---|
alternatives[] |
Puede contener una o varias hipótesis de reconocimiento (hasta el máximo especificado en |
is_final |
Si |
stability |
Una estimación de la probabilidad de que el reconocedor no cambie su suposición sobre este resultado provisional. Los valores van de 0,0 (completamente inestable) a 1,0 (completamente estable). Este campo solo se proporciona para los resultados provisionales ( |
result_end_time |
Desfase de tiempo del final de este resultado con respecto al inicio del audio. |
channel_tag |
Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. Si audio_channel_count = N, sus valores de salida pueden oscilar entre "1" y "N". |
language_code |
Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio. |
StreamingRecognizeRequest
Mensaje de nivel superior enviado por el cliente para el método StreamingRecognize. Se envían varios mensajes de StreamingRecognizeRequest. El primer mensaje debe contener un mensaje streaming_config y no debe contener audio_content. Todos los mensajes posteriores deben contener audio_content y no deben contener un mensaje streaming_config.
| Campos | |
|---|---|
Campo de unión streaming_request. La solicitud de streaming, que es una configuración de streaming o contenido de audio. streaming_request solo puede ser una de estas dos opciones: |
|
streaming_config |
Proporciona información al reconocedor que especifica cómo procesar la petición. El primer mensaje de |
audio_content |
Los datos de audio que se van a reconocer. Los fragmentos secuenciales de datos de audio se envían en mensajes |
StreamingRecognizeResponse
StreamingRecognizeResponse es el único mensaje que devuelve StreamingRecognize al cliente. Se envía al cliente una serie de cero o más mensajes StreamingRecognizeResponse. Si no hay audio reconocible y single_utterance tiene el valor "false", no se enviará ningún mensaje al cliente.
A continuación, se muestra un ejemplo de una serie de StreamingRecognizeResponses que se pueden devolver al procesar audio:
results { alternatives { transcript: "tube" } stability: 0.01 }
results { alternatives { transcript: "to be a" } stability: 0.01 }
results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }
results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }
results { alternatives { transcript: " that's" } stability: 0.01 }
results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }
results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }
Notas:
Solo dos de las respuestas anteriores (la 4 y la 7) contienen resultados finales, que se indican con
is_final: true. Al concatenarlos, se genera la transcripción completa: "ser o no ser, esa es la cuestión".Los demás contienen
resultsprovisionales. Los elementos #3 y #6 contienen dosresultsprovisionales: la primera parte tiene una alta estabilidad y es menos probable que cambie; la segunda parte tiene una baja estabilidad y es muy probable que cambie. Un diseñador de interfaces de usuario puede optar por mostrar soloresultsde alta estabilidad.Los valores específicos de
stabilityyconfidenceque se muestran arriba son solo ejemplos. Los valores reales pueden variar.En cada respuesta, solo se definirá uno de estos campos:
error,speech_event_typeo uno o varios camposresults(repetidos).
| Campos | |
|---|---|
error |
Si se define, devuelve un mensaje |
results[] |
Esta lista repetida contiene cero o más resultados que corresponden a partes consecutivas del audio que se está procesando. Contiene cero o un resultado |
speech_event_type |
Indica el tipo de evento de voz. |
speech_event_time |
Desfase de tiempo entre el inicio del audio y la emisión del evento. |
total_billed_time |
Segundos de audio facturados de la emisión, si están disponibles. Solo se define si es la última respuesta de la cadena. |
speech_adaptation_info |
Proporciona información sobre el comportamiento de adaptación en respuesta |
request_id |
ID asociado a la solicitud. Se trata de un ID único específico de la solicitud en cuestión. |
SpeechEventType
Indica el tipo de evento de voz.
| Enumeraciones | |
|---|---|
SPEECH_EVENT_UNSPECIFIED |
No se ha especificado ningún evento de voz. |
END_OF_SINGLE_UTTERANCE |
Este evento indica que el servidor ha detectado el final de la expresión oral del usuario y no espera que diga nada más. Por lo tanto, el servidor no procesará más audio (aunque puede que devuelva resultados adicionales posteriormente). El cliente debe dejar de enviar datos de audio adicionales, cerrar la conexión gRPC y esperar a que el servidor cierre la conexión gRPC para recibir resultados adicionales. Este evento solo se envía si single_utterance se ha definido como true. De lo contrario, no se usa. |
SPEECH_ACTIVITY_BEGIN |
Este evento indica que el servidor ha detectado el inicio de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events. |
SPEECH_ACTIVITY_END |
Este evento indica que el servidor ha detectado el final de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events. |
SPEECH_ACTIVITY_TIMEOUT |
Este evento indica que se ha superado el tiempo de espera definido por el usuario para el inicio o el final de la actividad de voz. Al recibir este evento, el cliente debe enviar un cierre parcial. No se procesará más audio. |
TranscriptNormalization
Configuración de normalización de transcripciones. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales.
| Campos | |
|---|---|
entries[] |
Una lista de entradas de sustitución. Realizaremos la sustitución de una entrada cada vez. Por ejemplo, la segunda entrada de ["cat" => "dog", "mountain cat" => "mountain dog"] nunca se aplicará porque siempre procesaremos la primera entrada antes. 100 entradas como máximo. |
Entrada
Una sola configuración de sustitución.
| Campos | |
|---|---|
search |
Qué se va a sustituir. La longitud máxima es de 100 caracteres. |
replace |
Qué se va a sustituir. La longitud máxima es de 100 caracteres. |
case_sensitive |
Indica si la búsqueda distingue entre mayúsculas y minúsculas. |
TranscriptOutputConfig
Especifica un destino opcional para los resultados del reconocimiento.
| Campos | |
|---|---|
Campo de unión
|
|
gcs_uri |
Especifica un URI de Cloud Storage para los resultados del reconocimiento. Debe especificarse en el formato |
UpdateCustomClassRequest
Mensaje enviado por el cliente para el método UpdateCustomClass.
| Campos | |
|---|---|
custom_class |
Obligatorio. La clase personalizada que se va a actualizar. El campo
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
update_mask |
Lista de campos que se van a actualizar. |
UpdatePhraseSetRequest
Mensaje enviado por el cliente para el método UpdatePhraseSet.
| Campos | |
|---|---|
phrase_set |
Obligatorio. La frase que se va a actualizar. El campo
Speech-to-Text admite tres ubicaciones: Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado
|
update_mask |
Lista de campos que se van a actualizar. |
WordInfo
Información específica de la palabra para palabras reconocidas.
| Campos | |
|---|---|
start_time |
Compensación horaria referente al comienzo del audio y correspondiente al inicio de la palabra hablada. Este campo solo se define si |
end_time |
Compensación horaria referente al comienzo del audio y correspondiente al final de la palabra hablada. Este campo solo se define si |
word |
La palabra correspondiente a este conjunto de información. |
confidence |
La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define en la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que |
speaker_tag |
Solo de salida. Se asigna un valor entero distinto a cada interlocutor del audio. Este campo especifica cuál de esos interlocutores se ha detectado que ha pronunciado esta palabra. El valor va de "1" a diarization_speaker_count. speaker_tag se define si enable_speaker_diarization = "true" y solo para la alternativa principal. Nota: Usa speaker_label en su lugar. |
speaker_label |
Solo de salida. Valor de etiqueta asignado a cada interlocutor único del audio. Este campo especifica qué altavoz se ha detectado que ha pronunciado esta palabra. En algunos modelos, como medical_conversation, puede ser el rol real del interlocutor (por ejemplo, "paciente" o "proveedor"), pero, por lo general, se trata de un número que identifica a un interlocutor. Este campo solo se define si enable_speaker_diarization = "true" y solo en la alternativa principal. |