Package google.cloud.speech.v1p1beta1

Índice

Adaptación

Servicio que implementa la API Google Cloud Speech Adaptation.

CreateCustomClass

rpc CreateCustomClass(CreateCustomClassRequest) returns (CustomClass)

Crea una clase personalizada.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

CreatePhraseSet

rpc CreatePhraseSet(CreatePhraseSetRequest) returns (PhraseSet)

Crea un conjunto de sugerencias de frases. Cada elemento del conjunto puede ser una sola palabra o una frase de varias palabras. El modelo de reconocimiento favorece los elementos de PhraseSet cuando envías una llamada que incluye el objeto PhraseSet.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

DeleteCustomClass

rpc DeleteCustomClass(DeleteCustomClassRequest) returns (Empty)

Eliminar una clase personalizada.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

DeletePhraseSet

rpc DeletePhraseSet(DeletePhraseSetRequest) returns (Empty)

Elimina un conjunto de frases.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

GetCustomClass

rpc GetCustomClass(GetCustomClassRequest) returns (CustomClass)

Obtener una clase personalizada.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

GetPhraseSet

rpc GetPhraseSet(GetPhraseSetRequest) returns (PhraseSet)

Obtener un conjunto de frases.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

ListCustomClasses

rpc ListCustomClasses(ListCustomClassesRequest) returns (ListCustomClassesResponse)

Lista de clases personalizadas.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

ListPhraseSet

rpc ListPhraseSet(ListPhraseSetRequest) returns (ListPhraseSetResponse)

Lista de conjuntos de frases.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

UpdateCustomClass

rpc UpdateCustomClass(UpdateCustomClassRequest) returns (CustomClass)

Actualiza una clase personalizada.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

UpdatePhraseSet

rpc UpdatePhraseSet(UpdatePhraseSetRequest) returns (PhraseSet)

Actualizar un conjunto de frases.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Voz

Servicio que implementa la API Google Cloud Speech.

LongRunningRecognize

rpc LongRunningRecognize(LongRunningRecognizeRequest) returns (Operation)

Realiza el reconocimiento de voz asíncrono: recibe los resultados a través de la interfaz google.longrunning.Operations. Devuelve un Operation.error o un Operation.response que contiene un mensaje LongRunningRecognizeResponse. Para obtener más información sobre el reconocimiento de voz asíncrono, consulta el procedimiento.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Reconocer

rpc Recognize(RecognizeRequest) returns (RecognizeResponse)

Realiza reconocimiento de voz síncrono: recibe los resultados una vez que todo el audio se ha enviado y procesado.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

StreamingRecognize

rpc StreamingRecognize(StreamingRecognizeRequest) returns (StreamingRecognizeResponse)

Realiza reconocimiento de voz bidireccional en streaming: recibe los resultados mientras se envía el audio. Este método solo está disponible a través de la API gRPC (no REST).

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

CreateCustomClassRequest

Mensaje enviado por el cliente para el método CreateCustomClass.

Campos
parent

string

Obligatorio. Recurso superior en el que se creará esta clase personalizada. Formato:

projects/{project}/locations/{location}/customClasses

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado parent:

  • speech.customClasses.create
custom_class_id

string

Obligatorio. El ID que se usará para la clase personalizada, que se convertirá en el componente final del nombre de recurso de la clase personalizada.

Este valor debe contener letras, números y guiones. El primer carácter debe ser una letra, el último una letra o un número, y debe tener entre 4 y 63 caracteres.

custom_class

CustomClass

Obligatorio. Clase personalizada que se va a crear.

CreatePhraseSetRequest

Mensaje enviado por el cliente para el método CreatePhraseSet.

Campos
parent

string

Obligatorio. El recurso superior en el que se creará este conjunto de frases. Formato:

projects/{project}/locations/{location}

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado parent:

  • speech.phraseSets.create
phrase_set_id

string

Obligatorio. ID que se usará para el conjunto de frases, que se convertirá en el componente final del nombre de recurso del conjunto de frases.

Este valor debe contener letras, números y guiones. El primer carácter debe ser una letra, el último una letra o un número, y debe tener entre 4 y 63 caracteres.

phrase_set

PhraseSet

Obligatorio. El conjunto de frases que se va a crear.

CustomClass

Conjunto de palabras o frases que representan un concepto común que es probable que aparezca en el audio. Por ejemplo, una lista de nombres de barcos de pasajeros. Los elementos CustomClass se pueden sustituir por marcadores de posición que hayas definido en las frases de PhraseSet.

Campos
name

string

Nombre de recurso de la clase personalizada.

custom_class_id

string

Si esta clase personalizada es un recurso, custom_class_id es el ID de recurso de CustomClass. Se distingue entre mayúsculas y minúsculas.

items[]

ClassItem

Colección de elementos de clase.

kms_key_name

string

Solo de salida. El nombre de la clave de KMS con la que se cifra el contenido de ClassItem. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el contenido de ClassItem. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

uid

string

Solo de salida. Identificador único asignado por el sistema a CustomClass. Este campo no se usa.

display_name

string

Solo de salida. Nombre legible por humanos que se puede definir para CustomClass. Debe tener 63 caracteres como máximo. Este campo no se usa.

state

State

Solo de salida. El estado del ciclo de vida de CustomClass. Este campo no se usa.

delete_time

Timestamp

Solo de salida. Hora a la que se solicitó la eliminación de este recurso. Este campo no se usa.

expire_time

Timestamp

Solo de salida. La hora a la que se purgará este recurso. Este campo no se usa.

annotations

map<string, string>

Solo de salida. Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. Este campo no se usa.

etag

string

Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. Este campo no se usa.

reconciling

bool

Solo de salida. Indica si se está actualizando esta CustomClass. Este campo no se usa.

ClassItem

Un elemento de la clase.

Campos
value

string

Valor del elemento de clase.

Estado

Conjunto de estados que definen el ciclo de vida de un CustomClass.

Enumeraciones
STATE_UNSPECIFIED Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos.
ACTIVE El estado normal y el estado activo.
DELETED Se ha eliminado este CustomClass.

DeleteCustomClassRequest

Mensaje enviado por el cliente para el método DeleteCustomClass.

Campos
name

string

Obligatorio. Nombre de la clase personalizada que se va a eliminar. Formato:

projects/{project}/locations/{location}/customClasses/{custom_class}

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado name:

  • speech.customClasses.delete

DeletePhraseSetRequest

Mensaje enviado por el cliente para el método DeletePhraseSet.

Campos
name

string

Obligatorio. Nombre del conjunto de frases que se va a eliminar. Formato:

projects/{project}/locations/{location}/phraseSets/{phrase_set}

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado name:

  • speech.phraseSets.delete

GetCustomClassRequest

Mensaje enviado por el cliente para el método GetCustomClass.

Campos
name

string

Obligatorio. Nombre de la clase personalizada que se va a obtener. Formato:

projects/{project}/locations/{location}/customClasses/{custom_class}

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado name:

  • speech.customClasses.get

GetPhraseSetRequest

Mensaje enviado por el cliente para el método GetPhraseSet.

Campos
name

string

Obligatorio. Nombre del conjunto de frases que se va a obtener. Formato:

projects/{project}/locations/{location}/phraseSets/{phrase_set}

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado name:

  • speech.phraseSets.get

ListCustomClassesRequest

Mensaje enviado por el cliente para el método ListCustomClasses.

Campos
parent

string

Obligatorio. El elemento superior, que es el propietario de esta colección de clases personalizadas. Formato:

projects/{project}/locations/{location}/customClasses

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado parent:

  • speech.customClasses.list
page_size

int32

Número máximo de clases personalizadas que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 50 clases personalizadas como máximo. El valor máximo es 1000; los valores superiores a este límite se convertirán a 1000.

page_token

string

Token de página recibido de una llamada ListCustomClass anterior. Proporciona este elemento para obtener la siguiente página.

Al hacer la paginación, todos los demás parámetros proporcionados a ListCustomClass deben ser los mismos que aparecen en la llamada que proporcionó el token de la página.

ListCustomClassesResponse

Mensaje devuelto al cliente por el método ListCustomClasses.

Campos
custom_classes[]

CustomClass

Las clases personalizadas.

next_page_token

string

Token que se puede enviar como page_token para obtener la siguiente página. Si se omite este campo, no hay páginas posteriores.

ListPhraseSetRequest

Mensaje enviado por el cliente para el método ListPhraseSet.

Campos
parent

string

Obligatorio. El elemento superior, propietario de esta colección de conjuntos de frases. Formato:

projects/{project}/locations/{location}

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado parent:

  • speech.phraseSets.list
page_size

int32

Número máximo de conjuntos de frases que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 50 conjuntos de frases como máximo. El valor máximo es 1000; los valores superiores a este límite se convertirán a 1000.

page_token

string

Token de página recibido de una llamada ListPhraseSet anterior. Proporciona este elemento para obtener la siguiente página.

Al hacer la paginación, todos los demás parámetros proporcionados a ListPhraseSet deben ser los mismos que aparecen en la llamada que proporcionó el token de la página.

ListPhraseSetResponse

Mensaje devuelto al cliente por el método ListPhraseSet.

Campos
phrase_sets[]

PhraseSet

El conjunto de frases.

next_page_token

string

Token que se puede enviar como page_token para obtener la siguiente página. Si se omite este campo, no hay páginas posteriores.

LongRunningRecognizeMetadata

Describe el progreso de una llamada LongRunningRecognize de larga duración. Se incluye en el campo metadata del Operation devuelto por la llamada GetOperation del servicio google::longrunning::Operations.

Campos
progress_percent

int32

Porcentaje aproximado del audio procesado hasta el momento. Se garantiza que será 100 cuando el audio se haya procesado por completo y los resultados estén disponibles.

start_time

Timestamp

Hora en la que se recibió la solicitud.

last_update_time

Timestamp

Hora de la actualización de procesamiento más reciente.

uri

string

Solo de salida. El URI del archivo de audio que se está transcribiendo. Vacío si el audio se ha enviado como contenido de bytes.

output_config

TranscriptOutputConfig

Solo de salida. Una copia de TranscriptOutputConfig si se ha definido en la solicitud.

LongRunningRecognizeRequest

Mensaje de nivel superior enviado por el cliente para el método LongRunningRecognize.

Campos
config

RecognitionConfig

Obligatorio. Proporciona información al reconocedor que especifica cómo procesar la petición.

audio

RecognitionAudio

Obligatorio. Los datos de audio que se van a reconocer.

output_config

TranscriptOutputConfig

Opcional. Especifica un destino opcional para los resultados del reconocimiento.

LongRunningRecognizeResponse

Es el único mensaje que devuelve el método LongRunningRecognize al cliente. Contiene el resultado como cero o más mensajes secuenciales SpeechRecognitionResult. Se incluye en el campo result.response del Operation devuelto por la llamada GetOperation del servicio google::longrunning::Operations.

Campos
results[]

SpeechRecognitionResult

Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio.

total_billed_time

Duration

Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente.

output_config

TranscriptOutputConfig

Configuración de salida original, si está presente en la solicitud.

output_error

Status

Si la salida de la transcripción no supera este campo, contendrá el error correspondiente.

speech_adaptation_info

SpeechAdaptationInfo

Proporciona información sobre el comportamiento de la adaptación del habla en la respuesta.

request_id

int64

ID asociado a la solicitud. Se trata de un ID único específico de la solicitud en cuestión.

PhraseSet

Proporciona "sugerencias" al reconocedor de voz para favorecer palabras y frases específicas en los resultados.

Campos
name

string

Nombre de recurso del conjunto de frases.

phrases[]

Phrase

Una lista de palabras y frases.

boost

float

Pista. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores de impulso negativos se corresponderían con la eliminación de sesgos. El ajuste para evitar sesgos no está habilitado, por lo que el aumento negativo se ignorará. Aunque boost puede aceptar una amplia gama de valores positivos, la mayoría de los casos prácticos se adaptan mejor a valores comprendidos entre 0 (excluido) y 20. Te recomendamos que uses una búsqueda binaria para encontrar el valor óptimo de tu caso práctico, así como que añadas frases con y sin refuerzo a tus solicitudes.

kms_key_name

string

Solo de salida. El nombre de la clave de KMS con la que se cifra el contenido de PhraseSet. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el contenido de PhraseSet. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

uid

string

Solo de salida. Identificador único asignado por el sistema al objeto PhraseSet. Este campo no se usa.

display_name

string

Solo de salida. Nombre legible por humanos que puede definir el usuario para el PhraseSet. Debe tener 63 caracteres como máximo. Este campo no se usa.

state

State

Solo de salida. El estado del ciclo de vida de CustomClass. Este campo no se usa.

delete_time

Timestamp

Solo de salida. Hora a la que se solicitó la eliminación de este recurso. Este campo no se usa.

expire_time

Timestamp

Solo de salida. La hora a la que se purgará este recurso. Este campo no se usa.

annotations

map<string, string>

Solo de salida. Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. Este campo no se usa.

etag

string

Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. Este campo no se usa.

reconciling

bool

Solo de salida. Indica si este PhraseSet se está actualizando o no. Este campo no se usa.

Frase

Frases que contengan palabras y frases "sugerencias" para que el reconocimiento de voz tenga más probabilidades de reconocerlas. Esto se puede utilizar para mejorar la precisión de palabras y frases específicas, por ejemplo, si el usuario suele pronunciar comandos específicos. Esto también se puede usar para agregar palabras adicionales al vocabulario del reconocedor. Consulta los límites de uso.

Los elementos de lista también pueden incluir clases predefinidas o personalizadas que contengan grupos de palabras que representen conceptos comunes que se dan en el lenguaje natural. Por ejemplo, en lugar de proporcionar una sugerencia de frase para cada mes del año (por ejemplo, "i was born in january", "i was born in february", etc.), usar la clase $MONTH precompilada aumenta la probabilidad de transcribir correctamente el audio que incluye meses (por ejemplo, "i was born in $month"). Para hacer referencia a clases precompiladas, usa el símbolo de la clase precedido por $, por ejemplo, $MONTH. Para hacer referencia a las clases personalizadas que se han definido de forma insertada en la solicitud, asigna a custom_class_id de la clase una cadena única para todos los recursos de clase y las clases insertadas. A continuación, usa el ID de la clase entre ${...}, por ejemplo, "${my-months}". Para hacer referencia a recursos de clases personalizadas, usa el ID de la clase entre ${} (por ejemplo, ${my-months}).

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Campos
value

string

La frase en sí.

boost

float

Pista. Anula el refuerzo definido a nivel de conjunto de frases. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. El aumento negativo se ignorará. Aunque boost puede aceptar una amplia gama de valores positivos, la mayoría de los casos prácticos se adaptan mejor a valores entre 0 y 20. Te recomendamos que uses una búsqueda binaria para encontrar el valor óptimo de tu caso práctico, así como que añadas frases con y sin refuerzo a tus solicitudes.

Estado

Conjunto de estados que definen el ciclo de vida de un CustomClass.

Enumeraciones
STATE_UNSPECIFIED Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos.
ACTIVE El estado normal y el estado activo.
DELETED Se ha eliminado este CustomClass.

RecognitionAudio

Contiene datos de audio en la codificación especificada en RecognitionConfig. Se debe proporcionar content o uri. Si se proporcionan ambos o ninguno, se devuelve google.rpc.Code.INVALID_ARGUMENT. Consulta los límites de contenido.

Campos
Campo de unión audio_source. La fuente de audio, que puede ser contenido insertado o un URI de Google Cloud Storage. audio_source solo puede ser una de estas dos opciones:
content

bytes

Los bytes de datos de audio codificados tal como se especifica en RecognitionConfig. Nota: Al igual que con todos los campos de bytes, los búferes de protocolo usan una representación binaria pura, mientras que las representaciones JSON usan base64.

uri

string

URI que apunta a un archivo que contiene bytes de datos de audio, tal como se especifica en RecognitionConfig. El archivo no debe estar comprimido (por ejemplo, con gzip). Actualmente, solo se admiten URIs de Google Cloud Storage, que deben especificarse en el siguiente formato: gs://bucket_name/object_name (otros formatos de URI devuelven google.rpc.Code.INVALID_ARGUMENT). Para obtener más información, consulta URIs de solicitudes.

RecognitionConfig

Proporciona información al reconocedor que especifica cómo procesar la petición.

Campos
encoding

AudioEncoding

Codificación de los datos de audio enviados en todos los mensajes RecognitionAudio. Este campo es opcional para los archivos de audio FLAC y WAV, y obligatorio para el resto de los formatos de audio. Para obtener información detallada, consulta AudioEncoding.

sample_rate_hertz

int32

Frecuencia de muestreo en hercios de los datos de audio enviados en todos los mensajes RecognitionAudio. Los valores válidos son: 8000-48000. 16.000 es el valor óptimo. Para obtener los mejores resultados, configura la frecuencia de muestreo de la fuente de audio en 16.000 Hz. Si no es posible, usa la frecuencia de muestreo nativa de la fuente de audio (en lugar de volver a muestrear). Este campo es opcional para los archivos de audio FLAC y WAV, pero es obligatorio para todos los demás formatos de audio. Para obtener información detallada, consulta AudioEncoding.

audio_channel_count

int32

Número de canales de los datos de audio de entrada. SOLO se debe definir para el reconocimiento MULTICANAL. Los valores válidos de LINEAR16, OGG_OPUS y FLAC son de 1 a 8. Los valores válidos de MULAW, AMR, AMR_WB y SPEEX_WITH_HEADER_BYTE son 1. Si se incluye 0 o se omite, se usa un canal (mono) de forma predeterminada. Nota: De forma predeterminada, solo reconocemos el primer canal. Para realizar un reconocimiento independiente en cada canal, asigna el valor "true" a enable_separate_recognition_per_channel.

enable_separate_recognition_per_channel

bool

Este valor debe ser true explícitamente y audio_channel_count > 1 para que cada canal se reconozca por separado. El resultado del reconocimiento contendrá un campo channel_tag para indicar a qué canal pertenece. Si no es así, solo reconoceremos el primer canal. La solicitud se factura de forma acumulativa por todos los canales reconocidos: audio_channel_count multiplicado por la duración del audio.

language_code

string

Obligatorio. El idioma del audio proporcionado como etiqueta de idioma BCP-47. Por ejemplo: "en-US". Consulta la lista de códigos de idioma admitidos en Idiomas disponibles.

alternative_language_codes[]

string

Lista de hasta 3 etiquetas de idioma BCP-47 adicionales que indican posibles idiomas alternativos del audio proporcionado. Consulta la lista de códigos de idioma admitidos en Idiomas disponibles. Si se indican idiomas alternativos, el resultado del reconocimiento contendrá el reconocimiento en el idioma detectado más probable, incluido el idioma principal language_code. El resultado del reconocimiento incluirá la etiqueta de idioma del idioma detectado en el audio. Nota: Esta función solo se admite en los casos prácticos de comandos y búsqueda por voz, y el rendimiento puede variar en otros casos prácticos (por ejemplo, la transcripción de llamadas telefónicas).

max_alternatives

int32

Número máximo de hipótesis de reconocimiento que se devolverán. En concreto, el número máximo de mensajes SpeechRecognitionAlternative en cada SpeechRecognitionResult. Es posible que el servidor devuelva menos de max_alternatives. Los valores válidos son 0-30. Si se indica el valor 0 o 1, se devolverá un máximo de uno. Si se omite, devolverá un máximo de uno.

profanity_filter

bool

Si se define como true, el servidor intentará filtrar las palabras malsonantes y sustituirá todos los caracteres de cada palabra filtrada por asteriscos, excepto el inicial (por ejemplo, "f***"). Si se asigna el valor false o se omite, no se filtrarán las palabras malsonantes.

adaptation

SpeechAdaptation

La configuración de adaptación de voz mejora la precisión del reconocimiento de voz. Para obtener más información, consulta la documentación sobre adaptación del habla. Cuando se define la adaptación del habla, se sustituye el campo speech_contexts.

transcript_normalization

TranscriptNormalization

Opcional. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales.

speech_contexts[]

SpeechContext

Matriz de SpeechContext. Un medio para proporcionar contexto y ayudar al reconocimiento de voz. Para obtener más información, consulta Adaptación de voz.

enable_word_time_offsets

bool

Si true, el primer resultado incluye una lista de palabras y los desplazamientos de hora de inicio y finalización (marcas de tiempo) de esas palabras. Si false, no se devuelve información sobre el desfase de tiempo a nivel de palabra. El valor predeterminado es false.

enable_word_confidence

bool

Si true, el primer resultado incluye una lista de palabras y la confianza de esas palabras. Si es false, no se devuelve información sobre la confianza a nivel de palabra. El valor predeterminado es false.

enable_automatic_punctuation

bool

Si es "true", añade signos de puntuación a las hipótesis de los resultados del reconocimiento. Esta función solo está disponible en algunos idiomas. Si se define este valor para solicitudes en otros idiomas, no tendrá ningún efecto. El valor predeterminado "false" no añade signos de puntuación a las hipótesis de resultados.

enable_spoken_punctuation

BoolValue

Comportamiento de la puntuación hablada de la llamada. Si no se define, se usa el comportamiento predeterminado en función del modelo elegido. Por ejemplo, command_and_search habilitará la puntuación hablada de forma predeterminada. Si se define como "true", se sustituirá la puntuación hablada por los símbolos correspondientes en la solicitud. Por ejemplo, "how are you question mark" (¿cómo estás?) se convierte en "how are you?" (¿cómo estás?). Consulta https://cloud.google.com/speech-to-text/docs/spoken-punctuation para obtener ayuda. Si es "false", no se sustituye la puntuación hablada.

enable_spoken_emojis

BoolValue

Comportamiento de los emojis hablados en la llamada. Si no se define, se usa el comportamiento predeterminado en función del modelo elegido. Si se define como "true", se añade el formato de los emojis hablados a la solicitud. De esta forma, los emojis que digas se sustituirán por los símbolos Unicode correspondientes en la transcripción final. Si es "false", los emojis hablados no se sustituyen.

enable_speaker_diarization
(deprecated)

bool

Si es "true", habilita la detección de interlocutor para cada palabra reconocida en la alternativa principal del resultado del reconocimiento mediante una speaker_label proporcionada en WordInfo. Nota: Usa diarization_config en su lugar.

diarization_speaker_count
(deprecated)

int32

Si se define, especifica el número estimado de participantes en la conversación. El valor predeterminado es "2". Se ignora a menos que enable_speaker_diarization se defina como true. Nota: Usa diarization_config en su lugar.

diarization_config

SpeakerDiarizationConfig

Configuración para habilitar la diarización del interlocutor y definir parámetros adicionales para que la diarización se adapte mejor a tu aplicación. Nota: Cuando esta opción está habilitada, enviamos todas las palabras desde el principio del audio de la mejor alternativa en cada respuesta STREAMING consecutiva. Esto se hace para mejorar nuestras etiquetas de interlocutor a medida que nuestros modelos aprenden a identificar a los interlocutores de la conversación con el tiempo. En las solicitudes que no son de streaming, los resultados de la diarización solo se proporcionarán en la alternativa principal de FINAL SpeechRecognitionResult.

metadata

RecognitionMetadata

Metadatos sobre esta solicitud.

model

string

Qué modelo se debe seleccionar para la solicitud dada. Selecciona el modelo que mejor se adapte a tu dominio para obtener los mejores resultados. Si un modelo no está especificado de forma explícita, entonces seleccionamos automáticamente un modelo basado en los parámetros en RecognitionConfig.

Modelo Descripción

latest_long

Es ideal para contenido largo, como contenido multimedia o conversaciones.

latest_short

Ideal para contenido breve, como comandos o discursos dirigidos de una sola toma.

command_and_search

Adecuado para consultas cortas como comandos de voz o búsquedas por voz.

phone_call

Adecuado para audio originado a partir de una llamada telefónica (generalmente grabada a una frecuencia de muestreo de 8 kHz).

video

Adecuado para el audio generado a partir de vídeos o en los que intervienen varios interlocutores. Lo ideal es que el audio se grabe a una velocidad de muestreo de 16 kHz o mayor. Este es un modelo premium que cuesta más que la tarifa estándar.

default

Adecuado para audio que no es uno de los modelos de audio específicos. Por ejemplo, audio de formato largo. Lo ideal es que el audio sea de alta fidelidad, grabado a una velocidad de muestreo de 16 kHz o superior.

medical_conversation

Adecuado para el audio generado a partir de una conversación entre un profesional sanitario y un paciente.

medical_dictation

Adecuado para el audio generado a partir de notas de dictado de un profesional sanitario.

use_enhanced

bool

Introduce el valor "true" para usar un modelo mejorado de reconocimiento de voz. Si use_enhanced tiene el valor true y no se ha definido el campo model, se elegirá un modelo mejorado adecuado si existe para el audio.

Si use_enhanced es true y no existe una versión mejorada del modelo especificado, la voz se reconoce con la versión estándar del modelo especificado.

AudioEncoding

La codificación de los datos de audio enviados en la petición.

Todas las codificaciones solo admiten audio de 1 canal (mono), a menos que se definan los campos audio_channel_count y enable_separate_recognition_per_channel.

Para obtener los mejores resultados, la fuente de audio debe capturarse y transmitirse mediante una codificación sin pérdida (FLAC o LINEAR16). La precisión del reconocimiento de voz puede reducirse si se utilizan códecs con pérdida para capturar o transmitir audio, sobre todo si hay ruido de fondo. Los códecs con pérdida incluyen MULAW, AMR, AMR_WB, OGG_OPUS, SPEEX_WITH_HEADER_BYTE, MP3 y WEBM_OPUS.

Los formatos FLAC y WAV de archivos de audio incluyen un encabezado que describe el contenido de audio incluido. Puedes solicitar el reconocimiento de archivos WAV que contengan audio codificado en LINEAR16 o MULAW. Si envía el formato de archivo de audio FLAC o WAV en su solicitud, no es necesario que especifique un AudioEncoding. El formato de codificación de audio se determina a partir del encabezado del archivo. Si especificas un AudioEncoding al enviar audio FLAC o WAV, la configuración de codificación debe coincidir con la codificación descrita en el encabezado de audio. De lo contrario, la solicitud devolverá un código de error google.rpc.Code.INVALID_ARGUMENT.

Enumeraciones
ENCODING_UNSPECIFIED Sin especificar.
LINEAR16 Muestras de little endian firmadas de 16 bits sin comprimir (Linear PCM).
FLAC FLAC (códec de audio sin pérdida) es la codificación recomendada porque no tiene pérdidas, por lo que el reconocimiento no se ve comprometido, y solo requiere aproximadamente la mitad del ancho de banda de LINEAR16. La codificación de flujo FLAC admite muestras de 16 y 24 bits, pero no todos los campos de STREAMINFO.
MULAW Muestras de 8 bits que comparan muestras de audio de 14 bits utilizando G.711 PCMU/mu-law.
AMR Códec de banda estrecha de tasa múltiple adaptativa. sample_rate_hertz debe ser 8000.
AMR_WB Códec de banda ancha de tasa múltiple adaptativa. sample_rate_hertz debe ser 16000.
OGG_OPUS Marcos de audio codificados en Opus en un contenedor Ogg (OggOpus). sample_rate_hertz debe ser uno de los siguientes valores: 8000, 12000, 16000, 24000 o 48000.
SPEEX_WITH_HEADER_BYTE Aunque no se recomienda el uso de codificaciones con pérdida, si se requiere una codificación de tasa de bits muy baja, se da mucha más prioridad a OGG_OPUS sobre la codificación Speex. La codificación Speex compatible con la API Cloud Speech tiene un byte de encabezado en cada bloque, como en el tipo MIME audio/x-speex-with-header-byte. Es una variante de la codificación RTP Speex definida en RFC 5574. El flujo es una secuencia de bloques, un bloque por paquete RTP. Cada bloque comienza con un byte que contiene la longitud del bloque, en bytes, seguido de uno o más cuadros de datos de Speex, asignados a un número integral de bytes (octetos) como se especifica en RFC 5574. En otras palabras, cada encabezado RTP se reemplaza con un solo byte que contiene la longitud del bloque. Solo se admite Speex de banda ancha. sample_rate_hertz debe ser 16000.
MP3 Audio MP3. La codificación MP3 es una función beta y solo está disponible en la versión 1.1 beta 1. Admite todas las tasas de bits MP3 estándar (que van de 32 a 320 kbps). Cuando se usa esta codificación, sample_rate_hertz debe coincidir con la frecuencia de muestreo del archivo que se esté usando.
WEBM_OPUS Marcos de audio codificados en Opus en un contenedor WebM (WebM). sample_rate_hertz debe ser uno de los siguientes valores: 8000, 12000, 16000, 24000 o 48000.
ALAW Muestras de 8 bits que companden muestras de audio de 13 bits mediante G.711 PCMU/a-law.

RecognitionMetadata

Descripción de los datos de audio que se van a reconocer.

Campos
interaction_type

InteractionType

El caso práctico que mejor describa el contenido de audio que se va a reconocer.

industry_naics_code_of_audio

uint32

El vertical de sector al que se aplica más esta solicitud de reconocimiento de voz. Esto es lo que mejor indica los temas que contiene el audio. Usa el código NAICS de 6 dígitos para identificar el sector vertical. Consulta https://www.naics.com/search/.

microphone_distance

MicrophoneDistance

El tipo de audio que más se ajusta al audio que se está reconociendo.

original_media_type

OriginalMediaType

El medio original en el que se grabó el discurso.

recording_device_type

RecordingDeviceType

El tipo de dispositivo con el que se grabó el discurso.

recording_device_name

string

El dispositivo que se ha usado para hacer la grabación. Por ejemplo, "Nexus 5X", "Polycom SoundStation IP 6000", "POTS", "VoIP" o "Micrófono cardioide".

original_mime_type

string

Tipo MIME del archivo de audio original. Por ejemplo, audio/m4a, audio/x-alaw-basic, audio/mp3 y audio/3gpp. Se mantiene una lista de posibles tipos MIME de audio en http://www.iana.org/assignments/media-types/media-types.xhtml#audio.

obfuscated_id
(deprecated)

int64

ID ofuscado (protegido por la privacidad) del usuario para identificar el número de usuarios únicos que utilizan el servicio.

audio_topic

string

Descripción del contenido. Por ejemplo, "Grabaciones de las audiencias del Tribunal Supremo Federal del 2012".

InteractionType

Categorías de casos prácticos que pueden describir la solicitud de reconocimiento de audio.

Enumeraciones
INTERACTION_TYPE_UNSPECIFIED El caso práctico es desconocido o no es ninguno de los otros valores que se indican a continuación.
DISCUSSION Varias personas en una conversación o debate. Por ejemplo, en una reunión con dos o más personas que participan activamente. Normalmente, todas las personas que hablan principalmente están en la misma sala (si no es así, consulta PHONE_CALL).
PRESENTATION Una o varias personas dan una charla o una presentación a otras, casi siempre sin interrupciones.
PHONE_CALL Llamada telefónica o videoconferencia en la que participan activamente dos o más personas que no están en la misma sala.
VOICEMAIL Un mensaje grabado para que lo escuche otra persona.
PROFESSIONALLY_PRODUCED Audio producido por profesionales (por ejemplo, Serie de televisión o pódcast.
VOICE_COMMAND Transcribir comandos de voz, como los que se usan para controlar un dispositivo.
DICTATION Transcribir la voz a texto para crear un documento escrito, como un mensaje de texto, un correo o un informe.

MicrophoneDistance

Enumera los tipos de ajustes de captura que describen un archivo de audio.

Enumeraciones
MICROPHONE_DISTANCE_UNSPECIFIED No se conoce el tipo de audio.
NEARFIELD El audio se ha captado con un micrófono colocado cerca. Por ejemplo, un teléfono, un dictáfono o un micrófono de mano. Por lo general, si el altavoz está a menos de 1 metro del micrófono.
MIDFIELD El altavoz está a menos de 3 metros del micrófono.
FARFIELD El altavoz está a más de 3 metros del micrófono.

OriginalMediaType

El medio original en el que se grabó el discurso.

Enumeraciones
ORIGINAL_MEDIA_TYPE_UNSPECIFIED Tipo de contenido multimedia original desconocido.
AUDIO Los datos de voz son una grabación de audio.
VIDEO Los datos de voz grabados originalmente en un vídeo.

RecordingDeviceType

El tipo de dispositivo con el que se grabó el discurso.

Enumeraciones
RECORDING_DEVICE_TYPE_UNSPECIFIED Se desconoce el dispositivo de grabación.
SMARTPHONE El discurso se grabó en un smartphone.
PC El discurso se grabó con un ordenador personal o una tablet.
PHONE_LINE El discurso se grabó a través de una línea telefónica.
VEHICLE Se ha grabado una conversación en un vehículo.
OTHER_OUTDOOR_DEVICE La conversación se grabó en exteriores.
OTHER_INDOOR_DEVICE La voz se grabó en interiores.

RecognizeRequest

Mensaje de nivel superior enviado por el cliente para el método Recognize.

Campos
config

RecognitionConfig

Obligatorio. Proporciona información al reconocedor que especifica cómo procesar la petición.

audio

RecognitionAudio

Obligatorio. Los datos de audio que se van a reconocer.

RecognizeResponse

Es el único mensaje que devuelve el método Recognize al cliente. Contiene el resultado como cero o más mensajes secuenciales SpeechRecognitionResult.

Campos
results[]

SpeechRecognitionResult

Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio.

total_billed_time

Duration

Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente.

speech_adaptation_info

SpeechAdaptationInfo

Proporciona información sobre el comportamiento de adaptación en respuesta

request_id

int64

ID asociado a la solicitud. Se trata de un ID único específico de la solicitud en cuestión.

using_legacy_models

bool

Indica si la solicitud ha usado modelos de ASR antiguos (no se ha migrado automáticamente para usar modelos conformer).

SpeakerDiarizationConfig

Configuración para habilitar la diarización del interlocutor.

Campos
enable_speaker_diarization

bool

Si es "true", habilita la detección de interlocutor para cada palabra reconocida en la alternativa principal del resultado del reconocimiento mediante una speaker_label proporcionada en WordInfo.

min_speaker_count

int32

Número mínimo de participantes en la conversación. Este intervalo te ofrece más flexibilidad, ya que permite que el sistema determine automáticamente el número correcto de altavoces. Si no se define, el valor predeterminado es 2.

max_speaker_count

int32

Número máximo de participantes en la conversación. Este intervalo te ofrece más flexibilidad, ya que permite que el sistema determine automáticamente el número correcto de altavoces. Si no se define, el valor predeterminado es 6.

speaker_tag
(deprecated)

int32

Solo de salida. Sin usar.

SpeechAdaptation

Configuración de la adaptación de voz.

Campos
phrase_sets[]

PhraseSet

Una colección de conjuntos de frases. Para especificar las sugerencias insertadas, deja en name la frase definida y rellena el resto de los campos. Cualquier conjunto de frases puede usar cualquier clase personalizada.

phrase_set_references[]

string

Colección de nombres de recursos de conjuntos de frases que se van a usar.

custom_classes[]

CustomClass

Una colección de clases personalizadas. Para especificar las clases insertadas, deja el campo name de la clase en blanco y rellena el resto de los campos. Asigna un custom_class_id único a la clase. Haz referencia a la clase definida insertada en las sugerencias de frases por su custom_class_id.

abnf_grammar

ABNFGrammar

La notación aumentada de Backus-Naur (ABNF) es una notación de gramática estandarizada que consta de un conjunto de reglas de derivación. Consulta las especificaciones en https://www.w3.org/TR/speech-grammar.

ABNFGrammar

Campos
abnf_strings[]

string

Todas las declaraciones y reglas de una gramática ABNF divididas en varias cadenas que se concatenarán.

SpeechAdaptationInfo

Información sobre el uso de la adaptación de voz en los resultados

Campos
adaptation_timeout

bool

Si se ha agotado el tiempo de espera al aplicar la adaptación de voz. Si es true, la adaptación no ha tenido ningún efecto en la transcripción de la respuesta.

timeout_message

string

Si se define, devuelve un mensaje que especifica qué parte de la solicitud de adaptación de voz ha agotado el tiempo de espera.

SpeechContext

Proporciona "sugerencias" al reconocedor de voz para favorecer palabras y frases específicas en los resultados.

Campos
phrases[]

string

Lista de cadenas que contienen "sugerencias" de palabras y frases para que el reconocimiento de voz tenga más probabilidades de reconocerlas. Esto se puede utilizar para mejorar la precisión de palabras y frases específicas, por ejemplo, si el usuario suele pronunciar comandos específicos. Esto también se puede usar para agregar palabras adicionales al vocabulario del reconocedor. Consulta los límites de uso.

También se pueden asignar clases a los elementos de la lista para grupos de palabras que representen conceptos comunes que aparecen en el lenguaje natural. Por ejemplo, en lugar de proporcionar sugerencias de frases para cada mes del año, usar la clase $MONTH aumenta la probabilidad de transcribir correctamente el audio que incluye meses.

boost

float

Pista. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores de impulso negativos se corresponderían con la eliminación de sesgos. El ajuste para evitar sesgos no está habilitado, por lo que el aumento negativo se ignorará. Aunque boost puede aceptar una amplia gama de valores positivos, la mayoría de los casos prácticos se adaptan mejor a valores entre 0 y 20. Te recomendamos que uses una búsqueda binaria para encontrar el valor óptimo para tu caso práctico.

SpeechRecognitionAlternative

Hipótesis alternativas (también conocidas como lista de mejor N).

Campos
transcript

string

Texto de transcripción que representa las palabras que el usuario habló. En los idiomas que usan espacios para separar las palabras, es posible que la transcripción tenga un espacio inicial si no es el primer resultado. Puedes concatenar cada resultado para obtener la transcripción completa sin usar un separador.

confidence

float

La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define en la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que is_final=true. No se garantiza que este campo sea preciso y los usuarios no deben confiar en que siempre se proporcione. El valor predeterminado 0.0 es un valor de centinela que indica que confidence no se ha definido.

words[]

WordInfo

Una lista de información específica de la palabra para cada palabra reconocida. Nota: Cuando enable_speaker_diarization sea true, verás todas las palabras desde el principio del audio.

SpeechRecognitionResult

Un resultado de reconocimiento de voz correspondiente a una parte del audio.

Campos
alternatives[]

SpeechRecognitionAlternative

Puede contener una o varias hipótesis de reconocimiento (hasta el máximo especificado en max_alternatives). Estas alternativas se ordenan en función de la precisión. La alternativa superior (primera) es la más probable, según la clasificación del reconocedor.

channel_tag

int32

Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. Si audio_channel_count = N, sus valores de salida pueden oscilar entre "1" y "N".

result_end_time

Duration

Desfase de tiempo del final de este resultado con respecto al inicio del audio.

language_code

string

Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio.

StreamingRecognitionConfig

Proporciona información al reconocedor que especifica cómo procesar la petición.

Campos
config

RecognitionConfig

Obligatorio. Proporciona información al reconocedor que especifica cómo procesar la petición.

single_utterance

bool

Si se incluye false o se omite, el reconocedor realizará un reconocimiento continuo (seguirá esperando y procesando el audio aunque el usuario deje de hablar) hasta que el cliente cierre el flujo de entrada (API gRPC) o hasta que se alcance el límite de tiempo máximo. Puede devolver varios StreamingRecognitionResults con la marca is_final definida como true.

Si true, el reconocedor detectará una sola frase hablada. Cuando detecte que el usuario ha pausado o dejado de hablar, devolverá un evento END_OF_SINGLE_UTTERANCE y dejará de reconocer la voz. Devolverá como máximo un StreamingRecognitionResult con la marca is_final definida como true.

El campo single_utterance solo se puede usar con modelos especificados. De lo contrario, se producirá un error. El campo model de RecognitionConfig debe tener el siguiente valor:

  • command_and_search
  • phone_call Y campo adicional useEnhanced=true
  • El campo model no está definido. En este caso, la API selecciona automáticamente un modelo en función de los demás parámetros que definas en RecognitionConfig.
interim_results

bool

Si true, se pueden devolver resultados provisionales (hipótesis provisionales) a medida que estén disponibles (estos resultados provisionales se indican con la marca is_final=false). Si se incluye false o se omite, solo se devuelven los resultados de is_final=true.

enable_voice_activity_events

bool

Si true, las respuestas con eventos de voz de actividad de voz se devolverán a medida que se detecten.

voice_activity_timeout

VoiceActivityTimeout

Si se define, el servidor cerrará automáticamente el flujo una vez transcurrido el tiempo especificado después de que se haya enviado el último evento de voz VOICE_ACTIVITY. El campo voice_activity_events también debe tener el valor true.

VoiceActivityTimeout

Eventos en los que se puede definir un tiempo de espera para la actividad de voz.

Campos
speech_start_timeout

Duration

Duración del tiempo de espera de la emisión si no se empieza a hablar.

speech_end_timeout

Duration

Duración del tiempo de espera de la emisión después de que termine la voz.

StreamingRecognitionResult

Resultado de reconocimiento de voz en streaming correspondiente a una parte del audio que se está procesando.

Campos
alternatives[]

SpeechRecognitionAlternative

Puede contener una o varias hipótesis de reconocimiento (hasta el máximo especificado en max_alternatives). Estas alternativas se ordenan en función de la precisión. La alternativa superior (primera) es la más probable, según la clasificación del reconocedor.

is_final

bool

Si false, este StreamingRecognitionResult representa un resultado provisional que puede cambiar. Si true, esta es la última vez que el servicio de voz devolverá este StreamingRecognitionResult concreto. El reconocedor no devolverá más hipótesis para esta parte de la transcripción y el audio correspondiente.

stability

float

Una estimación de la probabilidad de que el reconocedor no cambie su suposición sobre este resultado provisional. Los valores van de 0,0 (completamente inestable) a 1,0 (completamente estable). Este campo solo se proporciona para los resultados provisionales (is_final=false). El valor predeterminado 0.0 es un valor de centinela que indica que stability no se ha definido.

result_end_time

Duration

Desfase de tiempo del final de este resultado con respecto al inicio del audio.

channel_tag

int32

Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. Si audio_channel_count = N, sus valores de salida pueden oscilar entre "1" y "N".

language_code

string

Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio.

StreamingRecognizeRequest

Mensaje de nivel superior enviado por el cliente para el método StreamingRecognize. Se envían varios mensajes de StreamingRecognizeRequest. El primer mensaje debe contener un mensaje streaming_config y no debe contener audio_content. Todos los mensajes posteriores deben contener audio_content y no deben contener un mensaje streaming_config.

Campos
Campo de unión streaming_request. La solicitud de streaming, que es una configuración de streaming o contenido de audio. streaming_request solo puede ser una de estas dos opciones:
streaming_config

StreamingRecognitionConfig

Proporciona información al reconocedor que especifica cómo procesar la petición. El primer mensaje de StreamingRecognizeRequest debe contener un mensaje de streaming_config.

audio_content

bytes

Los datos de audio que se van a reconocer. Los fragmentos secuenciales de datos de audio se envían en mensajes StreamingRecognizeRequest secuenciales. El primer mensaje StreamingRecognizeRequest no debe contener datos audio_content, y todos los mensajes StreamingRecognizeRequest posteriores deben contener datos audio_content. Los bytes de audio deben codificarse tal como se especifica en RecognitionConfig. Nota: Al igual que con todos los campos de bytes, los búferes de protocolo usan una representación binaria pura (no base64). Consulta los límites de contenido.

StreamingRecognizeResponse

StreamingRecognizeResponse es el único mensaje que devuelve StreamingRecognize al cliente. Se envía al cliente una serie de cero o más mensajes StreamingRecognizeResponse. Si no hay audio reconocible y single_utterance tiene el valor "false", no se enviará ningún mensaje al cliente.

A continuación, se muestra un ejemplo de una serie de StreamingRecognizeResponses que se pueden devolver al procesar audio:

  1. results { alternatives { transcript: "tube" } stability: 0.01 }

  2. results { alternatives { transcript: "to be a" } stability: 0.01 }

  3. results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }

  4. results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }

  5. results { alternatives { transcript: " that's" } stability: 0.01 }

  6. results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }

  7. results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }

Notas:

  • Solo dos de las respuestas anteriores (la 4 y la 7) contienen resultados finales, que se indican con is_final: true. Al concatenarlos, se genera la transcripción completa: "ser o no ser, esa es la cuestión".

  • Los demás contienen results provisionales. Los elementos #3 y #6 contienen dos results provisionales: la primera parte tiene una alta estabilidad y es menos probable que cambie; la segunda parte tiene una baja estabilidad y es muy probable que cambie. Un diseñador de interfaces de usuario puede optar por mostrar solo results de alta estabilidad.

  • Los valores específicos de stability y confidence que se muestran arriba son solo ejemplos. Los valores reales pueden variar.

  • En cada respuesta, solo se definirá uno de estos campos: error, speech_event_type o uno o varios campos results (repetidos).

Campos
error

Status

Si se define, devuelve un mensaje google.rpc.Status que especifica el error de la operación.

results[]

StreamingRecognitionResult

Esta lista repetida contiene cero o más resultados que corresponden a partes consecutivas del audio que se está procesando. Contiene cero o un resultado is_final=true (la parte recién liquidada), seguido de cero o más resultados is_final=false (los resultados provisionales).

speech_event_type

SpeechEventType

Indica el tipo de evento de voz.

speech_event_time

Duration

Desfase de tiempo entre el inicio del audio y la emisión del evento.

total_billed_time

Duration

Segundos de audio facturados de la emisión, si están disponibles. Solo se define si es la última respuesta de la cadena.

speech_adaptation_info

SpeechAdaptationInfo

Proporciona información sobre el comportamiento de adaptación en respuesta

request_id

int64

ID asociado a la solicitud. Se trata de un ID único específico de la solicitud en cuestión.

SpeechEventType

Indica el tipo de evento de voz.

Enumeraciones
SPEECH_EVENT_UNSPECIFIED No se ha especificado ningún evento de voz.
END_OF_SINGLE_UTTERANCE Este evento indica que el servidor ha detectado el final de la expresión oral del usuario y no espera que diga nada más. Por lo tanto, el servidor no procesará más audio (aunque puede que devuelva resultados adicionales posteriormente). El cliente debe dejar de enviar datos de audio adicionales, cerrar la conexión gRPC y esperar a que el servidor cierre la conexión gRPC para recibir resultados adicionales. Este evento solo se envía si single_utterance se ha definido como true. De lo contrario, no se usa.
SPEECH_ACTIVITY_BEGIN Este evento indica que el servidor ha detectado el inicio de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events.
SPEECH_ACTIVITY_END Este evento indica que el servidor ha detectado el final de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events.
SPEECH_ACTIVITY_TIMEOUT Este evento indica que se ha superado el tiempo de espera definido por el usuario para el inicio o el final de la actividad de voz. Al recibir este evento, el cliente debe enviar un cierre parcial. No se procesará más audio.

TranscriptNormalization

Configuración de normalización de transcripciones. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales.

Campos
entries[]

Entry

Una lista de entradas de sustitución. Realizaremos la sustitución de una entrada cada vez. Por ejemplo, la segunda entrada de ["cat" => "dog", "mountain cat" => "mountain dog"] nunca se aplicará porque siempre procesaremos la primera entrada antes. 100 entradas como máximo.

Entrada

Una sola configuración de sustitución.

Campos
search

string

Qué se va a sustituir. La longitud máxima es de 100 caracteres.

replace

string

Qué se va a sustituir. La longitud máxima es de 100 caracteres.

case_sensitive

bool

Indica si la búsqueda distingue entre mayúsculas y minúsculas.

TranscriptOutputConfig

Especifica un destino opcional para los resultados del reconocimiento.

Campos

Campo de unión output_type.

output_type solo puede ser una de estas dos opciones:

gcs_uri

string

Especifica un URI de Cloud Storage para los resultados del reconocimiento. Debe especificarse en el formato gs://bucket_name/object_name y el contenedor ya debe existir.

UpdateCustomClassRequest

Mensaje enviado por el cliente para el método UpdateCustomClass.

Campos
custom_class

CustomClass

Obligatorio. La clase personalizada que se va a actualizar.

El campo name de la clase personalizada se usa para identificar la clase personalizada que se va a actualizar. Formato:

projects/{project}/locations/{location}/customClasses/{custom_class}

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado customClass:

  • speech.customClasses.update
update_mask

FieldMask

Lista de campos que se van a actualizar.

UpdatePhraseSetRequest

Mensaje enviado por el cliente para el método UpdatePhraseSet.

Campos
phrase_set

PhraseSet

Obligatorio. La frase que se va a actualizar.

El campo name del conjunto de frases se usa para identificar el conjunto que se va a actualizar. Formato:

projects/{project}/locations/{location}/phraseSets/{phrase_set}

Speech-to-Text admite tres ubicaciones: global, us (Norteamérica) y eu (Europa). Si llamas al endpoint speech.googleapis.com, usa la ubicación global. Para especificar una región, usa un endpoint regional con el valor de ubicación us o eu correspondiente.

Para la autorización, se necesita el siguiente permiso de gestión de identidades y accesos en el recurso especificado phraseSet:

  • speech.phraseSets.update
update_mask

FieldMask

Lista de campos que se van a actualizar.

WordInfo

Información específica de la palabra para palabras reconocidas.

Campos
start_time

Duration

Compensación horaria referente al comienzo del audio y correspondiente al inicio de la palabra hablada. Este campo solo se define si enable_word_time_offsets=true y solo en la hipótesis principal. Esta es una característica experimental y la precisión de la compensación horaria puede variar.

end_time

Duration

Compensación horaria referente al comienzo del audio y correspondiente al final de la palabra hablada. Este campo solo se define si enable_word_time_offsets=true y solo en la hipótesis principal. Esta es una característica experimental y la precisión de la compensación horaria puede variar.

word

string

La palabra correspondiente a este conjunto de información.

confidence

float

La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define en la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que is_final=true. No se garantiza que este campo sea preciso y los usuarios no deben confiar en que siempre se proporcione. El valor predeterminado 0.0 es un valor de centinela que indica que confidence no se ha definido.

speaker_tag
(deprecated)

int32

Solo de salida. Se asigna un valor entero distinto a cada interlocutor del audio. Este campo especifica cuál de esos interlocutores se ha detectado que ha pronunciado esta palabra. El valor va de "1" a diarization_speaker_count. speaker_tag se define si enable_speaker_diarization = "true" y solo para la alternativa principal. Nota: Usa speaker_label en su lugar.

speaker_label

string

Solo de salida. Valor de etiqueta asignado a cada interlocutor único del audio. Este campo especifica qué altavoz se ha detectado que ha pronunciado esta palabra. En algunos modelos, como medical_conversation, puede ser el rol real del interlocutor (por ejemplo, "paciente" o "proveedor"), pero, por lo general, se trata de un número que identifica a un interlocutor. Este campo solo se define si enable_speaker_diarization = "true" y solo en la alternativa principal.