Logo
TGCATALOG
Catálogo Selecciones Blog
Speech Technology - речь

Speech Technology - речь

Канал посвящён технологиям речи: распознавание, синтез и голосовые помощники. Актуальные новости и обзоры.

Sin valoraciones
24
10.09.2026
24
10.09.2026
Sin valoraciones
24
10.09.2026
Redirección segura vía bot
О канале

Канал посвящён технологиям речи: распознавание, синтез и голосовые помощники. Актуальные новости и обзоры.

Подписчиков 1,718
Тематика Tecnología
Язык Español
Ссылка t.me/speechtech

También te recomendamos

Kekaton AI  Voz en off y clon de voz
Kekaton AI Voz en off y clon de voz
Bot

bot de IA para clonar texto a voz y voz en Telegram. Cree audio utilizando la red neuronal de forma rápida y fácil.

Descripción

🗣️ Speech Technology — канал для любителей голосовых технологий. Узнайте о новейших системах распознавания речи, синтезе голоса и ИИ-ассистентах. От Siri до продвинутых нейросетей.

🔬 Здесь публикуются статьи о разработках, исследованиях и применении в повседневной жизни. Обзоры софта, аппаратных решений и тенденции рынка.

🎤 Будьте в курсе прорывов в области речевых технологий. Полезно для разработчиков, лингвистов и всех интересующихся ИИ.

Últimas publicaciones

Speech Technology - речь
Speech Technology - речь
🔒Открыть пост
и посмотреть медиа
Deepmind also releases something Ссылка скрыта PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar Current multimodal LLMs process audio as a mono stream, ignoring the rich spatial information essential for embodied AI. Existing spatial audio models, conversely, are constrained to fixed microphone geometries, preventing deployment across diverse devices. We present PhaseCoder, a transformer-only spatial audio encoder that is agnostic to microphone geometry. PhaseCoder takes raw multichannel audio and microphone coordinates as inputs to perform localization and produces robust spatial embeddings. We demonstrate that Gemma 3n LLM can be fine-tuned to reason over "Spatial Audio Tokens" produced by PhaseCoder. We show our encoder achieves state-of-the-art results on microphone-invariant localization benchmarks and, for the first time, enables an LLM to perform complex spatial reasoning and targeted transcription tasks from an arbitrary microphone array.
Speech Technology - речь
Evolución de suscriptores
+0.2% últimos 30 días
Actuales
1,718
Hace un mes
1,715
Crecimiento medio
+0 / día
Actualizado
hace 4 horas

Reseñas de canal Speech Technology - речь

Inicia sesión para dejar una reseña

Solo los usuarios registrados pueden compartir su opinión.

Aún no hay reseñas

¡Sé el primero en compartir tu experiencia con este recurso!

Recursos similares

31

Crecer juntos: Un conjunto de recursos de cracking – Software, herramientas y guías en un solo lugar para profesionales.

Canal

Medios de comunicación sobre la IA: noticias, tendencias, facaps, memes con acento ucraniano.

Canal

Noticias, innovaciones e interesantes hechos de TI.

Canal
Cambiar a tema claro
Inicio Catálogo Selecciones Blog Entrar