Le projet Speakr a été conçu pour aider les utilisateurs à gérer et à rechercher dans de grandes collections de fichiers audio, tels que les enregistrements de réunions, les entretiens et les notes vocales. Il permet aux utilisateurs de charger des fichiers existants ou d'enregistrer directement depuis leur navigateur, capturant à la fois l'entrée du microphone et les sons du système. Une fois traité, l'audio est converti en texte clair et rechercheable. Ce texte est divisé par orateur, et le système fournit des résumés et des notes pouvant être utilisés comme référence rapide. Les utilisateurs peuvent cliquer sur des parties spécifiques de la transcription pour sauter directement au moment exact dans l'audio.
L'une des fonctionnalités uniques de Speakr est "Inquire", qui permet aux utilisateurs de poser des questions sur l'ensemble de la collection d'enregistrements. Par exemple, un utilisateur pourrait demander : « Quel a été notre décision concernant le prix, et qui n'était pas d'accord ? » Le système recherche alors dans les enregistrements et fournit des réponses, souvent accompagnées de liens vers des parties spécifiques de l'audio. Il existe également une fonction bêta optionnelle appelée "mode agent", qui lit automatiquement les enregistrements pertinents et fournit des réponses avec des liens numérotés vers les extraits concernés.
Bien que Speakr soit commercialisé comme un outil auto-hébergé - mettant l'accent sur la confidentialité des utilisateurs - la transcription et le traitement de l'audio impliquent des services externes. L'audio est envoyé à un moteur tiers, tel qu'OpenAI ou OpenRouter, pour être converti en texte. Ce texte est ensuite traité par un autre modèle pour générer des résumés, des titres et des réponses aux conversations. Pour les utilisateurs souhaitant garder tout en local, une alternative appelée Ollama peut être utilisée à la place des services externes. Cependant, cela nécessite une carte graphique et un grand modèle Whisper pour une transcription efficace, comme indiqué dans la documentation du projet. Sans carte graphique, le système fonctionne toujours, mais sera plus lent.
Speakr est construit à l'aide de Docker et prend en charge à la fois SQLite et PostgreSQL pour le stockage des données. Il nécessite au moins 2 Go de RAM pour l'application elle-même et inclut des fonctionnalités courantes dans les applications multi-utilisateurs, telles que les comptes utilisateurs, l'authentification unique, les options de partage, les API signées et les webhooks. Le logiciel est publié sous la licence AGPLv3, qui permet une utilisation gratuite mais exige que toute modification soit partagée avec la communauté. Un contrat commercial est également disponible pour les utilisateurs qui préfèrent ne pas être soumis aux termes de la licence AGPLv3.
D'autres outils similaires incluent Scriberr, qui transcrit l'audio localement sans envoyer de données vers des serveurs externes, mais dont le développement s'est arrêté. Une autre alternative est Meetily, qui se concentre sur les postes de travail individuels plutôt que sur les serveurs d'équipe et propose la séparation vocale comme fonctionnalité payante.
Le projet Speakr propose une transcription et une recherche d'audio auto-hébergées avec des préoccupations liées à la confidentialité
Contenu réécrit par une IA à partir de sources de presseComment ça marche
audio-transcriptionself-hostedprivacyai-insightsdockeropen-source
Sources d'origine :
- 🇫🇷Korben



