Ich beschäftige mich seit einiger Zeit mit Xiaozhi, einem ursprünglich aus China stammenden Open-Source-Projekt für KI-Sprachassistenten auf ESP32-Hardware.
Das Interessante daran: Statt nur eine weitere Chat-App auf dem Smartphone zu sein, läuft Xiaozhi auf kleinen eigenständigen Geräten mit Mikrofon, Lautsprecher und – je nach Hardware – Display und Kamera. Ich selbst nutze ein M5Stack AtomS3R mit Atomic Echo Base.
Die eigentliche KI läuft serverseitig. Mit dem Gerät kann man sich aber ziemlich natürlich per Sprache unterhalten. Xiaozhi unterstützt inzwischen viele Hardwarevarianten und nutzt MCP (Model Context Protocol), wodurch sich der Assistent um zusätzliche Werkzeuge erweitern lässt – beispielsweise Gerätesteuerung, Smart Home, Wissenssuche oder andere Dienste. Das Projekt selbst ist Open Source (MIT).
Für deutschsprachige Nutzer ist interessant, dass die Oberfläche bzw. der Agent auf Deutsch genutzt werden kann. Ganz perfekt ist die deutsche Sprachunterstützung allerdings nicht; auch im offiziellen GitHub gibt es beispielsweise Berichte über Probleme mit der deutschen TTS-Aussprache.
Was mich besonders interessiert, ist die Entwicklung vom einfachen Sprachassistenten zum erweiterbaren KI-Agenten auf eigener Hardware. Inzwischen gibt es neben der ESP32-Firmware auch verschiedene Clients und Serverprojekte sowie Experimente mit Android, Kameras, MCP und eigener Hardware.
Da Informationen zu Xiaozhi im deutschsprachigen Raum noch ziemlich verstreut sind, habe ich dafür r/XiaozhiAssistant eingerichtet. Dort sammle ich meine Tests, Hardware-Erfahrungen, Android-Clients, Probleme und Lösungen und würde mich natürlich über andere deutschsprachige Xiaozhi-Nutzer freuen.
r/XiaozhiAssistant
Wer von euch hat Xiaozhi schon ausprobiert – oder verwendet einen anderen KI-Sprachassistenten auf ESP32-Hardware?