Home Assistant LAB · Głos i AI w praktyce · Lekcja 5
Czy lokalny głos jest naprawdę szybki? Budujemy benchmark Speech-to-Phrase, Assist i Pipera
W poprzedniej lekcji lokalny Assist przeszedł test WAN OFF. Teraz mierzymy go jak prawdziwy system. Nie zapisujemy jednej liczby „czas odpowiedzi”. Rozdzielamy wake word, wykrycie końca mowy, STT, intent, TTS, reakcję fizycznego urządzenia i pierwszy dźwięk z Voice PE. Dzięki temu po aktualizacji albo zmianie sprzętu będziesz wiedział nie tylko, że jest wolniej, ale dokładnie gdzie powstało opóźnienie.
Dlaczego ten etap jest ważny
Bez pomiaru każda optymalizacja jest zgadywaniem. Mocniejszy serwer nie naprawi opóźnienia w VAD, szybszy STT nie poprawi wolnej odpowiedzi dostarczanej do satelity, a strojenie Pipera nie ma sensu, jeśli trzy sekundy znikały wcześniej.
W pełnej lekcji zrobisz to krok po kroku
Tworzymy stałe stanowisko i zestaw sześciu klas komend
Ta sama odległość, ten sam Voice PE, ten sam odbiornik, ten sam pipeline i ta sama akustyka. Zamiast jednego łatwego zdania testujemy encję ON/OFF, alias, obszar, wartość i pytanie o stan. Każdą klasę powtarzamy kilka razy.
Czytamy surowe timestampy Debug Assist
Wyjaśniamy `stt-start`, `stt-vad-start`, `stt-vad-end`, `stt-end`, `intent-start/end` oraz `tts-start/end`. Pokazujemy, dlaczego cały czas STT zawiera również długość Twojej wypowiedzi i jak wyliczyć rzeczywisty czas przetwarzania po końcu mowy.
Mierzymy to, czego Home Assistant nie widzi
Drugi telefon nagrywa użytkownika, Voice PE i lampę. Dzięki nagraniu mierzymy End-to-Action i End-to-Voice: od ostatniego słowa komendy do fizycznej reakcji oraz do pierwszego słowa odpowiedzi.
WAN ON i WAN OFF dostają ten sam zestaw prób
Wykonujemy serię online, potem odcinamy wyłącznie WAN i powtarzamy te same zdania bez przestawiania urządzeń. Jeżeli pipeline jest naprawdę lokalny, wyniki powinny być funkcjonalnie zbliżone.
Mediana mówi, jak działa system zwykle. MAX pokazuje najgorszy przypadek
Nie chowamy pojedynczych zwisów pod wygodną średnią. Zapisujemy medianę, średnią, MAX i osobne procenty skuteczności wake wordu, STT, intentu, targetu oraz końcowego wykonania.
Pełna wersja zawiera
- stały scenariusz benchmarku MarkLabs
- 30 prób WAN ON i 30 prób WAN OFF
- osobny wynik skuteczności wake wordu za pierwszym razem
- STT Exact i STT Semantic
- osobne wyniki intentu, targetu i fizycznej akcji
- ścieżkę Settings > Voice assistants > Debug
- interpretację wszystkich kluczowych zdarzeń pipeline
- obliczanie STT post-speech, Intent Time i TTS Generation Time
- wyjaśnienie wpływu VAD na odczuwaną szybkość
- pomiar End-to-Action i End-to-Voice z nagrania 60 fps
- medianę, średnią, MAX i skuteczność End-to-End
- interpretację wyników i lokalizowanie wąskiego gardła
- skrócony test regresyjny po aktualizacji Home Assistant
- zasady uczciwego porównania Speech-to-Phrase z przyszłym Whisperem
- gotowy arkusz benchmarku do wypełnienia
Jak pracujemy w pełnej wersji
Nie zmieniamy konfiguracji podczas pomiaru. Najpierw trzy próby rozgrzewkowe, potem seria właściwa. Po każdej grupie uzupełniamy Debug Assist, żeby nie pomylić runów.
Nie optymalizujemy niczego przed zapisaniem wyniku bazowego. Dopiero po benchmarku zmieniamy jedną rzecz i powtarzamy ten sam zestaw. Wtedy wiemy, czy poprawa jest realna.
Efekt po zakończeniu lekcji
Masz liczbową bazę wydajności własnego Assist i potrafisz wskazać najwolniejszy etap. Po kolejnej aktualizacji nie będziesz mówił „chyba działa wolniej”. Powtórzysz test i zobaczysz dokładnie, co się zmieniło.
Chcesz zbudować i zmierzyć własnego asystenta razem z kursem?
Ta lekcja jest częścią kursu Smart Home od Zera na platformie MarkLabs E-Learning. Pełna wersja pokazuje nie tylko konfigurację, ale także sposób jej sprawdzenia, pomiaru i późniejszej diagnostyki.
Kup dostęp do kursu: 29 zł
Dożywotni dostęp | Wszystkie lekcje | Bez subskrypcji
Zamiast oceny „wydaje się szybko” zapiszesz medianę, najgorszy wynik, skuteczność i wersje komponentów, dzięki czemu późniejsza aktualizacja da się uczciwie porównać.