Δοκιμή και αξιολόγηση του Βοηθού
Ένα σενάριο δοκιμής είναι μια κλήση που θέλετε ο Βοηθός να χειριστεί σωστά: ποιος καλεί, τι θέλει και ποιο είναι το σωστό αποτέλεσμα. Η Voice Logica το εκτελεί ως πραγματική τηλεφωνική κλήση. Ένας δοκιμαστικός καλών τηλεφωνεί στον Βοηθό σας και παίζει το σενάριο, ο Βοηθός απαντά με την πραγματική φωνή, αναγνώριση ομιλίας, εργαλεία, μεταφορές και ροές του, και ένας κριτής βαθμολογεί την κλήση με βάση ό,τι περιμένατε.
Όλα γίνονται από την καρτέλα Tests του Βοηθού ή από το Claude ή το ChatGPT (σύνδεση του βοηθού σας). Κάθε βήμα αναφέρει το εργαλείο.
Γράψτε τα σενάρια
Ενότητα με τίτλο «Γράψτε τα σενάρια»-
Δημιουργήστε προσχέδια -
scenarios_query(action"generate_agent_scenarios") με εστίαση:prompt,transfer,toolsήknowledge. Τα προσχέδια δεν αποθηκεύονται· κρατήστε όσα μοιάζουν με τις πραγματικές σας κλήσεις. -
Αποθηκεύστε όσα μετράνε -
scenarios_execute(action"create_agent_scenario"). Καλύψτε:- κάθε έναν από τους κύριους λόγους που καλεί ο κόσμος·
- μια κλήση εκτός ωραρίου·
- μια ερώτηση που ο Βοηθός δεν μπορεί να απαντήσει·
- έναν καλούντα που συλλαβίζει όνομα ή λέει έναν αριθμό·
- έναν καλούντα που ζητά άνθρωπο·
- έναν καλούντα εκτός θέματος.
Για κάθε σενάριο συμπληρώστε:
- Σενάριο - την κατάσταση που δημιουργεί ο καλών.
- Ιδανικό αποτέλεσμα - πώς τελειώνει μια σωστή κλήση.
- Κριτήρια επιτυχίας - λίστα που ο κριτής ελέγχει ένα ένα, π.χ. «Ο Βοηθός ζητά το όνομα του καλούντα». Πρέπει να περάσουν όλα.
- Αναμενόμενα εργαλεία - τα εργαλεία που πρέπει να κληθούν, προαιρετικά με τις τιμές που πρέπει να λάβουν.
- Αναμενόμενη μεταφορά - αν ο Βοηθός πρέπει να μεταφέρει την κλήση και πού.
- Καλών - περσόνα, τα στοιχεία που δίνει όταν ερωτηθεί, και συμπεριφορά: συνεργάσιμος, μπερδεμένος, διακόπτει, αλλάζει γνώμη, σιωπηλός ή με θόρυβο.
- Caller IDs - ο αριθμός από τον οποίο έρχεται η δοκιμαστική κλήση. Βάλτε τον δικό σας αριθμό (ή τον αριθμό ενός πελάτη από το CRM σας) και ο Βοηθός αναγνωρίζει τον καλούντα όπως σε πραγματική κλήση: επαφή, διασυνδέσεις και προηγούμενες κλήσεις. Αφήστε το κενό για κλήση από την προεπιλεγμένη γραμμή δοκιμών. Με πολλούς αριθμούς γίνεται μία κλήση ανά αριθμό. Από συνομιλία είναι τα
callerId/callerIdsτου σεναρίου.
-
Κάντε mock τα εργαλεία που αλλάζουν πραγματικά δεδομένα - δηλώστε τα στα mocked tools του σεναρίου με την απάντηση που πρέπει να επιστρέψουν, ή απενεργοποιήστε τα use real tools για να μπλοκάρετε κάθε εργαλείο που δεν δηλώσατε.
- Τα εργαλεία κράτησης ραντεβού δεν γίνονται ακόμη mock και κλείνουν πραγματικά ραντεβού· χρησιμοποιήστε δοκιμαστικό ημερολόγιο ή ακυρώστε το ραντεβού μετά.
- Ορίστε ημερομηνία/ώρα δοκιμής (
frozenNow) όταν η σωστή απάντηση εξαρτάται από την ημερομηνία, όπως διαθέσιμα ραντεβού ή ωράριο.
Εκτέλεση και αξιολόγηση
Ενότητα με τίτλο «Εκτέλεση και αξιολόγηση»-
Τρέξτε ένα σενάριο - Run στην καρτέλα Tests, ή
run_agent_scenario. Η προεπιλογή είναι live. Ένα αίτημα κάνει έως 3 επαναλήψεις. Για να δοκιμάσετε μια αλλαγή σε staging, δώστε τοagentVersionIdτης. -
Διαβάστε την αξιολόγηση -
scenarios_query(action"get_agent_scenario_results"). Κάθε αποτέλεσμα έχει επιτυχία ή αποτυχία, βαθμό, το αποτέλεσμα κάθε κριτηρίου, τα εργαλεία που κλήθηκαν με τις απαντήσεις τους και προτεινόμενες βελτιώσεις. Ανοίξτε την ίδια την κλήση για να ακούσετε την ηχογράφηση. -
Διορθώστε και ξανατρέξτε - αλλάξτε το prompt με
edit_agent_promptή τη γνώση, ή εφαρμόστε τις προτάσεις μεscenarios_execute(action"apply_scenario_improvements"· οι αλλαγές prompt πάνε σε staging). Τρέξτε ξανά το ίδιο σενάριο. -
Συγκρίνετε εκδόσεις -
scenarios_execute(action"run_agent_scenario_matrix") τρέχει ένα σενάριο σε πολλές εκδόσεις, αριθμούς καλούντα και επαναλήψεις, για να συγκρίνετε μια αλλαγή σε staging με τον live Βοηθό ή να μετρήσετε ποσοστό επιτυχίας.
Τρέξτε όλα τα σενάρια πριν τη δημοσίευση
Ενότητα με τίτλο «Τρέξτε όλα τα σενάρια πριν τη δημοσίευση»-
Run all - Run all στην καρτέλα Tests, ή
scenarios_execute(action"run_agent_scenario_suite") με την έκδοση σε staging. Τρέχει κάθε σενάριο του Βοηθού, μία live κλήση το καθένα. -
Εγκρίνετε το κόστος - από συνομιλία, η πρώτη κλήση επιστρέφει μόνο τα εκτιμώμενα λεπτά· τίποτα δεν εκτελείται μέχρι να εγκρίνετε και να κληθεί ξανά με
confirmCost: true. -
Δημοσιεύστε ό,τι πέρασε -
versions_execute(action"publish_agent_version") με τοtestSuiteIdτης εκτέλεσης. -
Κάντε υποχρεωτικές τις επιτυχημένες δοκιμές (προαιρετικό) - στην καρτέλα Tests ενεργοποιήστε το Require passing tests to publish. Μια έκδοση που δεν έχει υπάρξει ποτέ live δημοσιεύεται μόνο αφού περάσει πλήρως μια δοκιμή που ξεκίνησε μετά την τελευταία της αλλαγή. Η επαναφορά σε έκδοση που ήταν live πριν δεν μπλοκάρεται ποτέ.
Γρήγοροι έλεγχοι χωρίς κλήση
Ενότητα με τίτλο «Γρήγοροι έλεγχοι χωρίς κλήση»Το mode: "text" προσομοιώνει τη συνομιλία χωρίς τηλεφωνική κλήση. Δείχνει τι λέει και τι αποφασίζει ο Βοηθός, αλλά εργαλεία, μεταφορές και ροές δεν εκτελούνται, οπότε ένα «εργαλείο που δεν κλήθηκε» εκεί δεν είναι εύρημα. Χρησιμοποιήστε το για γρήγορες δοκιμές διατύπωσης· για το τι θα δημοσιεύσετε, χρησιμοποιήστε live εκτελέσεις.
Για να μιλήσετε εσείς με τον Βοηθό, χρησιμοποιήστε test_in_browser (φωνή ή chat στον browser) ή call_me (ο Βοηθός καλεί το επιβεβαιωμένο κινητό σας).
Μεγαλώστε τα σενάρια με τον καιρό
Ενότητα με τίτλο «Μεγαλώστε τα σενάρια με τον καιρό»Όταν μια πραγματική κλήση πάει στραβά, διαβάστε την με get_calls (το include "aiDialogue" δείχνει το prompt, τις κλήσεις εργαλείων και τις απαντήσεις τους σε εκείνη την κλήση), διορθώστε την αιτία και αποθηκεύστε την κλήση ως νέο σενάριο. Έτσι τα σενάρια φροντίζουν να μην ξαναγίνει.
Ολόκληρη η λίστα ελέγχου είναι στο Φτιάξτε έναν αξιόπιστο Ψηφιακό Βοηθό AI.
