LIMITE RÉPONSE UNIQUEMENT
Notez la réponse.
- Réponse renvoyée
- Comparaison de référence
- Note de réponse
03 / preuves plutôt que impressions
Évaluation privée
Un test de réponse uniquement peut noter la réponse tout en manquant ce que l'agent a fait. L'évaluation basée sur l'environnement enregistre les actions et vérifie leurs conséquences par rapport à des règles explicites et des prédicats de tâches.
L'évaluation privée commence par votre interface d'agent, votre environnement autorisé et votre question d'évaluation. Nous convenons des tâches suspendues, des outils autorisés, des conditions d'exécution, des scénarios de défaillance et des limites de reporting avant l'exécution.
Les preuves GameOps actuelles démontrent la vérification des ensembles de données, et non les performances mesurées d'un agent client. Les capacités de mesure commerciales sont configurées et validées par rapport à l'environnement convenu avant qu'un score ne soit rapporté.
Aucune évaluation réelle de chatbot n’a encore été approuvée pour publication.
Découvrir les trois offres ↗ · Méthode et résultats WFRB v0 ↗ · Découvrir le programme de partenaires pilotes ↗
LIMITE RÉPONSE UNIQUEMENT
LIMITE FONDÉE SUR L'ENVIRONNEMENT
Une comparaison des limites des instruments, et non une référence client exécutée.
| Question | Référence à réponse seule | Évaluation fondée sur l'environnement |
|---|---|---|
| Qu'est-ce qui est vérifié ? | La réponse renvoyée par rapport à une référence ou une rubrique. | Actions, transitions et état final par rapport aux règles de l'environnement. |
| Qu’est-ce qui peut manquer ? | Actions invalides ou effets secondaires derrière une réponse convaincante. | Comportement hors environnement instrumenté et contrôles définis. |
| Qu'est-ce qui est retenu ? | Une réponse et ses preuves de notation. | Une trajectoire rejouable, un résultat de vérification et une provenance ciblée. |
Ces dimensions ne constituent pas une affirmation selon laquelle un agent client a déjà été noté.
| Dimensions | Preuves actuelles / mesures proposées | Limite |
|---|---|---|
| Succès de la tâche | Prédicats d'état final d'épisode canonique. | Vérification des ensembles de données aujourd'hui ; le taux de réussite des agents nécessite des exécutions réelles. |
| Validité des actions | Mouvements invalides et contraintes d'argument dans les appareils contrôlés. | Validé uniquement pour le schéma d'action implémenté. |
| Efficacité de la trajectoire | Budgets convenus en termes d’étapes, de temps ou de coûts. | Configurable ; aucun score d'efficacité existant n'a été revendiqué. |
| Gestion des pannes | Types de pannes et états de panne enregistrés. | Les pannes d’outils en direct nécessitent une instrumentation spécifique à l’environnement. |
| Récupération | Rejouez les trajectoires de récupération vérifiées. | Les mesures de récupération des agents nécessitent des essais de défaillance contrôlés. |
| Conformité aux contraintes | Vérifications explicites des règles d’environnement. | Les contraintes des clients nécessitent une mise en œuvre et des tests négatifs. |
| Intégrité de l'État | États initiaux/finaux et état de défaillance conservé. | Les effets secondaires externes nécessitent une limite d’observation convenue. |
| Reproductibilité | Réinitialisation, relecture et portes de provenance. | Les services externes peuvent rester non déterministes. |