El Kit de Copilot Studio: Probar agentes antes de que los empleados los prueben
Cómo el Kit de Copilot Studio construye conjuntos de prueba para sus propios agentes, qué tipos de prueba existen y cómo instalarlo y configurarlo.
El Kit de Copilot Studio, oficialmente Copilot Agent Kit, es una herramienta complementaria mantenida por el Equipo Asesor de Clientes de Power (Power CAT) para Microsoft Copilot Studio, que le permite probar, monitorear y asegurar sus propios agentes antes de que los empleados o clientes los vean. El núcleo del kit son conjuntos de prueba que enfrentan un agente con entradas definidas y validan automáticamente las respuestas contra valores esperados, en lugar de hacer clic manualmente en cada cambio en el chat. Estado: agosto de 2026.
¿Cómo instala el Kit de Copilot Studio?
El camino más fácil es a través del Marketplace: Visite el Kit de Copilot Agent en Marketplace, seleccione Obtener ahora, inicie sesión y seleccione el entorno de destino.
- Instalación en Marketplace: Confirme los términos, seleccione Instalar, luego en Power Apps abra la solución predeterminada en Soluciones y proporcione la referencia de conexión Kit de Copilot Studio - Dataverse con una conexión válida de Dataverse.
- Instalación desde GitHub: Descargue la solución administrada actual del repositorio oficial de Power CAT e importe en Power Apps a través de Soluciones, recreando conexiones según sea necesario.
- Acceso: Después de la instalación, encontrará la aplicación en Aplicaciones como Power CAT Copilot Studio Kit, ábala a través de Reproducir y luego comparta con su equipo usando la función de compartir.
Un asistente de configuración en el kit maneja la configuración de referencias de conexión, variables de entorno y Cloud Flows en gran medida automáticamente.
¿Cómo construye conjuntos de prueba para sus agentes?
Un conjunto de prueba agrupa múltiples pruebas individuales que ejecuta conjuntamente contra un agente. Los componentes principales son seis tipos de prueba con diferentes niveles de profundidad de verificación.
- Coincidencia de respuesta: compara la respuesta del agente directamente con una respuesta esperada, opcionalmente exacta, contiene o comienza con.
- Archivos adjuntos: verifica archivos adjuntos estructurados como Adaptive Cards, opcionalmente con validación asistida por IA contra instrucciones de prueba personalizadas.
- Coincidencia de tema: compara el tema esperado con el tema realmente activado y admite múltiples temas simultáneamente en la orquestación generativa.
- Respuestas generativas: permite que un modelo de lenguaje evalúe si una respuesta generada por IA se ajusta a una respuesta de patrón o instrucciones de prueba personalizadas.
- Multi-turno: encadena múltiples pruebas individuales en orden fijo dentro de la misma conversación e interrumpe en errores críticos.
- Validación de plan: verifica en la orquestación generativa si el agente utiliza realmente las herramientas esperadas en su plan de ejecución, evaluadas contra un umbral de aprobación en porcentaje.
Los conjuntos de prueba se pueden crear y mantener en masa a través de Excel, las pruebas individuales o conjuntos completos también se pueden duplicar para derivar rápidamente variantes.
¿Qué logra el kit más allá de las simples pruebas?
Además de la automatización de pruebas, el kit contiene varios módulos que abordan la gobernanza y operación de flotas de agentes. El Compliance Hub evalúa el inventario de agentes contra controles configurados y marca violaciones de políticas, el módulo Depurador de agentes proporciona diagnósticos paso a paso de conversaciones registradas, y los KPI de conversación consolidan métricas de uso y calidad además del análisis integrado de Copilot Studio. Para empresas que utilizan Copilot Studio en producción, la automatización de pruebas y el Compliance Hub en combinación son el apalancamiento más efectivo contra la proliferación incontrolada de agentes.
¿Para qué es útil la prueba de conexión con fuentes de datos protegidas?
Cuando un agente accede a una fuente de datos externa como SharePoint o Dataverse, aparece una tarjeta de autorización en la primera conversación que un usuario debe confirmar. Simula este flujo mediante una prueba de múltiples turnos con dos pruebas secundarias: la primera activa la tarjeta de autorización y compara su contenido, la segunda envía la confirmación y verifica la respuesta posterior. Una vez autorizado para un usuario de prueba, las pruebas posteriores se ejecutan contra el mismo conector sin esta desviación. Quien desee integrar esta cobertura de prueba en una estrategia de automatización existente con Microsoft Copilot se beneficiará de una separación clara entre entornos de desarrollo y producción.
Preguntas frecuentes sobre el Kit de Copilot Studio
¿El Kit de Copilot Studio cuesta licencias adicionales?
El kit en sí es una herramienta complementaria gratuita mantenida por el equipo Power CAT de Microsoft que puede instalar desde Marketplace o GitHub. Sin embargo, requiere un entorno de Power Apps y Dataverse, que está sujeto a las reglas estándar de licencia de Power Platform.
¿Puedo ejecutar pruebas automáticamente antes de cada implementación?
Sí, a través de la integración con Power Platform Pipelines, las pruebas se pueden ejecutar automáticamente antes de que un agente se promueva entre entornos. El kit es por tanto utilizable para procesos de lanzamiento de múltiples etapas desde desarrollo a través de prueba hasta producción.
¿Qué tipo de prueba es adecuado para una conversación de múltiples etapas?
El tipo de prueba Multi-turno representa múltiples mensajes consecutivos en la misma conversación y se puede combinar con pruebas de Coincidencia de respuesta, Archivos adjuntos, Coincidencia de tema y Respuestas generativas como pruebas secundarias. Las pruebas secundarias críticas interrumpen toda la ejecución de pruebas en caso de error, las no críticas continúan y proporcionan contexto adicional.
¿Necesito configuración adicional para las pruebas de Respuestas generativas?
Sí, este tipo de prueba requiere que esté habilitado el enriquecimiento de AI Builder para que un modelo de lenguaje evalúe la respuesta generada contra una respuesta de patrón o instrucciones de prueba personalizadas. Sin este enriquecimiento, el tipo de prueba no está disponible en la interfaz.
Simon Glowik
Fundador de NordFlux. Siete años de experiencia, desde la web y el SEO hasta la automatización a escala de grupo, hoy de forma pragmática para las pymes y con soberanía de datos alemana.
Certificaciones
- Certificado Microsoft — PL-900 y AZ-900
- Certificado UiPath — Automation Developer Associate
¿Preguntas concretas sobre automatización o IA?
En un análisis inicial gratuito hablamos directamente de su caso. Sin compromiso.