Nota de aprendizaje
Nota de aprendizaje
El entrenamiento modifica un modelo mediante datos y cómputo. La inferencia consiste en usar el modelo entrenado para producir resultados. Datos más útiles, mejores algoritmos, más cómputo y un mejor uso del cómputo durante la inferencia pueden mejorar el desempeño, pero una tendencia no garantiza una capacidad futura concreta. Las herramientas, permisos, tiempo disponible y apoyo humano también determinan lo que puede hacer el sistema completo.
Una prueba de referencia, o benchmark, mide el desempeño en tareas seleccionadas bajo condiciones específicas. Puede mostrar progreso sin demostrar que el sistema esté listo para un entorno laboral. Pregunta cómo se eligieron las tareas, cómo se definió el éxito, si los ejemplos eran conocidos, cuántos intentos se permitieron y qué ayuda humana hubo. Una explicación segura de sí misma no mide la fiabilidad.
El ciclo de retroalimentación de la investigación en IA es una hipótesis: si la IA acelera la investigación que mejora la propia IA, el progreso podría acelerarse más. Una explosión de inteligencia depende de obstáculos como experimentos, evaluación fiable, recursos de cómputo e integración. Otra perspectiva destaca la adopción lenta, el cambio institucional y la utilidad desigual. Analiza mecanismos y evidencia; no evalúes una predicción por lo impactante que suene.
Cómo interpretar un horizonte temporal: la medida de METR se basa en cuánto tardaría una persona experta en tareas que una IA completa con cierta probabilidad de éxito. No mide cuánto tiempo funciona la IA ni demuestra la automatización de una profesión completa. La selección de tareas y el contexto limitan la generalización. Metodología y límites de METR, en inglés
Laboratorio de fuentes · 30 minutos
Trabaja con los datos ficticios de W2; la nota de METR es una lectura opcional en inglés. Identifica métrica, denominador, contexto, comparación faltante y conclusión justificada. Profundización opcional: Narayanan y Kapoor, AI as Normal Technology. Su énfasis en adopción e instituciones es un argumento por evaluar, no una refutación definitiva del progreso rápido.
Recuperación de ideas
Explica la diferencia entre capacidad del modelo e implementación segura a alguien que estudia enfermería o ingeniería civil. Nombra un factor que pueda modificar una sin modificar la otra.
W2 · Evaluar antes de extrapolar
Fichas de evidencia ficticia
A. Demostración de la empresa: 18 de 20 tareas de apoyo completadas correctamente; tareas elegidas por la empresa; un intento por tarea; sin acceso a una base real; el personal aportó datos claros. La empresa afirma: «Listo para apoyo estudiantil autónomo».
B. Prueba independiente en aula: 12 de 20 tareas correctas; incluye fechas ambiguas y solicitudes incompletas; misma versión del modelo y un intento por tarea. Las selecciones distintas impiden tratar A y B como una comparación controlada.
C. Evidencia faltante: no hay referencia del servicio manual, evaluación de accesibilidad, ponderación por gravedad, prueba de demanda alta ni medición de consecuencias para estudiantes.
Ficha de trabajo · 60 minutos
- 10 min: Calcula tasas de éxito y fallo. Explica por qué combinarlas en un 75% de éxito oculta condiciones diferentes, aunque la operación matemática sea posible.
- 15 min: Completa seis campos: afirmación, evidencia, condiciones de prueba, información faltante, confianza y próxima prueba.
- 15 min: Diseña una comparación justa: mismas tareas representativas, criterios explícitos, referencia humana, permisos constantes e informe separado de errores graves. Indica quién evalúa sin conocer el origen del resultado cuando sea posible.
- 10 min: Formula dos predicciones condicionales: una con mejora rápida de capacidades y otra con integración lenta. Nombra una observación que favorezca cada una.
- 10 min: Reformula la afirmación comercial de manera defendible en 50 palabras.
Profundiza
¿Sería aceptable un 99% de éxito si los errores restantes excluyen a estudiantes de un apoyo esencial? ¿Qué cambia si el personal revisa todos los resultados? ¿Qué cuesta esa revisión? Describe las consecuencias antes de elegir un umbral.
Informe acumulativo · 45 minutos
Añade una tabla de evidencia y una evaluación propuesta. Separa los datos ficticios de práctica de las fuentes reales. Para otro proyecto, usa datos ficticios igualmente transparentes o datos públicos verificados; no afirmes haber realizado un estudio.
Comprobación final
Un sistema tiene un horizonte de tareas de dos horas con 50% de éxito. ¿Significa que funciona con seguridad durante dos horas sin supervisión? Explica por qué no. ¿Qué evidencia debilitaría tu predicción preferida?
