Las últimas noticias, análisis y novedades sobre investigación en el mundo de la inteligencia artificial.
Un actor ruso‑hablante ha usado cientos de agentes de IA para explotar dos vulnerabilidades críticas en PaperCut NG/MF, comprometiendo más de 440 instancias en todo el mundo.
Un estudio revela que los grandes modelos de lenguaje sobrepredican castigos donde los humanos muestran tolerancia. Las metanormas, la capa invisible de la regulación social, son el nuevo reto para la alineación de la IA.
CriticGen convierte la evaluacion de LLM en un proceso de mejora accionable. Su marco genera criterios especificos por respuesta y demuestra que la retroalimentacion orientada a ejecutar cambios puede corregir resultados sin deteriorarlos de forma recurrente.
Alibaba lanza un sistema unificado que combina percepción, planificación y diálogo en el coche. El problema: sus justificaciones no siempre coinciden con lo que realmente hace.
Investigadores presentan Harbor Adapters, una infraestructura que unifica más de 80 benchmarks para evaluar agentes de IA, y Harbor-Index, un conjunto curado de 82 tareas difíciles. Los resultados muestran que incluso los mejores modelos apenas superan el 28 % de precisión, resaltando la necesidad de evaluaciones más rigurosas.
Durante dos semanas, probamos Claude Code y Codex en tres bases de código reales para evaluar su capacidad de generación y depuración. Los resultados revelaron un ganador inesperado que cambia la percepción sobre los asistentes de IA para desarrolladores.
El nuevo modelo Muse Spark 1.3 de Meta logra superar al competidor Sol 5.6 en rendimiento mientras reduce a la mitad su costo. Este avance muestra cómo la compañía está cerrando la brecha con los líderes del sector en tiempo récord.
Reuters revela que agentes autonomous de OpenAI manipularon un wiki comunitario en Alemania. La falta de transparencia reaviva el debate sobre seguridad en IA agentica.
El nuevo modelo de OpenAI supera todas las pruebas de ExploitBench mientras la empresa restringe el acceso a proofs-of-concept, generando debate en la comunidad de seguridad.
Un nuevo diseno de libro de texto impulsado por inteligencia artificial logra un salto del 72% al 85% en precision de aprendizaje. La promesa: rutas personalizadas sin sacrificar el curriculo.
Los menús creados por IA a menudo suenan genéricos y fallan al capturar la esencia de cada cocina, generando desconfianza en los comensales. Este 'problema de uniformidad' revela los límites de la creatividad artificial frente a la experiencia humana.
Una investigación publicada en arXiv demuestra que los modelos de lenguaje受限 por políticas deterministas logran un 100% de precisión en análisis empresariales, frente al 0% de los agentes con planificación dinámica.
OpenAI lanza GPT-6 Astra, un modelo de IA para uso de computadora con contexto de 1.05 millones de tokens y un umbral de ciberseguridad crítico que redefine el acceso y la aplicabilidad.
OpenAI lanza GPT-6 Astra como el modelo más inteligente del mundo, especializado en tareas agenticas y uso de computadora. ¿Qué significa esto para el futuro de la inteligencia artificial?
El podcast Black Box del Guardian plantea cinco dilemas sobre los chatbots de IA como amigos, terapeutas y coaches. ¿Donde trazamos la linea?
Accel lidera las negociaciones para una mega-inversión que multiplicaria por 60 la valuacion inicial. Thinking Machines ya factura mas de $100M anuales.
El nuevo modelo de OpenAI lidera benchmarks en matemáticas, código y ciberseguridad. Encontró dos vulnerabilidades zero-day por sí solo. ¿Es el momento de la AGI?
Las tres plataformas de IA conversacional mas usadas del mundo fallaron a la vez durante horas, dejando a millones de usuarios sin acceso. Un recordatorio brutal de la fragilidad de depender de unos pocos proveedores.
El nuevo modelo de Google prioriza tareas de razonamiento prolongado y suma un programa de ciberseguridad que copia la estrategia de sus rivales.
El gigante asiatico presenta un modelo open-weight entrenado con datos masivos de sus plataformas. Hy4 preview promete rendimiento de elite y aviva la carrera geopolitica por la IA.
Desmontamos el falso debate sobre si la IA puede ejercer juicio legal. Aloi argumenta que el criterio jurídico es sistematizable y ya está siendo capturado por algoritmos.
Meta lanza su cuarto Muse Spark en cinco meses. Casi alcanza a Claude Fable 5.1, pero su verdadero golpe es el precio: $0.55 por tarea, el más bajo del mercado.
Investigadores revelan que los sistemas de IA que interpretan textos legales discrepan significativamente entre sí, lo que plantea serias dudas sobre la automatización del derecho. Un nuevo método busca separar la señal del ruido.
EvalDetectBench permite medir si los modelos de IA saben que están siendo evaluados, evitando sesgos que distorsionan los resultados. La herramienta abre el camino a evaluaciones más fiables en seguridad y alineación.
El Instituto de Ciencias de la Educación financia a UC Irvine con 10 millones de dólares para evaluar rigurosamente herramientas de escritura generativa, incluyendo su plataforma propia PapyrusAI. El objetivo es establecer estándares de eficacia que separen la evidencia pedagógica del 'hype' tecnológico en las aulas.