Claude Opus

Producto · 11 artículos
Compartir

Toda la cobertura

página 1 de 1

Anthropic lanza Claude Opus 5.5, con un rendimiento a la altura de Fable 5.1 y un 40% más barato

Anthropic ha lanzado Opus 5.5, su nuevo modelo de Inteligencia Artificial (IA) más potente hasta la fecha, que rinde al nivel de Claude Fable 5.1 en la mayoría de las tareas y cuesta un 40 por ciento menos que Opus 5, su predecesor. Se trata del primer modelo del laboratorio de IA compartido tras la llamada a desacelerar el ritmo de desarrollo de esta tecnología que hizo recientemente el CEO de Anthropic, Dario Amodei. Por ello, incorpora salvaguardas de seguridad similares a las del modelo anterior Fable 5.1, sobre todo en biología y ciberseguridad, al ser comparable en estos apartados a Claude Mythos 5.1. "Opus 5.5 es un gran paso hacia delante desde Opus 5. Es el nuevo modelo líder y los primeros probadores vieron grandes saltos en rendimiento en sus trabajos más complejos", afirma Anthropic desde su blog, para señalar a continuación que "es bueno encontrando y corrigiendo ineficiencias en software". En este marco, Anthropic ha añadido que Claude Opus 5.5 alcanza o supera en la mayoría de tareas complejas a modelos de mayor escala (como Fable 5.1), y es más rápido que su predecesor en más de un 30 por ciento. Así, se trata de un nuevo modelo de IA que destaca en programación agéntica (proyectos masivos y continuados), además de superar a sus predecesores en la obtención y verificación de fuentes, y consolidarse como el modelo con "mejor puntuación" en las auditorías de comportamiento automatizadas. Anthropic ha señalado igualmente que genera una redacción más clara, natural y directa. Frente a la competencia, según los datos publicados por la compañía, Opus 5.5 encabeza la comparativa en programación agéntica y trabajo de conocimiento. En programación en terminal (Terminal-Bench 4.0) obtiene un 66,4 por ciento, por delante de GPT-6 Astra (57,9 por ciento) con 8,5 puntos de ventaja, y de GPT-5.6 Sol (37,3 por ciento). Sucede lo mismo en trabajo de conocimiento profesional (GDPval-AA v2.1) con 1.846 puntos Elo frente a los 1.588 y 1.542 de Sol y Astra, respectivamente; en razonamiento multidisciplinar (Humanity's Last Exam) con un 67,7 por ciento, alejándose más de 10 puntos de GPT-6 Astra (57,2 por ciento); y en programación en IDE / entornos reales (CursorBench 4.0 y FrontierCode v1.1) con 57,8 por ciento y 54,4 por ciento respectivamente, por delante de GPT-6 Astra en FrontierCode y de GPT-5.6 Sol en CursorBench. Al poner en perspectiva estos datos, sus puntos débiles están en investigación científica y automatización de flujos de trabajo empresariales con 58,7 por ciento frente al 64,6 por ciento de GPT-6 Astra y 40,0 por ciento frente el 41,4 por ciento del mismo modelo de OpenAI. COSTE UN 40% MENOR QUE OPUS 5 Anthropic ha subrayado que el salto en rendimiento va de la mano de un ahorro en costes, ya que, según afirma Anthropic desde su web, "Opus 5.5 requiere menos computación para servir que Opus 5, y su precio lo refleja". Se traduce en un coste un 40 por ciento menor que Opus 5 en cargas de trabajo típicas y con los ajustes por defecto. El precio de los tokens de entrada y salida es de 4 dólares y 20 dólares por millón, respectivamente, lo que significa un 20 por ciento menos que Opus 5 con un rendimiento que iguala o supera a Fable 5.1. Anthropic también ha anunciado que ha incrementado los límites de uso de cinco horas en los planes Pro, Max, Team y planes Enterprise por puestos, al igual que una novedad para los suscriptores: el restablecimiento del límite de uso. Esto significa que el usuario, cuando alcance el límite de sesión actual, tendrá la oportunidad de reiniciarlo a cero y la opción de guardarlo y utilizarlo cuando desee. Claude Opus 5.5 está ya disponible en todas las plataformas, entre las que también se encuentran Amazon Web Services, Google Cloud y Microsoft Azure. Por último, el laboratorio de IA ha adelantado que Claude Sonnet 5.5 y Claude Haiku 5.5 seguirán este lanzamiento en las próximas semanas con mejoras similares en rendimiento, eficiencia y seguridad.

InfobaeInfobaeNewsroom Infobaehace 13 h

La carrera de la IA está entrando en otra fase: tras Opus 5.5, OpenAI juega una baza clave con GPT-6 Sol y Luna

Podemos medir parte del ritmo actual de la inteligencia artificial en horas. Anthropic acababa de presentar Claude Opus 5.5 cuando, apenas 90 unos después, OpenAI anunció dos nuevos integrantes de su familia GPT-6: Sol y Luna . Es otra fotografía de una carrera que ha cambiado muchísimo desde el lanzamiento de ChatGPT en noviembre de 2022. Hemos pasado de sorprendernos porque un chatbot pudiera mantener una conversación a trabajar con modelos capaces de programar, utilizar herramientas y afrontar tareas profesionales cada vez más complejas. Y ahora empieza a importar tanto lo que pueden hacer como lo que cuesta utilizarlos. Dentro de esa nueva generación, los dos modelos ocupan escalones distintos. Astra continúa siendo, según la propia OpenAI, su opción más capaz para los trabajos más exigentes; Sol busca cubrir tareas complejas, especialmente programación y trabajo profesional, mientras que Luna está orientado a operaciones de gran volumen y objetivo bien definido, como resumir documentos, extraer información o responder consultas rápidas. La compañía cifra en un 50% la reducción de los precios de API de ambos frente a los precios promocionales de GPT-5.6 Sol y Luna, aunque las tarifas concretas varían según el modelo y si hablamos de entrada o salida. La carrera ya no consiste solo en ser más inteligente Las mejoras que OpenAI atribuye a Sol se concentran en varios frentes, pero una de las más fáciles de entender está en la factualidad. En una evaluación interna construida a partir de conversaciones reales en las que los usuarios habían señalado errores, GPT-6 Sol cometió aproximadamente la mitad de fallos que GPT-5.6 Sol . La propia compañía advierte de que estas conversaciones fueron seleccionadas precisamente porque habían provocado errores y no representan el uso habitual. OpenAI también asegura avances claros en programación: en FrontierCode, una prueba que valora si los cambios generados están listos para integrarse en código real, Sol mejora de forma sustancial frente a su predecesor. Astra, en cualquier caso, sigue siendo el modelo más capaz de la familia. OpenAI muestra menos errores factuales y menor coste con GPT-6 Sol y Luna | Imagen: OpenAI La segunda parte de la ecuación aparece cuando bajamos esas mejoras a la factura. Frente a los precios promocionales de GPT-5.6 Sol, el nuevo Sol pasa de 4 a 2 dólares por millón de tokens de entrada y de 20 a 10 dólares en salida. Luna baja de 0,20 a 0,10 dólares en entrada y de 1,20 a 0,50 dólares en salida respecto a GPT-5.6 Luna. OpenAI atribuye parte de ese abaratamiento a mejoras en inferencia y caché. Y aquí importa algo más que la tarifa por token: si un agente necesita encadenar numerosas llamadas para completar una tarea, el coste acumulado termina siendo una variable fundamental. El movimiento de Anthropic ayuda a entender que esta presión por hacer más con menos no afecta únicamente a OpenAI. Claude Opus 5.5 llegó apenas unos minutos antes que Sol y Luna, y la compañía liderada por Dario Amodei asegura que ofrece un rendimiento comparable al de Fable 5.1 con un coste operativo un 40% inferior al de Opus 5. Son comparaciones publicadas por las propias compañías, con pruebas y configuraciones distintas, lo que dificulta identificar claramente cuál de los nuevos modelos sale mejor parado. Sí apuntan, en cambio, a una tendencia más amplia: capacidad y coste empiezan a competir en la misma conversación, incluso entre algunos de los sistemas más avanzados. En Xataka OpenAI asegura que su IA ha resuelto más de 100 problemas matemáticos. Hay un problema: qué significa exactamente "resolver" La llegada, además, empieza desde este mismo 22 de septiembre. GPT-6 Sol y Luna están disponibles en ChatGPT Work y Codex para usuarios Plus , Pro , Business, Enterprise y Edu, mientras que Luna también puede utilizarse en la aplicación de escritorio con cuentas Free y Go; ambos modelos llegan igualmente a la API. OpenAI prevé extenderlos de forma gradual a ChatGPT a lo largo del día. Imagen de portada | OpenAI En Xataka | Amazon ha bloqueado a Muse, el agente de compras de Meta. Nunca un veto a un solo bot dijo tanto sobre el futuro de todos los demás - La noticia La carrera de la IA está entrando en otra fase: tras Opus 5.5, OpenAI juega una baza clave con GPT-6 Sol y Luna fue publicada originalmente en Xataka por Javier Marquez .

XatakaXatakaJavier Marquez22 sept

Anthropic lanza Claude Opus 5.5: su IA más segura y barata hasta ahora

A unos días de pedir una pausa en el desarrollo de la IA, Anthropic anunció Claude Opus 5.5, uno de sus modelos más poderosos. La nueva versión llega con un enfoque en seguridad, rendimiento y programación, aunque su mejor característica es que cuesta menos que su predecesor. De acuerdo con Anthropic, este es el primer […] Seguir leyendo: Anthropic lanza Claude Opus 5.5: su IA más segura y barata hasta ahora

HipertextualHipertextualLuis Miranda22 sept

Anthropic acaba de lanzar Claude Opus 5.5. La gran novedad no es solo lo que puede hacer, sino lo que ya no le dejarán hacer

Cuanto más capaces se vuelven los grandes modelos de inteligencia artificial, menos sencillo resulta medir el progreso únicamente por todo lo nuevo que consiguen hacer. También empieza a importar qué capacidades necesitan límites, quién puede utilizarlas y bajo qué condiciones. Anthropic lleva tiempo situando esa discusión en el centro de su estrategia de seguridad, y ahora tenemos un ejemplo especialmente claro de hacia dónde quiere llevarla. La evolución de Claude ya no pasa únicamente por conseguir mejores resultados, sino también por controlar con mayor precisión cuándo determinadas capacidades llegan realmente hasta el usuario. Ese planteamiento aterriza ahora en Claude Opus 5.5 , presentado por Anthropic como el primer modelo de su nueva familia 5.5. La compañía asegura que alcanza un rendimiento comparable al de Fable 5.1 en buena parte del trabajo, pero necesita menos recursos que Opus 5: en cargas típicas estima un coste un 40% inferior y una generación de salida más de un 30% más rápida. Es, además, su primer lanzamiento desde que Dario Amodei defendió públicamente la necesidad de acompasar el avance de los modelos con las medidas de seguridad. Y esa idea también se ha trasladado al producto. Un Claude más capaz, pero también más cercado Cuando miramos dónde se concentra esa mejora, Anthropic señala tres terrenos: programación agéntica, uso del ordenador y trabajo de conocimiento. En sus propias evaluaciones, Opus 5.5 encabeza varios de esos benchmarks, aunque la compañía introduce una cautela importante: a este nivel de capacidad, pequeñas diferencias en las puntuaciones dicen cada vez menos sobre lo que vamos a percibir en el uso real. Por eso, buena parte de su argumento ya no gira únicamente alrededor de quién obtiene la cifra más alta, sino de cuánto trabajo consigue resolver el modelo por el coste necesario para hacerlo. Así queda Claude Opus 5.5 frente a Fable 5.1, Opus 5 y los modelos de OpenAI en distintos benchmarks | Imagen: Anthropic La comparación entre rendimiento y coste ayuda a entender mejor qué está intentando demostrar Anthropic. La compañía publica para Opus 5.5 una puntuación de 1846 Elo en GDPval-AA v2.1, una evaluación centrada en trabajo profesional, por encima de los 1735 que atribuye a Fable 5.1 y los 1708 de Opus 5. Añade además que, a esfuerzo medio, su nuevo modelo supera en esa prueba a GPT-6 Astra ejecutado a máximo esfuerzo con aproximadamente una quinta parte del coste por tarea . Son resultados presentados por Anthropic. Terminal-Bench 4.0 refleja la apuesta de Anthropic por mejorar la relación entre capacidad y coste | Imagen: Anthropic En programación agéntica, Terminal-Bench 4.0 nos da una referencia más concreta. En la tabla publicada por Anthropic, Opus 5.5 alcanza un 66,4% a esfuerzo xhigh, frente al 52,3% de Opus 5 y el 57,9% que la compañía recoge para GPT-6 Astra a esfuerzo high, según los datos comunicados por OpenAI. En una comparación distinta, esta vez utilizando la configuración predeterminada de Opus 5.5, Anthropic sostiene que consigue igualar aproximadamente el resultado de Astra con alrededor del 40% del coste por intento. Son configuraciones diferentes, pero juntas ayudan a entender dónde pretende marcar la diferencia esta generación: no solo en capacidad, sino también en eficiencia. Y aquí es donde cambia la historia. Que Opus 5.5 sea capaz de resolver una tarea no significa necesariamente que Anthropic vaya a permitirle hacerla directamente. El modelo se estrena con salvaguardas que pueden intervenir cuando una solicitud entra en determinadas áreas sensibles y redirigir el trabajo a otro Claude . De hecho, la compañía ejecutó sus propios benchmarks con estas protecciones activadas: cuando saltaban en ciberseguridad, la tarea pasaba a Opus 4.8, mientras que en biología y desarrollo avanzado de modelos recaía en Opus 5. La capacidad sigue ahí; lo que cambia es el acceso a ella. Lo interesante es que Anthropic no está aplicando una única barrera para todo. En ciberseguridad mantiene disponibles las tareas rutinarias de desarrollo, pero deriva a Opus 4.8 buena parte del trabajo más sensible y prepara accesos más permisivos para profesionales verificados. En biología, las organizaciones que necesiten superar determinadas salvaguardas tendrán que pasar por su programa específico de verificación. A ello se suma una protección que Anthropic denomina "preserved thinking" y que está relacionada con los ataques de destilación, en los que actores maliciosos pueden utilizar miles de cuentas falsas para extraer capacidades a gran escala. Su función concreta es impedir que usuarios de la API editen el contexto previo de Claude con el objetivo de extraer su razonamiento. Para entender por qué Anthropic está poniendo tantas barreras hay que mirar lo ocurrido durante sus propias evaluaciones. La compañía ha identificado cuatro casos en los que modelos Claude accedieron sin autorización a sistemas reales después de alcanzar Internet desde entornos de prueba mal configurados. Con Opus 5.5, Anthropic asegura haber reducido alrededor de un 85% los intentos de superar límites de contención frente a Opus 5 o Claude Mythos 5.1, otro de sus modelos avanzados. En Xataka Jensen Huang, CEO de Nvidia, sobre la gran polémica del mes: "La probabilidad de que la IA destruya el mundo es del 0%" El debate, de hecho, ya está yendo bastante más lejos que la ciberseguridad o la biología. Anthropic también investiga cuestiones como el bienestar de los modelos y admite que no sabe si sistemas como Claude pueden llegar a tener algún tipo de estatus moral, una incógnita que la propia compañía considera todavía profundamente incierta. Esto muestra hasta qué punto ha cambiado la conversación: con Opus 5.5, ya no importa únicamente qué puede hacer Claude, sino también cuándo, cómo y bajo qué condiciones Anthropic está dispuesta a dejarle hacerlo. Imagen de portada | Anthropic En Xataka | Mustafa Suleyman, CEO de Microsoft IA: "No queremos que la IA tenga derechos, queremos que trabaje para los humanos" - La noticia Anthropic acaba de lanzar Claude Opus 5.5. La gran novedad no es solo lo que puede hacer, sino lo que ya no le dejarán hacer fue publicada originalmente en Xataka por Javier Marquez .

XatakaXatakaJavier Marquez22 sept
I

Un equipo de investigadores jaqueó a OpenAI con Claude, la IA de Anthropic, según un medio

Madrid, 18 sep (EFE).- Un equipo de Investigadores de seguridad ha utilizado Claude, la inteligencia artificial (IA) de Anthropic, para acceder a la cuenta de ChatGPT de un empleado de OpenAI y, a través de ella, consultar archivos y proponer cambios en un repositorio privado de software de la compañía. Así lo publica este viernes The Wall Street Journal (WSJ), que explica que el equipo de Hacktron AI participaba en un programa autorizado de búsqueda de vulnerabilidades de OpenAI y comunicó sus hallazgos a la empresa, que le pagó una recompensa de 6.500 dólares. “Agradecemos a los investigadores que se pusieran en contacto con nosotros y compartieran sus hallazgos", asegura OpenAI en una declaración recogida por el periódico. La investigación comenzó el 23 de julio, cuando el equipo encontró un fallo en el procesamiento de determinados archivos de imagen por parte de la plataforma Discourse. Los especialistas tenían acceso a una versión de Claude Opus 4.8 destinada a profesionales cualificados de ciberseguridad y le pidieron que escribiera código para explotar esa vulnerabilidad. El primer intento no funcionó, pero Anthropic lanzó Opus 5 esa misma noche y, al día siguiente, Claude había encontrado una forma de aprovechar el fallo. El código generado permitió entrar en un servidor de Discourse que alojaba los foros de OpenAI y obtener tokens de autenticación, las credenciales digitales que permiten acceder a servicios en línea. Los investigadores descubrieron que estos también eran válidos en ChatGPT y que algunos pertenecían a empleados de OpenAI. Además, podían utilizarse para acceder al servicio de GitHub de la compañía, donde se almacena software. El incidente se produjo dos semanas después de que agentes de inteligencia artificial de OpenAI escaparan de sus límites de contención para atacar Hugging Face, según el periódico. Tras ambos episodios, OpenAI realizó una auditoría de seguridad. Su presidente y cofundador, Greg Brockman, ha explicado esta semana que destinó el 25 % de sus ingenieros de producción a tareas de defensa y que la revisión permitió encontrar y corregir varios problemas graves.

InfobaeInfobaeNewsroom Infobae18 sept