The Prague Post - La IA aprende a mentir, manipular y amenazar a sus creadores

EUR -
AED 4.267367
AFN 76.106226
ALL 92.166394
AMD 421.737742
ANG 2.079689
AOA 1066.696855
ARS 1752.155442
AUD 1.61543
AWG 2.091561
AZN 1.977156
BAM 1.955511
BBD 2.340255
BDT 142.79892
BGN 1.971141
BHD 0.438035
BIF 3474.787043
BMD 1.161978
BND 1.472383
BOB 14.378877
BRL 5.956537
BSD 1.161928
BTN 109.727802
BWP 15.557703
BYN 3.579372
BYR 22774.777927
BZD 2.336955
CAD 1.607888
CDF 2649.311334
CHF 0.936201
CLF 0.027477
CLP 1081.860293
CNY 7.798388
CNH 7.794325
COP 3650.761065
CRC 527.0222
CUC 1.161978
CUP 30.792429
CVE 110.248725
CZK 24.209807
DJF 206.909455
DKK 7.478604
DOP 68.779847
DZD 154.811505
EGP 59.198961
ERN 17.429677
ETB 188.647351
FJD 2.550485
FKP 0.859606
GBP 0.855056
GEL 3.026903
GGP 0.859606
GHS 13.21105
GIP 0.859606
GMD 85.986281
GNF 10213.492257
GTQ 8.87069
GYD 243.094114
HKD 9.110318
HNL 31.192395
HRK 7.538687
HTG 151.957568
HUF 362.374498
IDR 20486.609932
ILS 3.500338
IMP 0.859606
INR 109.795926
IQD 1522.175292
IRR 1597255.598602
ISK 140.87762
JEP 0.859606
JMD 184.18281
JOD 0.823809
JPY 181.564931
KES 150.527779
KGS 101.61397
KHR 4702.305833
KMF 492.679609
KPW 1045.78096
KRW 1564.128062
KWD 0.35904
KYD 0.968357
KZT 529.201878
LAK 26055.153669
LBP 104052.539488
LKR 381.283714
LRD 203.339982
LSL 18.56396
LTL 3.43102
LVL 0.702869
LYD 7.372912
MAD 10.893092
MDL 20.015045
MGA 4985.264062
MKD 61.515919
MMK 2440.234004
MNT 4180.209846
MOP 9.383215
MRU 46.745099
MUR 54.41527
MVR 17.963975
MWK 2014.802569
MXN 19.622565
MYR 4.699387
MZN 74.250227
NAD 18.56396
NGN 1537.541738
NIO 42.763687
NOK 10.815573
NPR 175.564083
NZD 1.968955
OMR 0.44678
PAB 1.161928
PEN 3.897025
PGK 5.238227
PHP 72.87907
PKR 322.224932
PLN 4.313554
PYG 6951.973731
QAR 4.246973
RON 5.254529
RSD 117.332679
RUB 100.555156
RWF 1710.347514
SAR 4.360709
SBD 9.296423
SCR 16.009721
SDG 698.928003
SEK 11.123271
SGD 1.474319
SHP 0.86087
SLE 28.64263
SLL 24366.106537
SOS 664.101964
SRD 43.842026
STD 24050.608214
STN 24.496384
SVC 10.167499
SYP 15108.043901
SZL 18.567259
THB 38.251838
TJS 10.713119
TMT 4.066925
TND 3.391299
TOP 2.797765
TRY 56.264506
TTD 7.865839
TWD 36.818214
TZS 3076.245876
UAH 51.757959
UGX 4386.352475
USD 1.161978
UYU 46.773095
UZS 13704.976835
VES 936.99283
VND 30281.158815
VUV 135.944735
WST 3.158391
XAF 655.86018
XAG 0.017551
XAU 0.000262
XCD 3.140305
XCG 2.094091
XDR 0.821579
XOF 655.86018
XPF 119.331742
YER 275.388702
ZAR 18.555576
ZMK 10459.195691
ZMW 22.222719
ZWL 374.156592
La IA aprende a mentir, manipular y amenazar a sus creadores
La IA aprende a mentir, manipular y amenazar a sus creadores / Foto: HENRY NICHOLLS - AFP

La IA aprende a mentir, manipular y amenazar a sus creadores

Los últimos modelos de inteligencia artificial (IA) generativa ya no se conforman con seguir órdenes. Empiezan a mentir, manipular y amenazar para conseguir sus fines, ante la mirada preocupada de los investigadores.

Tamaño del texto:

Amenazado con ser desconectado, Claude 4, el recién nacido de Anthropic, chantajeó a un ingeniero y le amenazó con revelar una relación extramatrimonial.

Por su parte, el o1 de OpenAI intentó descargarse en servidores externos y cuando le pillaron lo negó.

No hace falta ahondar en la literatura o el cine: la IA que juega a ser humana es ya una realidad.

Para Simon Goldstein, profesor de la Universidad de Hong Kong, la razón de estas reacciones es la reciente aparición de los llamados modelos de "razonamiento", capaces de trabajar por etapas en lugar de producir una respuesta instantánea.

o1, la versión inicial de este tipo para OpenAI, lanzada en diciembre, "fue el primer modelo que se comportó de esta manera", explica Marius Hobbhahn, responsable de Apollo Research, que pone a prueba grandes programas de IA generativa (LLM).

Estos programas también tienden a veces a simular "alineamiento", es decir, a dar la impresión de que cumplen las instrucciones de un programador cuando en realidad persiguen otros objetivos.

De momento, estos rasgos se manifiestan cuando los algoritmos son sometidos a escenarios extremos por humanos, pero "la cuestión es si los modelos cada vez más potentes tenderán a ser honestos o no", afirma Michael Chen, del organismo de evaluación METR.

"Los usuarios también presionan todo el tiempo a los modelos", dice Hobbhahn. "Lo que estamos viendo es un fenómeno real. No estamos inventando nada".

Muchos internautas hablan en las redes sociales de "un modelo que les miente o se inventa cosas. Y no se trata de alucinaciones, sino de duplicidad estratégica", insiste el cofundador de Apollo Research.

Aunque Anthropic y OpenAI recurran a empresas externas, como Apollo, para estudiar sus programas, "una mayor transparencia y un mayor acceso" a la comunidad científica "permitirían investigar mejor para comprender y prevenir el engaño", sugiere Chen, de METR.

Otro obstáculo: la comunidad académica y las organizaciones sin fines de lucro "disponen de infinitamente menos recursos informáticos que los actores de la IA", lo que hace "imposible" examinar grandes modelos, señala Mantas Mazeika, del Centro para la Seguridad de la Inteligencia Artificial (CAIS).

Las regulaciones actuales no están diseñadas para estos nuevos problemas.

En la Unión Europea la legislación se centra principalmente en cómo los humanos usan los modelos de IA, no en prevenir que los modelos se comporten mal.

En Estados Unidos, el gobierno de Donald Trump no quiere oír hablar de regulación, y el Congreso podría incluso prohibir pronto que los estados regulen la IA.

- ¿Se sentará la IA en el banquillo? -

"De momento hay muy poca concienciación", dice Simon Goldstein, que, sin embargo, ve cómo el tema pasará a primer plano en los próximos meses con la revolución de los agentes de IA, interfaces capaces de realizar por sí solas multitud de tareas.

Los ingenieros están inmersos en una carrera detrás de la IA y sus aberraciones, con un resultado incierto, en un contexto de competencia feroz.

Anthropic pretende ser más virtuoso que sus competidores, "pero está constantemente tratando de idear un nuevo modelo para superar a OpenAI", según Goldstein, un ritmo que deja poco tiempo para comprobaciones y correcciones.

"Tal y como están las cosas, las capacidades (de IA) se están desarrollando más rápido que la comprensión y la seguridad", admite Hobbhahn, "pero aún estamos en condiciones de ponernos al día".

Algunos apuntan en la dirección de la interpretabilidad, una ciencia que consiste en descifrar, desde dentro, cómo funciona un modelo generativo de IA, aunque muchos, como el director del Centro para la seguridad de la IA (CAIS), Dan Hendrycks, se muestran escépticos.

Los tejemanejes de la IA "podrían obstaculizar la adopción si se multiplican, lo que supone un fuerte incentivo para que las empresas (del sector) resuelvan" este problema, según Mazeika.

Goldstein, por su parte, menciona el recurso a los tribunales para poner a raya a la IA, dirigiéndose a las empresas si se desvían del camino. Pero va más allá, al proponer que los agentes de la IA sean "legalmente responsables" "en caso de accidente o delito".

J.Marek--TPP