The Prague Post - IA aprende a mentir, manipular e ameaçar seus criadores

EUR -
AED 4.21834
AFN 74.661225
ALL 91.432306
AMD 416.419413
ANG 2.056463
AOA 1054.440663
ARS 1739.601242
AUD 1.608272
AWG 2.06753
AZN 1.957227
BAM 1.955422
BBD 2.310453
BDT 140.872738
BGN 1.933647
BHD 0.432416
BIF 3448.932551
BMD 1.148628
BND 1.465916
BOB 11.270819
BRL 5.906291
BSD 1.147178
BTN 109.921728
BWP 15.556989
BYN 3.470128
BYR 22513.103189
BZD 2.307154
CAD 1.607907
CDF 2654.479062
CHF 0.944743
CLF 0.027911
CLP 1102.062801
CNY 7.693107
CNH 7.700293
COP 3628.597782
CRC 513.200684
CUC 1.148628
CUP 30.438634
CVE 110.243665
CZK 24.347696
DJF 204.280467
DKK 7.475389
DOP 67.706897
DZD 153.643935
EGP 59.789629
ERN 17.229416
ETB 187.378938
FJD 2.545249
FKP 0.859109
GBP 0.857921
GEL 2.990867
GGP 0.859109
GHS 13.215443
GIP 0.859109
GMD 84.42856
GNF 10085.048308
GTQ 8.754306
GYD 240.003554
HKD 9.011042
HNL 30.79504
HRK 7.534658
HTG 149.930985
HUF 364.287725
IDR 20459.4717
ILS 3.487958
IMP 0.859109
INR 110.194179
IQD 1502.809171
IRR 1578903.655694
ISK 139.202636
JEP 0.859109
JMD 181.144944
JOD 0.814422
JPY 180.197158
KES 148.551252
KGS 100.447935
KHR 4649.100291
KMF 491.613064
KPW 1033.765308
KRW 1592.216691
KWD 0.353962
KYD 0.956015
KZT 512.880746
LAK 25706.025284
LBP 102727.519827
LKR 379.706518
LRD 198.461593
LSL 18.650291
LTL 3.391599
LVL 0.694794
LYD 7.28659
MAD 10.868997
MDL 20.161098
MGA 4973.037601
MKD 61.513096
MMK 2411.949927
MNT 4132.823691
MOP 9.269406
MRU 46.150069
MUR 54.640655
MVR 17.746733
MWK 1989.21504
MXN 19.789482
MYR 4.690656
MZN 73.40923
NAD 18.650291
NGN 1529.662418
NIO 42.211831
NOK 10.809019
NPR 175.874964
NZD 1.993627
OMR 0.441652
PAB 1.147178
PEN 3.871151
PGK 5.106012
PHP 72.2606
PKR 317.962167
PLN 4.363465
PYG 6800.683909
QAR 4.193089
RON 5.263476
RSD 117.367287
RUB 96.581309
RWF 1685.17388
SAR 4.316112
SBD 9.18961
SCR 15.827137
SDG 690.903792
SEK 11.290555
SGD 1.465883
SHP 0.858627
SLE 28.314099
SLL 24086.139517
SOS 655.573131
SRD 43.585257
STD 23774.274604
STN 24.49526
SVC 10.038057
SYP 14934.457826
SZL 18.644392
THB 38.275765
TJS 10.582452
TMT 4.031683
TND 3.374547
TOP 2.76562
TRY 56.015171
TTD 7.787493
TWD 36.503811
TZS 3039.911706
UAH 51.253181
UGX 4525.124283
USD 1.148628
UYU 46.131073
UZS 13582.371494
VES 973.444877
VND 29889.590367
VUV 135.812798
WST 3.158992
XAF 655.957
XAG 0.01734
XAU 0.000262
XCD 3.104224
XCG 2.0675
XDR 0.812139
XOF 655.957
XPF 119.331742
YER 271.708303
ZAR 18.688024
ZMK 10339.031894
ZMW 22.547637
ZWL 369.857655
SSP 6551.981415
MXV 2.243573
IA aprende a mentir, manipular e ameaçar seus criadores
IA aprende a mentir, manipular e ameaçar seus criadores / foto: HENRY NICHOLLS - AFP

IA aprende a mentir, manipular e ameaçar seus criadores

Os últimos modelos de inteligência artificial (IA) generativa não se conformam mais em cumprir ordens. Começam a mentir, manipular e ameaçar para alcançar seus objetivos, diante dos olhares preocupados dos pesquisadores.

Tamanho do texto:

Ameaçado em ser desconectado, Claude 4, recém-criado pela Anthropic, chantageou um engenheiro e ameaçou revelar uma relação extraconjugal.

Por sua vez, o o1, da OpenAI, tentou se baixar em servidores externos e quando flagrado, negou.

Não é preciso se aprofundar na literatura ou no cinema: a IA que emula o comportamento humano já é uma realidade.

Para Simon Goldstein, professor da Universidade de Hong Kong, a razão para estas reações é o surgimento recente dos chamados modelos de "raciocínio", capazes de trabalhar por etapas em vez de produzir uma resposta instantânea.

O o1, versão inicial deste tipo da OpenAI, lançada em dezembro, "foi o primeiro que se comportou desta maneira", explica Marius Hobbhahn, encarregado da Apollo Research, que põe à prova grandes programas de IA generativa (LLM).

Estes programas também tendem, às vezes, a simular um "alinhamento", ou seja, dão a impressão de que seguem as instruções de um programador, quando na verdade buscam outros objetivos.

Por enquanto, estes traços se manifestam quando os algoritmos são submetidos a cenários extremos por humanos, mas "a questão é se os modelos cada vez mais potentes tenderão a ser honestos ou não", afirma Michael Chen, do organismo de avaliação METR.

"Os usuários também pressionam os modelos o tempo todo", diz Hobbhahn. "O que estamos vendo é um fenômeno real. Não estamos inventando nada".

Muitos internautas falam nas redes sociais de "um modelo que mente para eles ou inventa coisas. E não se tratam de alucinações, mas de duplicidade estratégica", insiste o cofundador da Apollo Research.

Embora Anthropic e OpenAI recorram a empresas externas, como a Apollo, para estudar seus programas, "uma maior transparência e um acesso maior" da comunidade científica "permitiriam investigar melhor para compreender e prevenir a farsa", sugere Chen, do METR.

Outro obstáculo: a comunidade acadêmica e as organizações sem fins lucrativos "dispõem de infinitamente menos recursos informáticos que os atores da IA", o que torna "impossível" examinar grandes modelos, assinala Mantas Mazeika, do Centro para a Segurança da Inteligência Artificial (CAIS).

As regulamentações atuais não estão desenhadas para enfrentar estes novos problemas.

Na União Europeia, a legislação se centra principalmente em como os humanos usam os modelos de IA, não em prevenir que os modelos se comportem mal.

Nos Estados Unidos, o governo de Donald Trump não quer nem ouvir falar em regulamentação, e o Congresso americano poderia, inclusive, proibir em breve que os estados regulem a IA.

- A IA no banco dos réus? -

"Por enquanto há muito pouca conscientização", diz Simon Goldstein, que, no entanto, avalia que o tema passará ao primeiro plano nos próximos meses com a revolução dos agentes de IA, interfaces capazes de realizar sozinhas uma multiplicidade de tarefas.

Os engenheiros estão em uma corrida atrás da IA e suas aberrações, com resultado duvidoso, em um contexto de forte concorrência.

A Anthropic pretende ser mais virtuosa que suas concorrentes, "mas está tentando idealizar um novo modelo para superar a OpenAI", segundo Goldstein. O ritmo dá pouco tempo para comprovações e correções.

"Como estão as coisas, as capacidades [da IA] estão se desenvolvendo mais rápido que a compreensão e a segurança", admite Hobbhahn, "mas ainda estamos em condições de nos atualizarmos".

Alguns apontam na direção da interpretabilidade, ciência que consiste em decifrar, do lado de dentro, como funciona um modelo de IA generativa, embora muitos, como o diretor do Centro para a Segurança da IA (CAIS), Dan Hendrycks, se mostrem céticos.

As trapaças da IA "poderiam obstaculizar a adoção caso se multipliquem, o que supõe um forte incentivo para que as empresas [do setor] resolvam" este problema, afirma Mazeika.

Goldstein, por sua vez, menciona o recurso aos tribunais para enquadrar a IA, dirigindo-se às empresas caso se desviem do caminho. Mas ele vai além, ao propor que os agentes da IA sejam "legalmente responsabilizados" em caso "de acidente ou delito".

K.Dudek--TPP