O abordare semi-automatizată pentru identificarea persoanelor politice în datele de cercetare: abordări alternative
Publicat miercuri 22 ianuarie 2025 la 17:23

Într-o publicație anterioară, partenerul tehnologic BROD Ontotext (ONTO) a prezentat experimentele inițiale cu un algoritm de învățare automată (ML) pentru a identifica sau extrage din texte persoanele expuse politic (PEP) din baxe de date tipice cercetării. Echipa ONTO a aplicat un algoritm personalizat de legare a entităților multilingve care include metoda IXA[1] pentru detectarea limitelor entității și metoda mGENRE pentru dezambiguizarea entității (denumită în continuare IXA_mGENRE[2]). În timp ce acest algoritm a prezentat o performanță relativ bună pe seturile de date din eșantioane mici (aproximativ 70% scor F1), procesarea prin mGENRE este foarte lentă, ceea ce l-ar putea face inadecvat pentru adnotarea unei cantități mari de date. Prin urmare, a fost efectuată o a doua rundă de experimente pentru a evalua modul în care IXA_mGENRE ar funcționa față de alți doi algoritmi. Cele două abordări alternative au inclus:
- BELA[3] (plus clasificarea ulterioară a persoanelor în plus față de cea implementată prin IXA_mGENRE) – BELA este primul sistem multilingv end-to-end pentru legarea entităților. Este foarte rapid datorită naturii sale cu o singură trecere. Cu toate acestea, modelul nu returnează categoriile entităților extrase, de unde și necesitatea aplicării suplimentare a metodei clasificatorului.
- MultiNERD[4] + mGENRE (denumit în continuare MultiNERD_mGENRE) – MultiNERD este un set de date multilingv, cu mai multe genuri și cu granulație fină pentru recunoașterea entității numite (NER) și dezambiguizare. Corpul său este format din articole Wikipedia și WikiNews scrise în 10 limbi (chineză, olandeză, engleză, franceză, germană, italiană, rusă, portugheză, poloneză și spaniolă). Mențiunile sunt legate de trei baze de cunoștințe diferite (Wikidata, Wikipedia și BabelNet[5]). MiltiNERD conține mențiuni pentru 15 categorii specifice NER, dintre care una este „persoană”. Există un model NER multilingv disponibil gratuit, instruit pe MultiNERD, pe care echipa ONTO l-a folosit ca alternativă la metoda IXA și a format astfel algoritmul MultiNERD_mGENRE. Chiar dacă modelul MultiNERD NER nu este pregătit special pentru bulgară și română, returnează rezultate pentru aceste limbi, astfel încât ar putea fi potrivit pentru extragerea PEP. Trebuie remarcat faptul că, spre deosebire de ceilalți doi algoritmi, acesta nu necesită o clasificare ulterioară a persoanei, deoarece modelul detectează deja categoria „persoană”.
Pentru a doua rundă de experimente, echipa ONTO a lucrat cu un subset de date furnizate atât de CSD, cât și de SNSPA, mai precis cu primele 20.000 de articole din anumite seturi de date. În plus, de data aceasta seturile de date nu erau un eșantion propriu-zis, ci mai degrabă conțineau date colectate pentru analiza subiectelor cheie de cercetare ale BROD privind apartenența la Schengen, ajutorul militar ucrainean și intrarea în zona euro. Tabelele de mai jos oferă doar un exemplu cu privire la modul în care adnotările pentru unul și același document au diferit între cei trei algoritmi.

Comparație adnotări algoritm pentru „persoană”, „nelegat”: exemplu în bulgară

Comparație adnotări algoritm pentru „persoană”, „nelegat”: exemplu în română
Cantitatea de date prelucrate a fost considerabil mai mare decât cantitatea de date prelucrate în prima iterație. Din acest motiv, nu a fost posibilă efectuarea unei evaluări manuale exhaustive a rezultatelor. În schimb, au fost calculate unele statistici ale rezultatelor și s-a efectuat doar o analiză manuală parțială. Pe baza acestei analize, echipa de cercetare ONTO a ajuns la următoarele concluzii:
- Majoritatea entităților clasificate drept „persoană” de MultiNERD sunt într-adevăr oameni. Modelul face greșeli, dar procentajul lor pare să fie mult mai mic decât greșelile pentru IXA_mGENRE.
- Majoritatea persoanelor „legate” sunt conectate corect. În unele cazuri, entitățile „nelegate” au un articol Wikidata corespunzător.
- MultiNERD returnează cel mai mare număr de persoane „nelegate”. Acest lucru este important pentru extragerea PEP, deoarece se presupune că, în unele cazuri, acestea nu sunt acoperite într-o bază de cunoștințe generale existentă. Cu toate acestea, este important de reținut că toți cei trei algoritmi returnează un număr mare de persoane „nelegate”, pentru care există un articol Wikidata. Acestea fiind spuse, nu este clar dacă MultiNERD returnează cel mai mare număr de PEP, pentru care nu există nicio intrare într-o bază de cunoștințe. BELA este singurul model dintre cele explorate în această cercetare care este antrenat special pentru a extrage entități din Wikidata. În celelalte cazuri, partea sistemului responsabilă pentru extragerea entității (limită), IXA și MultiNERD, nu sunt instruite în mod special pe Wikidata. Intuitiv, este de așteptat ca aceste două modele să returneze un număr mai mare de PEP care nu sunt prezente în Wikidata.
- Comparând algoritmii BELA și IXA_mGENRE, se pare că IXA_mGENRE extrage un număr semnificativ mai mare de entități decât BELA. Cu toate acestea, procentajul entităților „legate” este mult mai mic. Analiza manuală a rezultatelor a stabilit că, în comparație cu BELA, algoritmul IXA_mGENRE introduce mai mult zgomot și extrage mai des părți din text care nu sunt entități reale.
Având în vedere aceste rezultate experimentale, putem rezuma avantajele și dezavantajele fiecărui algoritm:
IXA_mGENRE
+ Produce rezultate de o calitate satisfăcătoare.
- mGENRE este foarte lent, nu este potrivit pentru adnotarea unei cantități mari de date, deoarece necesită mult timp.
- Clasificarea „Persoană”/„non persoană” este lentă, așa că ar putea fi problematică atunci când se prelucrează o cantitate mare de date.
BELA
+ BELA este foarte rapid, potrivit pentru procesarea unei cantități mari de date.
+ Produce rezultate de bună calitate.
- Clasificarea „Persoană”/„non persoană” este lentă, prin urmare ar putea fi problematică atunci când se prelucrează o cantitate mare de date.
MultiNERD_mGENRE
+ MultiNERD este mai lent decât BELA, dar produce rezultate într-un timp rezonabil și ar putea fi utilizat pentru procesarea unei cantități mari de date.
+ MultiNERD returnează categorii și poate fi benefic pentru extragerea altor tipuri de date, nu numai a persoanelor.
+ În cazul extragerii PEP, trecem doar entitățile cu categoria „persoană” către mGENRE și în acest fel întregul proces este mai rapid, deoarece mGENRE trebuie să proceseze mult mai puține date decât în cazul algoritmului IXA_mGENRE.
Pe scurt, pe baza rezultatelor experimentelor și a analizelor ulterioare, avem o concluzie definitivă cu privire la care dintre cei trei algoritmi este cel mai bun pentru identificarea/extracția PEP. Totuși, a devenit clar că algoritmii MultiNERD_mGENRE și BELA par a fi mai potriviți pentru această sarcină decât abordarea IXA_mGENRE, care este lentă și introduce un procentaj mai mare de zgomot. Dacă este necesar, aceste două modele ar putea fi folosite pentru a facilita activitățile de analiză a datelor pentru activitățile de cercetare din BROD sau din alte proiecte.
[1] XA/Cogcomp at SemEval-2023 Task 2: Context-enriched Multilingual Named Entity Recognition Using Knowledge Bases - ACL Anthology
[2] https://arxiv.org/abs/2103.12528
[3] GitHub - facebookresearch/BELA: Bi-encoder entity linking architecture
[4] GitHub - Babelscape/multinerd: Repository for the paper "MultiNERD: A Multilingual, Multi-Genre and Fine-Grained Dataset for Named Entity Recognition (and Disambiguation)" (NAACL 2022).
[5] https://babelnet.org/