3.062.850 DOKUMENTU TOPATU DITUT

  • Bilatzaileek ahalegin handia egin arren, nahi ditugun web-orriak aurkitzea ez da erraza izaten. Bilaketa egiteko eskatu eta lortutako web-orri zerrendak oso luzeak izaten dira, asko ez dira gure beharretara egokitzen, batzuk abandonatutakoak dira...
Interneten zerbait aurkitu nahi dugunean bilatzaileak erabiltzera jotzen dugu. Nahi adina bilatzaile ditugu eskueran eta askotan zaila izaten da bata eta bestearen arteko ezaugarriak bereiztea. Bilatzaileak datu-base edo informazio-base erraldoietan oinarritzen dira eta hauek etenik gabe automatikoki elikatzen aritzen dira; oro har, elikatzeko bidea robot bilatzailearena izaten da, hauek web-ean argitaratzen dena automatikoki detektatu, indexatu eta indizeak basera kargatzen dituztelarik. Elikatzeko erabiltzen den beste bideetako bat web-orrien kudeatzaileek, interesgarri deritzoten bilatzaileetan, eskuz alta ematearena izaten da.
Interneten egunero hainbat eta hainbat web-orri berri sortzen da eta beraz web-orrien kopurua etenik gabe hazten ari da. Aldi berean badago hazkunde esponentziala duen beste prozesu bat, hots, web-orrien desagerketarena edo abandonaketarena; web-orria desagertzen denean, gehienetan erreferentzia ez da bilatzaileen datu-baseetan ezabatzen eta ondorioz, erreferentzia horren gainean klik egitean desagerpen-abisua edo errore-mezua azaltzen zaigu; web-orrien abandonaketa da, ezbairik gabe, Interneten gehien hedatu den gaixotasuna eta horren froga erraz topa dezakegu edozein bilaketa egin ondoren aurkitutako orriaren eguneraketa-data ikusiz. Honen harira esan, oso ohikoa izaten dela enpresek edo partikularrek web-orriak diseinatzea, Interneten kokatzea eta ahaztea, hau da, Interneten banago eta egin beharrekoa egin dut pentsatzea. Jokatzeko era honek Internetekiko plan estrategikorik ez izatea erakusten du eta hau askorentzat Internet moda baino ez delako gertatzen da.
Beraz, Interneten informazio-posibilitateak zabaltzen doazen neurrian, lastrea ere handituz doa; horregatik gero eta korapilotsuagoa da buruan dugun kontzeptua zehaztasunez eta kalitatez, nolabait esatearren, lortzea.
Kasurik onenean ere, hau da, lastrea alde batera utzita, milaka edo milioika erreferentzia dituen emaitzarekin topo egitea nahikoa arrunta da. Adibidez, artikulu honen izenburuko zenbakia dugu, hau "cat" hitza Altavista bilatzailean idatzi ondoren ateratako emaitza baita.


NOIZ TOPATUKO DUT BEHAR DUDANA?

Halere, oraindik Interneten nahi duguna aurki dezakegu, gehiago edo gutxiago kostata, baina informazio-bilatzaileak gero eta kezkatuago daude arestian aipatu arazoekin. Zer egin, bada, egoera horren aurrean?
Orrien desagerketaren edo abandonaketaren aurrean robot bilatzaile gero eta ahalmentsuagoak garatzen ari dira. Hauek, orriak desagertzean edo abandonatzean, detektatu eta datu-basean erreferentzia ezabatzeko posibilitatea izan behar dute. Garbiketa-prozesuak etenik gabekoa izan behar du eta nahiz eta ez lortu informazio-basea %100 eguneratuta mantentzea, eskaintzen dena kalitate minimo batekin eskainiko da.
Dena den, arazo larrienak, buruan dugun kontzeptua ahalik eta fidagarritasun gehienez bilatzea, izaten segituko du. Orain arteko bilatzaile gehienek hitzak edota hauen arteko elkarketak erabiltzen dituzte bilaketarako oinarri gisa eta gainera bilaketa, hitza idatzi dugun lengoaian bakarrik burutzen da. Hau da, "etxe" hitza dituzten testuak eskuratu nahi baditugu, ez zaizkigu "maison", "casa" edo "house" dituzten testuak azalduko. Gainera buruan dugun kontzeptuak adierazteko ez da nahikoa hitzen arteko elkarketa hutsa egitea, baizik eta esaldiak, perpausak edo parrafoak dira kontzeptu horiek adierazteko bide naturalena. Adibidez, "New Yorkeko burtsen gorabeherak" azaltzen dituen informazioa bilatzeko ez da nahikoa "New York" eta "burtsa" eta "gorabehera" hitzak elkartzea, baizik eta sistemak nolabait ulertu beharko luke indize ekonomiko zehatz baten bilakaerari buruzko informazioa eskatzen zaiola.
Munduan dauden bilatzaileen oinarri edo justifikazio teknologikoa hizkuntzekin erabat loturik doa eta horrela, teknologian zabalduen dagoen hizkuntza ingelesa denez, berau da bilatzaile gehienen motorra. Motor honek euskararen gisako hizkuntza deribatiboetan neurri batean baino ez du balio, kontuan hartu behar baita ingelesezko hitzek oso forma eratorri gutxi dituztela eta aldiz, euskal hitz bakoitzari nahi adina atzizki erants dakiokeela.
Ildo honetan Euskal Herrian garatzen ari den informazio-teknologiak, euskara euskarri gisa duen neurrian, atzerriko bilatzaileen teknologiarekin desberdintasun nabarmenak ditu. Batez ere, bi dira euskararen ezaugarriak kontuan hartuz bilatzaileak eta hizkuntzaren teknologia oro har, garatzen ari diren ikerketa-taldeak, Ametzagaiña Taldea eta IXA Taldea. Nahiz eta bi taldeok ikerketarako teknologia desberdinak erabili, lortutako bilatzaileek hitzen lema dute oinarritzat, hau da hitzei itxura kendu eta erroa hartzen da bilaketa-tresna gisa.


AMETZAGAIÑA.

Ametzagaiña Taldeak hizkuntzaren ingeniaritzan hasieratik orain arte egindako bideak helburu nagusi bat duela esan daiteke, eta hau, sistema informatikoak esaldiak ulertzea da. Ildo honetan, Kapsula deituriko produktu teknologikoa sortu du eta honek hitzen lematizazio automatikoa egiten duenean, automatikoki jasotzen diren hainbat datu gaur indarrean duten bilaketa-sistemarako beharrezkoak ez badira ere, laster helduko zaion analisi semantikoan garrantzi berezia izango dute. Hortaz, euren tresna eta teknologiak prozesu ebolutibo jarraian kokatu dituzte eta bilatzaileak hasieran oso esaldi sinpleak baino ulertuko ez baditu ere, prozesu geldiezin horretan esaldi gero eta konplexuagoak eta beste hizkuntza batzuetan idatzitakoak ere ulertzen joango da.
Ildo honetan, Kapsularen robot web-bilatzaileak, urte honen bukaerarako baliabide garrantzitsu bat izango du, hots, web-orrietan eskuratutako informazioaren katalogazioa automatikoki egitearena. Lehen unean baliabide hau euskarazko informazioarentzat soilik izango da, baina datorren urtean zehar gure kulturan eragina duten hizkuntzentzat ere inplementatzen hasiko da. Honela Kapsula sisteman oinarritutako bilatzaileek, berme teknologikoa eskainiko die bai sistemetako administratzaileei, baita erabiltzaileei ere; batzuek informazioa lortzeko eta antolatzeko tresnak izango dituzten bitartean, besteek kontsulta gero eta zehatzagoak egiterik izango dute.


IXA TALDEA.

IXA taldeak jorratu eta jorratzen dituen ikerketa-lerro nagusiak hiru arlotan bana daitezke erabilgarritasunari begira: oinarriak, tresnak eta aplikazioak. Lehenari dagokionez, oinarrizko tresna linguistikoak ikertzen dituzte, hala nola, datu-base lexikala, testu-bildumak eta hauek prozesatzeko tresnak. Tresnei dagokienez, aplikazioak egiteko erabiltzen diren tresna orokorrak honakoak dira: lematizatzailea, analizatzaile sintaktikoa, desanbiguatzaile semantikoa eta abar. Ixa taldeak edota beste enpresek erabiltzeko aplikazioak zuzentzaile ortografikoa, estilo zuzentzailea, Web bilatzaileak eta hiztegi adimendunak dira batik bat.
Iñaki Alegria Ixa taldeko kideak adierazi digunez, "unibertsitatean gaudenez lehen bi arloak dira inportanteenak guretzako. Aplikazioak hutsuneak betetzeko edo enpresekin lankidetzan garatzen ditugu. Horrela Xuxen Hizkia eta Uzeirekin lankidetzan garatu da eta Web bilatzailea Plazaguneak garatu du guk garatutako zenbait teknologia integratuz".
Ixa taldeak garatu duen bilatzaileak lematizazio bidez bilatzen du euskarazko testuetan, baina talde kideek zaila ikusten dute beste hizkuntzetarako baliatzea.
Garatzen duten aplikazioetan ezagumendu linguistikoa oso garrantzitsua da eta hori euskararako garatu da. Prestatutako programek, batzuetan, aukera ematen dute beste hizkuntzetan aplikatzeko baina hizkuntza horietarako ezagumendu linguistikoarekin osatu beharko litzateke. Alegriaren ustez, "gure lana baino gurekin aritzen diren enpresen lana dela esango nuke gure teknologia beste hizkuntzetarako baliatzea".


GIZARTERATZEA ETA KOMERTZIALIZAZIOA.

Ixa taldea unibertsitateko irakasleek osatzen dutenez, produktuen gizarteratzea edo komertzializazioa enpresen bidez garatu nahi dute. Beraien ideala da enpresekin elkarlanean aritzea eta enpresen lana litzateke komertzializazioa. Enpresarik ez badago horretan interesaturik taldeak berak merkaturatzen du baina salbuespen gisa. Alegriak dioenez, tresna horiek garatzea garestia izaten da, eta euskararen inguruko merkatu txikiak enpresei ez interesatzea eragiten du, laguntza publikorik ez badago behinik behin.
Euskarak eta euskal gizarteak ingeniaritza linguistikoaren alorrean dituen premia gisa segidakoak irizten ditu Iñaki Alegriak.
Oinarriak eta tresna orokorrak garatzen dituzten neurrian horretan sentitzen dute behar handiena: Erreferentzia-corpus zabal, landu eta publiko bat, analizatzaile morfologiko, sintaktiko eta semantiko orokorrak eta horiek eraiki ahal izateko hainbat lan linguistiko sakon: euskararen sare semantikoa, aditzaren azpikategorizazio osoa... Hori eginda aplikazioak garatzea askoz errazagoa omen da. Aplikazioen munduan erabiltzaileek agintzen dutela dio Alegriak "baina hona hemen datorren urtetan garatu beharko diren batzuk: itzulpenerako laguntzak, terminologia lantzeko tresnak, estilo-zuzentzailea eta euskara ikasteko sistema aditua". Hau guztia testuen gainean, ahotsarekin sartuz gero beste hainbat behar dago eta beste talde batzuk daude horretan lanean.
Ixa taldeak garatu duen Xuxen zuzentzaile ortografikoari dagokionez, hil honetan Euskaltzaindiaren azken arauak jasotzen dituen bertsioa aterako da, azaro-abenduan Mac-erako bertsioa eta 2001eko hasieran Xuxen3 zenbait berrikuntzarekin.


Azkenak
2024-12-30 | Jon Torner Zabala
Euskal selekzioaren ofizialtasuna lortzeko lehen urratsa, Nazioarteko Pilota Federazioak haren alde bozkatuta

Euskadiko Euskal Pilota Federazioa eskubide osoko kide izatea onartu du Nazioarteko Pilota Federazioak, larunbatean Iruñean egindako batzarrean. Ofizialtasuna lortzeko bidean urrats handia da, "lorpen historikoa", Euskadiko Federazioak adierazi duenez, baina... [+]


2024-12-30 | Patxi Aznar
Hilketak, arma-eskalada eta ondorioak

Abenduaren 26an, aireko eraso batean, Israelgo armadak bost kazetari palestinar hil zituen. Haiekin 130 kazetari palestinar hil zituzten. Albiste horrek gauza pare bat gogorarazi dizkit, lehenengoa, benetako kazetariek jasaten duten jazarpena munduko edozein lekutan, adibidez,... [+]


2024-12-30 | Rober Gutiérrez
Gazte landunen %51k

Azken hilabete hauetan hainbat institututan lan egitea egokitu zait eta, uneren batean edo bestean, ikasleekin lan merkatuak eskaintzen dituen aukerez hitz egin behar izan dut. Ikasleen tipologia askotarikoa da eta hiri berean asko aldatzen da auzo batetik aldamenekora,... [+]


2024-12-30 | Josu Jimenez Maia
Izenorde guztiak

Historikotzat nekez har daitekeen argazkiaren erdian agertzen den neskatoa idazten ari da, zer eta izenorde zerrenda bat: ni, zu, hura, gu, zuek, haiek. Beherantz begira egonik, neskatoaren begirada nolakoa den antzeman ezinik gelditu naiz ni.

Argazkilariaren lanari soraio,... [+]


2024-12-30 | Julene Flamarique
Militarrek “botak zintzilikatu” zituzten Bilbon Inuzente-egunean

Larunbatean Irala auzoko koarteleko ekintzarekin, #BotaKuartelak koartela eta armada guztiak desagertzea eskatu du. Gune horiek “benetako mehatxuetatik” babestuko dituen auzorako proiektuetara bideratzeko proposatu dute beste behin ere, hala nola desberdintasunetik,... [+]


2024-12-30 | Julene Flamarique
Gazan hil dituzten milaka haurren izen-abizenak irakurri dituzte 30 orduz jarraian Iruñean

Hondakinen artean oraindik identifikatu gabe dauden Palestinarrak ere ikusarazteko helburupean egin dute. Israelek Gazan 18.000 adingabe hil ditu urriaren 7az geroztik. BDZko Elisa Huarteren arabera, “zerrendetan oraindik ezezagunak diren izenak irudikatzen dituzten marra... [+]


2024-12-30 | Leire Ibar
Eraso arrazistak salatu dituzte Arrigorriagan eta Baionan

Arrigorriagako Udalak elkarretaratzea egin du igandean udaletxeko plazan, ostiralean txinatar jatorriko merkatari batek bere dendan jasandako erasoa salatzeko eta biktimari babesa adierazteko. Horrez gain, Ipar Euskal Herriko Kontseilu Sozialistak elkarretaratzea antolatu du... [+]


Joseba Asiron
“Haur eskoletan euskarazko eskaria eta eskaintza parekatzeko negoziazio bidean gaude PSNrekin”

"Erorien Monumentuaz sozialistekin akordioa lortu izan ez balitz, eraikinak bere horretan jarraituko luke aurrerantzean ere eta hori zen guk onartzen ez genuen aukera bakarra”. Hala dio Joseba Asironek. Entzun elkarrizketa osorik hemen sakatuta.

 


2024-12-30 | ARGIA
Osasun asegurua du Araba, Bizkaia eta Gipuzkoako biztanleen ia laurdenak

EAEko biztanleen %23,9k osasun asegurua zeukan kontratatuta 2023an, Eustaten datuen arabera. 2021eko datuekin alderatuta, %4,1 gehiagok. Batez ere traumatologia, oftalmologia, ginekologia eta dermatologia kontsultak egin ziren. Aseguruen %61,3 enpresentzakoak edo bestelako... [+]


2024-12-30 | Ahotsa.info
Hatortxu Rocken azken aurreko edizio jendetsua Atarrabian euskal preso eta iheslarien etxeratzearen alde

Milaka lagun elkartu dira Hatortxu Rock elkartasun jaialdiaren azken aurreko edizioan. Euskal preso politikoen senideei babesa eta sostengua emateko sortutako jaialdiak agur esanen du 2025ko udan Lakuntzan eginen den azken edizioarekin. Sakabanaketarekin amaitzea lortu bada ere,... [+]


2024-12-30 | Jon Torner Zabala
‘Bagare’: euskararen eta euskal nortasunaren aldeko ereserkiak 50 urte

1974ko abenduan sortu zuten Bagare kanta Gontzal Mendibil zeanuriarrak eta Bittor Kapanagak, haren Olaetako (Aramaio) baserrian. Euskararen eta euskal nortasunaren aldeko ereserki bilakatu zen gerora.


2024-12-30 | Behe Banda
Barra warroak |
Urte berriari

Begi bistaz zentzugabea dirudien eztabaida batekin hasten da zutabea: 2024 gure literatur ale horietako bat balitz, nola deituko zeniokete?

Erantzunik topa ezean, ordu erdi ematea aurtengo bizipenei begira; Instagrameko artxibatuetan sartu lehenik, eta Twiterrera pasa horiek... [+]


Eguneraketa berriak daude