viernes, 16 de julio de 2010

Lingüística computacional (XIII y último)



El capítulo anterior de esta serie puede verse aquí.

We’ve all heard that a million monkeys banging on a million typewriters will eventually reproduce the entire works of Shakespeare. Now, thanks to the Internet, we know this is not true.

Todo hemos oído que un millón de monos tecleando en un millón de máquinas de escribir pueden llegar eventualmente a reproducir la obra completa de Shakespeare. Ahora, gracias a Internet, sabemos que esto no es cierto.

Esta célebre frase de Robert Wilensky pronunciada en 1996 tiene una primera lectura referente a la crítica que debe hacerse a la mala literatura que se hace/hacemos en Internet.

Pero nos permite también reflexionar sobre si es posible una literatura digital.

En los capítulos anteriores hemos analizado cómo el lenguaje puede modelizarse mediante gramáticas formales; cómo pueden establecerse corpa que pueden luego examinarse mediante la fuerza bruta y la velocidad de los procesadores electrónicos; cómo pueden generarse frases correctamente construidas; traducir de un idioma a otro; emitir sonidos inteligibles; reconocer la voz; etc. Pero todo esto no nos permite crear literatura. La literatura es mucho más. Es una sucesión de texto con un sentido, con una idea, con un estilo, con un camino determinado por alguien para que ese camino- y no otro- nos emocione (ver comentarios aquí y aquí ).

¿Puede hacer esto un ordenador? ¿Puede crearse un algoritmo que sea capaz de inventar una historia o un poema que puedan competir con un ser humano? En 1726, Swift en Los viajes de Gulliver ya imaginaba una máquina capaz de crear literatura.

Aunque han aparecido intentonas en el mercado en este sentido (aquí por ejemplo ) la realidad es que, hoy por hoy, no existe ninguna aplicación informática que se acerque a la creatividad e inventiva humana para generar historias y textos de calidad. Existen algunos programas que son capaces de efectuar tareas muy particulares (como por ejemplo, hacer resúmenes de textos o generar partes meterológicos razonables) pero cuando nos adentramos en el campo de la literatura no encontramos soluciones a pesar de tratarse de un campo de notable estudio y experimentación.

¿Qué ocurre entonces con el axioma del encabezado? Por simple estadística, si dejamos a los monos (aunque hagan falta muchos millones) tecleando los años suficientes (y una buena dosis de plátanos para incitarles a hacerlo), alguno de ellos debería producir, si no las obras completas de William, al menos algún par de páginas de indiscutible calidad. Esta asunción es conocida como el teorema de los infinitos monos. Al fin y al cabo, es como funciona la evolución. Se dejan una serie de moléculas químicas inertes que se combinan al azar y, al cabo de unos pocos miles de millones de años, ese azar ha creado los peces, las azáleas, los dinosaurios, la resistencia de Zátopek y la impresionante belleza de Rita Hayworth. Más fácil parece escribir un par de buenas páginas. ¿Puede un ordenador crear literatura?


La fuerza bruta

Los monos son lentos (y las bananas escasas) pero un ordenador es extremadamente rápido y no come más que electricidad. Podemos pensar que usando una gramática formal nos lanzamos a crear frases gramaticalmente correctas con un algoritmo matemático. Digamos un par de millones de sentencias por segundo. En un año ese ordenador habría generado casi setenta billones de frases correctas. Pongamos que otro ordenador se dedica a combinarlas al ritmo de cien mil combinaciones por segundo. En un año podría haber generado más de 3 billones de combinaciones. ¿Y ninguna de estas sería buena? ¿Y si en vez de tener un ordenador, hacemos funcionar una red de un millón de ellos, muchísimos menos de los que existen en el mundo? ¿Nos sorprenderíamos viendo en pantalla El Rey Lear?

La realidad es que esto no ocurre. La realidad es que estos algoritmos que recurren a la fuerza bruta consiguen por lo general mala prosa o mala poesía. Mala y breve. Hay muchos intentos de crear literatura por la fuerza bruta (por ejemplo, los Oulipoemas aquí aunque en este caos los versos han sido escritos por humanos. El ordenador sólo los combina).

¿Qué ocurre entonces? ¿Acaso el cerebro humano dispone de un mecanismo literario que no puede ser recreado por un ordenador? ¿Hay un alma intangible creadora?¿La musa existe?

Se trata de un problema estadístico. Por fuerza bruta nunca conseguiremos recrear las obras de Shakespeare ni las de Moliere ni las de Espronceda. Hagamos uso de un poco de matemáticas.

Imaginemos una novela de cualquier escritor actual de 500.000 caracteres, algo bastante habitual. Estos caracteres incluyen las letras, los números, los espacios y todos lo signos de puntuación. De acuerdo a las codificaciones ASCII podemos decir que hay 45 caracteres diferentes a combinar (olvidémonos de las mayúsculas ahora para simplificar). Vamos a poner a nuestros monos a trabajar para ver si son capaces de reproducir –simplemente por azar- esta novela creada por un humano.

La probabilidad de que el mono teclee un carácter al azar es 1 entre 45, o sea 0,0222. Y que después teclee otro carácter es la misma, también 0,0222. El que teclee los dos caracteres correctos uno tras otro es de 0,022 elevado al cuadrado, o sea 0,0004928.

Pero tenemos que teclear 500.000 carecteres en un orden correcto. Entonces, la probabilidad de que esto ocurra es:


O sea, aproximadamente un uno dividido entre ochocientos mil ceros. Ninguna calculadora del mundo nos mostraría esa cifra tan pequeña ni siquiera en notación exponencial. Es decir, necesitamos teclar un uno seguido de 800.000 ceros de veces para reproducir por azar la novela

Supongamos que nuestro mono presiona una tecla por segundo. El universo, desde el big bang, lleva existiendo 15.000.000.000 de años, o sea, 4.7 seguido de “sólo” 17 ceros. ¡Pero necesitamos ochocientos mil ceros!!, es decir, nuestro mono precisaría el tiempo de cicuenta mil universos seguidos .

De acuerdo, de acuerdo. El ordenador es mucho más rápido que Cheetah. Digamos que es capaz de generar diez millones de letras por segundo. ¡Ah, esto es otra cosa!. Pero, desilusión, en todo el tiempo que lleva nuestro universo un ordenador habría generado un uno seguido de 24 ceros. Aún, necesitaríamos un universo treinta y cuatro mil veces más largo que el actual.

Imposible usar la fuerza bruta para crear literatura al azar.

Creación de textos por modelos

Se trata de una técnica usada para generar peomas sobre todo. Un algoritmo que permite una variedad de oraciones ya que, en vez de combinar frases preprogamadas para formar oraciones largas, se usan palabras que encajan en modelos de versos predeterminados.

Estos modelos (que en terminología inglesa suelen recibir el nombre de pattern o de template) son moldes en los que existen huecos que deben llenarse con ciertas palabras, elegidas de entre las de una lista. Algo así como si se tratara de encajar piezas de un puzzle al que se le han quitado algunas, quedando libres huecos en los que sólo caben ciertas fichas.

Así, por ejemplo, a partir de la frase:

Una oropéndola, eso eres. Como el manantial ansioso de la silenciosa poesía

Podríamos crear el siguiente molde:

PALABRA 1 , eso eres. Como el PALABRA 2 PALABRA 3 de la PALABRA 4 PALABRA 5

PALABRA 1 podría ser elegida de una lista, tan larga y variada como queramos, de sustantivos (una oropéndola, en el ejemplo). PALABRA 2 de una lista de sustantivos masculinos en singular (manantial, en el ejemplo). PALABRA 3 de una lista de adjetivos en masculino. PALABRA 4 de una lista de adjetivos femeninos y PALABRA5 de una lista de sustantivos femeninos.

Igualmente sería posible definir moldes que contuvieran verbos:

Una caricia muere calmadamente entre marinos que cantan

Se convertiría en:

Una- SUSTANTIVO FEMENINO-VERBO EN TERCERA PERSONA SINGULAR DEL PRESENTE DE INDICATIVO-ADVERBIO- entre- SUSTANTIVO MASCULINO PLURAL- que- VERBO EN TERCER APEROSNA DEL PLURAL DEL PRESENTE DE INDICATIVO.

Podríamos definir miles de moldes, de templates y listas de miles de palabras. Incluso, estos moldes se pueden copiar de autores humanos célebres para que su estructura sea aún mejor. Y el Corpus de palabras (los Corpa, para ser exactos, puesto que cada lista sería un mundo independiente) podría ser tan extenso como se deseara. Con esos mimbres, basta un código sencillo que vaya rellenando los moldes de manera aleatoria. Los versos unitarios creados serán más o menos buenos en función de la fortuna del azar. Cuanto más extensas sean las listas y más moldes haya, más variados y creativos serán los ripios.

Más información

Concatenación de frases

En el habla común podemos generar oraciones relativamente complejas concatenando frases sencillas. En aras a la sencillez este algoritmo construirá siempre oraciones compuestas por cuatro unidades básicas. Ello producirá una rutina que hará que el texto resulte aburrido pero que, a efectos de lo que se pretende mostrar, es más que suficiente. Un programa más complejo debería combinar diversos modelos de oraciones y alternarlas de acuerdo a un patrón no reconocible (por ejemplo, utilizando una variable aleatoria) con lo que se rompería la monotonía.

En nuestro sencillo caso, las oraciones podrían por ejemplo construirse siguiendo un esquema A-B-C-D donde A sería un sintagma preposicional, B contendría el sintagma nominal, C el sintagma verbal y D un sintagma adverbial o adjetival. No es nada novedoso. Este tipo de formas de crear oraciones ha existido desde hace mucho en papel. Hay un libro de Didier Noyé titulado ” Réunionite : guide de survie en el que usa esta técnica para crear discursos insignificantes pero aparentemente contundentes en el área de gestión de empresas. Cortazar y Mozart ya usaron el sistema tanto en literatura como en música. No siendo nada nuevo, el método nos servirá para mostrar la técnica.

Veámoslo con un ejemplo:

“En cualquier caso, la utilidad de la literatura digital podrá ser analizada con detalle en un futuro cercano”

La descomposición de unidades sería:

A= En cualquier caso,
B= la utilidad de la literatura digital
C= podrá ser analizada con detalle
D= en un futuro cercano.

La particularidad de este tipo de subcadenas unidas es que pueden variarse casi a voluntad y siempre encajarán razonablemente en la oración. Así, supongamos que tenemos otro subconjunto “B” que dijera “la calidad de tal poesía”. Podríamos sustituir la “B” anterior por la nueva “B” y nos quedaría la oración:

“En cualquier caso, la calidad de tal poesía podrá ser analizada con detalle en un futuro cercano”

Que es también una oración inteligible y bien construida aunque carezca de contenido y significado real. Imaginemos, ahora, que tenemos sólo diez cadenas de cada uno de los cuatro tipos. Las combinaciones posibles serían diez mil sentencias distintas. Si tuviésemos cien de cada tipo, las combinaciones ascenderían a cien millones, más que suficiente para crear largos y soporíferos discursos o tediosas descripciones.

Más información aquí

Informes científicos falsos

En el MIT se desarrolló un célebre programa (http://pdos.csail.mit.edu/scigen/#examples ) con el que unos estudiante lograron que revistas de prestigio les publicaran ponencias generadas por ordenador auténticamente inconsistentes (bogus text). Y, asimismo, existe investigación sobre software que detecte los escritos generados automáticamente aparentemente correctos, pero carentes de sentido para desenmascararlos (http://www.physorg.com/news65101797.html).%3cbr.

En estos casos se usan combinaciones de modelos y concatenación de frases predeterminadas que se formatean con dibujos y gráficos para aprentar ser un escrito científico auténtico.

Eliza

Eliza, de Joseph Weizenbaum fue programado en 1966 y supuso una revolución el la generación de diálogos. Tuvo multitud de copias pero pronto se vieron sus limitaciones y no pasó de ser un divertimento.

Eliza simulaba ser un psiquiatra que contestaba a las frases que el usuario realizaba. Por ejemplo, este es un diálogo típico:

> Hello, I am Eliza.
* Life is hard
> Don't you ever say Hello?
* well, I am worried
> How long have you been worried?
* for years
> OK... "well, you are worried". Tell me more.
* I need sucess and money
> What does that suggest to you?
* that I am a looser
> Did you come to me because you are a looser?
* yes
> I see.

Puede verse que se trata de una conversación aparentemente racional. Es un espejismo. En cuanto se escribe algo un poco raro, el programa entra en un bucle de frases comodín y repetitivas.

Puede probarse una de las múltiples versiones de Eliza en la red, aquí.

Eliza (que es más fácil de programar en inglés que en castellano debido a que no hay género en la mayoría de las palabras y que la declinación verbal es muy sencilla) se basa en una base de datos de palabras y expresiones típicas. Cuando un usuario escribe una pregunta o un comentario, el algoritmo busca en esa base de datos si existe totalmente o parte. Si no encuentra nada, devuelve una frase que incite a seguir (por ejemplo, Come on o I see o that’s interesting). Si encuentra algo que sí está en la base de datos, construye una frase que usa una parte predeterminada por un modelo y le añade alguna de las palabras de lo introducido por el usuario, de modo que la frase final parece relacionada con la entrada.

Imaginemos, por ejemplo, que tenemos esta base de datos:

- Tristeza, triste -> ¿Por qué está usted triste?

- Alegría, alegre -> ¿Qué le hace sentirse alegre?

- Me siento * -> ¿Es importante para usted sentirse *?

Ahora, si el usuario introduce el texto:

Me siento triste

El algoritmo detectaría que triste está en la base de datos y contestaría con ¿Por qué está usted triste?

Si el usuario introduce :

Me siento fatal

El algoritmo detectaría que esta frase es del tipo “me siento”+”algo” . Tomaría ese “algo” (en este caso “fatal”) y lo añadiría a su frase hecha del modo:

¿Es imporante para usted sentirse fatal?

Dando la impresión de que el ordenador ha entendido y contesta.

Generador de novelas de Brown

Crea tu propia novela de Dan Brown (http://probar.blogspot.com/ ) es un inteligente y divertidísimo programa que genera reseñas de ficticias novelas al estilo de Dan Brown, añadiendo incluso la portada del supuesto libro y una pequeña crónica de un destacado diario. Técnicamente se base en introducir palabras, elegidas aleatoriamente, en frases predefinidas. Un método sencillo que sin embargo da magníficos resultados.

Otros ejemplos

Pueden citarse Los destellos aristocráticos y las alas soberanas profanan la justicia de Baudot, un trabajo de poesía electrónica de los años sesenta; Mell de Firner; Erato de Milic; Passage de Bootz; La pyramide truquée de Debyser; Poetry Generator de West; Tale Spin de Meehan;Hamilton Diamond de Johnson; By love insured de Chait; Stochastische Texte de Lutz y Bense (que generaba poesía a partir de la gramática de Chomsky); Silence on brúle de Denjean; Jus d'orange de Debyser;Shanghai Paris de Baboulin; el programa RENGA del Centro Pompidou que generaba un texto nuevo cada minuto;los trabajos del grupo ALAMO (Atelier de Littérature Assistée para la Mathématique et les Ordinateurs); Poemas V2 de Carmona; el robot PaCo de Corpa y Serrano, una máquina humanoide que imprimía poemas; WasPo un generador de poesía en estilo del siglo de oro programado por Gervás; etc.

¿Puede un ordenador entender la narrativa?

Hasta ahora hemos hablado de que un ordenador pueda escribir una novela pero cabe preguntarse si, en el sentido inverso, podría entenderla.

Los sistemas cognitivos caen dentro de la esfera de la inteligencia artificial y exceden lo que aquí puede explicarse pero recomiendo leer este artículo .

Internet colaborativo

¿Y si sustituimos los monos por personas que escriben colaborativamente, al modo de un cadáver exquisito? La Red permitiría que millones de personas (que además no teclean al azar sino que aportan su creatividad humana) pudieran colaborar en crear una novela literaria de alat calidad. Se han hecho intentos más o menos extensos (hay algunos ejemplos en Biblumliteraria ) pero ninguno hasta la fecha ha conducido a una obra que pueda siquiera aproximarse a los grandes trabajos humanos. De modo que la aseveración de Robert Wilensky con que abríamos este post parece confirmarse.

Computación de la narrativa

Supuesto que disponemos de un método para generar texto de calidad es necesario, asimismo, estudiar qué reglas y qué factores afectan a la consecución de una buena historia. ¿Cómo deben ser los personajes? ¿Qué subtramas deben derivarse de la historia principal? ¿cómo se interconectan entre sí y en qué momentos de la narración? ¿qué conceptos de sentido común deben tenerse en cuenta - y memorizarse en la base de datos del ordenador- para que el contexto sea correcto? ¿cuál es la jerarquía de eventos? ¿Cuál es el propósito de la trama? ¿Qué debe ocultarse para que haya intriga? En definitiva, aquellos aspectos que afectan a la literatura convencional que se tornan más complicados aún a la hora de programarlos. Es un campo en que no se ha avanzado mucho.

Un texto interesante al respecto puede leerse aquí.

Hoy en día parece que resultará extremadamente complicado simular la capacidad de inventar cuentos e historias del cerebro o quizá sea cuestión de tiempo y de que alguien, algún día, dé con un algoritmo y un método que puedan simular la capacidad literaria humana con éxito. Sin duda, será la lingüística computacional la disciplina que será decisiva para conseguirlo.


FIN DE LA SERIE

Vía Biblumliteraria...








Share/Save/Bookmark

miércoles, 14 de julio de 2010

De la página a la pantalla. Seminario en Londres



    El recién pasado 12 de Julio tuvo lugar en la Kingston University de Londres un taller y mesa redonda con el título From the Page to the Screen to Augmented Reality: New Modes of Language-Driven Technology-Mediated Research.
    Como conferenciante principal intervino Jay David Bolter, creador junto a John B. Smith y Michael Joyce de Storyspace, un programa de software para crear y editar ficción hipertextual. Su intervención llevaba el título: Elite and popular: digital art and literature in an era of social and locative media. Entre los participantes en la mesa redonda destacamos la presencia de Laura Borrás, de la Universidad de Barcelona.
    Ya en la misma presentación del evento se plantea uno de los retos claves de la literatura electrónica: "La relación entre la literatura digital y la comercial (mainstream) siempre ha sido complicada. A pesar del creciente cuerpo de trabajo creativo, los autores digitales todavía tienen dificultades para atraer la atención de lectores y críticos."
    El taller-mesa redonda convocaba, entre otros, a investigadores, escritores, teóricos y profesionales que usan las nuevas tecnologías y que han migrado desde prácticas más tradicionales basadas en la imprenta a los métodos multimediales e interdisciplinarios que utilizan ordenadores, redes sociales o tecnologías de teléfonos móviles.
    Seleccionamos algunas  cuestiones que plantean los organizadores.

    1.- ¿Qué nuevas oportunidades de expresión introducen las nuevas plataformas tecnológicas en la ficción, la poesía y el arte?

    2.- ¿Cómo cambia la literatura electrónica las relaciones entre el autor, el lector y el texto?

    3.- ¿Qué relevancia tienen la estética, los conceptos y las teorías de vanguardia en la estética digital de los nuevos medios?

    4.- ¿Cómo funcionan los procesos creativos individuales en el entorno colaborativo de la red?

    5.- ¿Qué efectos tiene la tecnología en la práctica de escribir?

    6.- ¿Cómo podría el surgimiento de dispositivos táctiles cambiar nuestro modo de crear y experimentar el arte literario basado en el lenguaje?

       Como ocurrió en el último congreso de la ELO, o en el de Toronto, o en muchos otros sobre literatura electrónica, me temo que no debemos esperar  algo parecido a unas Actas que reflejen los contenidos aportados por los participantes y las ideas intercambiadas en la discusión. Lo que es de rigor en otros encuentros académicos de especialistas, parece imposible en eventos que precisamente atañen a las nuevas tecnologías y que cuentan con equipos que podrían fácilmente publicar sus materiales en la red. En casa del herrero, cuchillo de palo.
     De todas formas, para responder a estas preguntas no bastará con escribir tratados  o análisis anticipatorios, dentro de poco tiempo las respuestas estarán tan a la vista que siempre habremos pensado que ya las sabíamos. 
Entrada publicada por Juan José Díez

Share/Save/Bookmark

lunes, 12 de julio de 2010

Y lloró Jesús

 
   
     No sé nada de Mike Cane, excepto que vive en Satan Island, NY. Esto es lo que declara en su perfil de Twitter. También sé que abandona sus blogs periódicamente y abre otros nuevos, que muchas veces vuelve a abandonar. Que sus blogs abandonados son deshechos de la red que algunos seguimos visitando y escarbando en busca de inspiración. Y que escribe como los ángeles caídos.     Mike y yo apenas hemos tenido algún que otro intercambio epistolar. Él sostiene que los ebooks bobos deben morir. Yo, en cambio, sostengo que los ebooks no pueden morir pues no existen. Pero sus ebooks bobos y mis ebooks inexistentes son una y la misma cosa. Los ebooks bobos de Mike Cane bien podrían ser ebooks mudos. Y de lo que no existe ya sabemos que calla.

     En posts anteriores, y tan temprano como en 2002, he sostenido la importancia de los metadata para que todo lo contenido en los libros (el 85 % del saber archivado por el hombre, contra el 15 % que hoy encontramos en la Red) sobreviva. Y he dicho una y otra vez que es la sociedad de redes la que le está exigiendo a la palabra volverse líquida para entrar en los flujos de una economía global construida en base a metadata. No es la palabra la que se niega a esta transformación, sino quienes la detentan. Lo hacen a través de estrategias que llevan el nombre de plataformas propietarias, sean los app-books del censor Steve Jobs o las torpezas encaradas por Libranda. Lo que obtienen como resultado son productos risibles, libros mudos, imitaciones de la página bidimensional o, peor aun, de los fracasados CD-Rom de los años 90. Y después dan entrevistas a la prensa en las cuales se ríen de lo que ellos mismos construyen.

     Este post será largo, porque reproduciré aquí las 81 etiquetas que Mike Cane ideó como punto de partida para que los ebooks dejen de ser bobos, mudos, inexistentes. Las 81 etiquetas que salven a los libros de los editores. Quien llegue al final de la lista sin perder la fe, puede considerarse un editor del futuro.

     Lo que Mike describe a continuación es una oración de tres palabras:

     Y lloró Jesús.

     Estas tres palabras contienen más información de la que la mayoría de la gente (y de los editores) imaginarían. Y es ésa la información que debe ser extraída: la información oculta que constituye el basamento de lo que ha de ser un ebook. Lo que la sociedad de redes le exigirá que sea. Ni Mike Cane ni yo somos especialistas en markup y lo que se propone aquí es un boceto de los fundamentos.

     Y lloró Jesús.

book-title=Santa Biblia Cristiana
sub-book-title=Evangelio según san Juan
book-author=X
book-editor=X
book-publisher-company=X
book-publisher-company-country=X
book-publication-year=X
book-copyright-year=X
book-publication-country=X
book-type=religioso
book-origin-language=griego
book-translated-language=español
book-edition=ReinaValera antigua
book-origin-publication-year=X
book-origin-publication-month=X
book-origin-publication-location=X
book-edition-publication-year=X
book-edition-publication-month=X
book-edition-publication-location=X
book-series=X
book-series-number=X
book-dedication=X
book-acknowledgement=X
book-footnote=X
book-sidebar=X
book-caption=X
book-photo-caption=X
book-part=Nuevo Testamento
book-chapter=11>
book-area=verse 35
book-paragraph-number=#
book-sentence-number=#
chapter-paragraph-number=#
chapter-sentence-number=#
factual-person-name=Jesús
factual-person-name-alt-01=Joshua
factual-person-name-alt-02=Yeshua
factual-person-sex=masculino
factual-person-identity=hombre
factual-person-age=32
factual-person-eye-color=X
factual-person-hair-color=X
factual-person-skin-color=X
factual-person-nationality=X
factual-person-role=líder
factual-person-occupation-01=carpintero
factual-person-occupation-02=predicador
factual-person-race=semita
factual-person-religion-01=judaismo
factual-person-religion-02=judío
factual-person-label-01=Mesías
factual-person-label-02=Hijo de Dios
factual-person-label-03=Hijo del Hombre
factual-person-label-04=La Palabra
factual-person-label-05=Cordero de Dios
factual-person-label-06=Salvador
factual-person-label-07=Rey de Reyes
factual-person-label-06=Señor
factual-person-father=José
factual-person-mother=María
factual-location-galaxy=Vía Láctea
factual-location-planet=Tierra
factual-location-nation=Israel
factual-location-city=Jerusalem
factual-location-rule=Romana
factual-location-politics=Imperial
factual-location-ruler=Poncio Pilatos
factual-location-year=32
factual-year-designation=E.C.
factual-local-time=día
factual-local-time-hour=desconocida
action-01=llorar
action-02=sollozar
body-item-implied=ojos
body-item=lágrimas
emotion-01=pena
emotion-02=pesar
emotion-03=decepción
emotion-04=frustración
emotion-05=simpatía
emotion-06=empatía

     Si esta es la información que necesitamos proporcionarle a las máquinas para que aprendan a leer tres palabras, ¿cuántas harían falta para que pudieran leer un párrafo entero?

     Los que abandonaron la lista de etiquetas cuando llegaron a la caracterización de la galaxia no pasarán la prueba para ser los editores del futuro, porque no han entendido que el etiquetado también puede servir para un libro de astronomía. Ni tampoco han entendido que si el personaje fuera el etiquetado también serviría para catalogar un libro de ciencia ficción.

     Toda esta información oculta que se vuelve explícita es la que transforma un ebook inexistente en un ebook. De objeto digital bobo a objeto inteligente. Pero es más, también es posible, a partir del etiquetado, relacionarlo con otros objetos similares de formas que hoy no son posibles y, además, los convierte en objetos "buscables" (y hallables) en la infinita Red. Un etiquetado de esta naturaleza permitiría al lector hacer búsquedas como éstas:

Todos los libros de suspense ambientados en Los Ángeles en 1945.


Todos los libros de ficción ambientados en Marte en cualquier año, publicados entre 1940 y 1960.


Todos los libros con el Cid Campeador como personaje ficticio.


Todos los primeros párrafos de todos los libros publicados en el mes de mayo de 2009.

     Y un largo etcétera.

     Hoy, como lo demuestra la entrevista con 4 editores mitológicos (y no tanto) que se cita más arriba, la jerarquía de la edición termina, justamente, en el editor. No más tarde que hoy, la editora de Barataria, durante el Seminario de ARCE sobre la edición cultural y su salud (o falta de salud) en España, se erigía en el pináculo de esa estructura jerárquica: "El editor no puede delegar nada", decía, relacionado con el alma y la misión de la editorial. Pero si los libros han de sobrevivir, serán estos metadata sus billetes de entrada a la vida de la información que se guarda en las bases de datos. Y esos metadata no los manejan los editores; los manejan los geeks. Serán los geeks quienes establezcan los estándares que permitan a la palabra entrar en la sociedad de redes y no quedar rezagada en la inmovilidad arquitectónica de la página impresa o, lo que es peor, en la inmovilidad del travestismo digital de Libranda.

     La creación de estos metadata es costosa, implica mucho trabajo y mucho tiempo. Pero también es verdad que su valor se acrecienta con el tiempo. Más aun, se acrecienta con el acrecentamiento de la información así vertida. No como sucede ahora, que los demasiados libros le han quitado valor cultural, intelectual y de mercado a los mismos libros. Los metadata serán un negocio de muchos miles de millones de dólares. Y, por lo que vemos, no será un negocio de estos editores.

     Y del lado del lector, el libro así digitalizado pasa a tener un valor que no el cero que hoy le atribuyen tanto los escépticos de la Red como los iluminados de la tecnología. Porque ese libro también será un billete, un billete valiosísimo al saber que nos hace humanos.

     ¿Y han pensado quién sabe hacer que la información haga cosas, que hable, que no sea muda? Sí, ellos. Todavía nadie ha hablado en serio de Google Editions.

Entrada publicada por Julieta Lionetti en Libros en la nube

Share/Save/Bookmark

viernes, 9 de julio de 2010

Lingüística computacional (XII)


El capítulo anterior de esta serie puede verse aquí.

Tagging

Para que un texto sea algo más que unos y ceros almacenados en una memoria, se necesita adjuntarle información adicional. Para hacerlo, se añaden etiquetas (tags) a ciertos trozos de información que den significado semántico y relacional al texto. En el extremo se podría etiquetar cada palabra. Las etiquetas funcionan como metadatos.

Los niveles de etiquetado pueden ser muy diversos:

Nivel 0

Se añade una etiqueta a todo el texto (que puede ser un texto o un sitio en la web o cualquier otro documento completo) con palabras clave. Así, si disponemos de una página en Internet que trate sobre astronomía, podríamos simplemente añadir una etiqueta en que pusiera “astronomía”. Para un buscador o un algoritmo automático sería sencillo buscar esa página cuando algún usuario hiciera una pregunta relacionada con esa temática.

Obviamente, etiquetar con un único concepto es sencillo pero pobre. En el ejemplo anterior, si un lector quisiera encontrar páginas que trataran sobre cosmología, la nuestra no aparecería. Podemos, entonces, etiquetar con un grupo de palabras. En nuestro ejemplo, por ejemplo, “astronomía, cosmología, física del espacio, planeta, estrella, nebulosa, galaxia” con lo que ofrecemos más información sobre el contenido del texto y ampliamos las posibilidades de que un algoritmo encuentre la página para lectores interesados.

En HTML (el lenguaje de programación de páginas web) puede utilizarse la instrucción META precisamente para añadir palabras clave que ayuden a los buscadores a clasificar la página y a hacerla más fácilmente accesible.

Las trampas y trucos están a la orden del día. Webmasters sin escrúpulos que tengan una página sobre economía o ciencia especializada pueden añadir como palabras clave toda clase de términos pornográficos o deportivos por ejemplo sólo para atraer tráfico. Un algoritmo sencillo de búsqueda no sabrá realmente si el texto habla de una u otra cosa porque creerá a las palabras clave.

Nivel 1

Hay etiquetas a lo largo del texto, en función de lo que diga cada párrafo del mismo. Esto permite incluir más información clasificatoria y afinar mucho más las búsquedas.

Nivel 2

Cada párrafo, sistemáticamente, está etiquetado y, además, de palabras clave, dispone de otras informaciones como textos relacionados enlazados, bibliografía similar, información sobre cómo debe visualizarse el texto, llamadas a elementos multimedia, etc.

Las etiquetas pueden también contener información numérica (por ejemplo, en un texto cartográfico, pueden incluirse la latitud y longitud geográfica de un lugar).

También se dan los hash tags que permiten añadir una pequeña frase que será presentada al buscar ese párrafo. Este tipo de frases, además, pueden estar anidadas con otras.

Pueden además existir etiquetas negativas, es decir aquellas que indican de que no trata el texto, con qué no está relacionado. Incluso, pueden existir relaciones probabilísticas determinando si un párrafo está ligado o tienen relación con cierto asunto en un tanto por ciento, dependiendo por ejemplo del grado de coincidencia con la pregunta.

Nivel 3

Cada palabra, imagen o elemento está etiquetado incluyendo categorías morfosintácticas.

Categorías versus etiquetado

Durante mucho tiempo, en las bases de datos se han usado las categorías para memorizar jerárquicamente las informaciones. Por ejemplo, en un sitio de deportes podríamos establecer un entramado de niveles ordenados (categorías) que fueran desde lo más genérico a lo más especializado. En el ejemplo siguiente podríamos ir añadiendo categorías tan profundamente como deseáramos.

La diferencia entre la categorización y el etiquetado es que la primera es jerárquica y el segundo no lo es. Los tags son elementos no jerárquicos asociados a una porción de información determinada y que contribuyen a la descripción de la información en sí, facilitando que dicha información sea recuperada adecuadamente.

La principal ventaja de las categorías es que permiten estructurar la información y permiten que las búsquedas de información sean sencillas y rápidas al poder navegarse por caminos estructurados dentro de la base de datos. El inconveniente es su rigidez. Las categorías deben ser creadas por los programadores ( o por los administradores) y suele ocurrir con mucha frecuencia que se quedan obsoletas ante las necesidades reales de los usuarios.

Las etiquetas, por el contrario, tienen la ventaja de que su flexibilidad. El propio usuario las crea y las usa. No hay que ser experto a la hora de elegir la categoría apropiada para una información. Las categorías se crean y destruyen on-time por cualquiera. Resulta evidente que son una forma interesante de estructurar información en Internet donde millones de usuarios pueden interactuar en un momento dado. Las categorías tienen, no obstante, inconvenientes importantes. Uno de ellos es la explosión de términos que se crea (lo que dificulta la búsqueda), la repetición oculta o la imposibilidad de búsqueda por vía de los homónimos y sinónimos.

Nubes Tag Clouds

Como se ha citado, el sistema de tags tiende a ser explosivo. Pronto, hay cientos de etiquetas y el usuario – o un algoritmo- se siente perdido entre un océano de ellas.
Las nubes de tags permiten ordenar las etiquetas en función de su uso. Gráficamente, aparecen como una nube de términos en los que aquellos que se usan más tienen un tamaño mayor y/o quedan desenfocados o en un plano trasero 3D virtual


Esto hace también que se reduzca el número de tags ya que un usuario al ir a escoger una etiqueta para un nuevo texto tiende a fijarse y usar en aquellos términos de mayor tamaño de la nube, sin inventar otros nuevos.

Folksonomies

Recibe este nombre un sistema de clasificación por etiquetas que se realiza en conjunto por varios usuarios- desde diversas fuentes, aplicaciones y localizaciones. El nombre proviene de una contracción entre “gente” (folks) y “taxonomía” que es la forma clásica de clasificar especímenes en ciencia. Hay un trasfondo estadístico en todo esto. Se espera- y muchas veces sucede- que el etiquetado colaborativo no sea caótico sino que los usuarios vayan concentrando sus elecciones y sus palabras claves en ciertos términos que estadísticamente van tomando peso hasta resultar definitorios de un elemento con toda claridad. De un vocabulario no controlado e inmenso debe surgir un listado claro y corto que permita describir el texto, la imagen o los conceptos. Podríamos aquí considerar las ideas de las redes neuronales o de la teoría de atractores para explicar el fenómeno.

Web semántica

El contenido de este apartado está tomado de aquí.
Las webs 1.0 y 2.0, con su mayor o menor facilidad para volcar contenido en la red y su mayor o menor interactividad, no dejan de ser bases de datos “ciegas”. Cada página es una especie de catálogo que el usuario puede leer y escribir pero que no contiene información acerca de cómo ser usada. Por así decirlo, cada página “no sabe de qué trata ella misma y el ordenador no sabe qué muestra o deja de mostrar”. Las páginas tienen significado para las personas que las leen pero no para los ordenadores que las procesan.
Cuando realizamos una consulta sobre un tema concreto, se nos presentan miles, millones a veces, de potenciales lugares sin orden ni concierto (o, peor aún, con el orden y concierto que da el dinero pagado por las empresas para que las páginas aparezcan en mejores lugares). El algoritmo Page Rank de Google es un intento, aún incipiente, de lograr un mayor acierto en la búsqueda de información ¿Cómo podemos dotar a las máquinas de una cierta inteligencia para que realmente nos muestren aquello que nos interesa? Esta idea, aunque puesta de moda ahora, es tan vieja como la red.
Ese es el objetivo de la web 3.0 (término propuesto por Jeffrey Zeldman más como arma publicitaria que de concepto). Se trataría de añadir a cada página una serie de contenidos semánticos (metadatos) de manera que un programa de inteligencia artificial pudiera evaluar si esa página, y no otra, es la que realmente nos interesa cuando hacemos una consulta. Es decir, añadirle un contenido semántico que pueda ser tratado por máquinas.
Imaginemos, por ejemplo, que queremos encontrar información referida a las novelas de García Márquez que sean de su primera época y que se puedan adquirir por menos de diez euros en alguna librería de nuestra ciudad. Una búsqueda de este tipo, en la actualidad, puede llevar horas y necesitar saltar por cientos de websites. Pero, si cada página contuviese información adicional oculta que la centrara en un interés concreto, podría aparecernos el contenido requerido inmediatamente.
Lograr esto es complejo. Para empezar requiere sistematizar de manera rigurosa el conocimiento, lo que ya de por sí es tarea de titanes (si no, ya tendríamos ordenadores pensantes). Para un humano entender que “hace calor” es inmediato pero ¿cómo hacemos que un ordenador “entienda” ese concepto? ¿cómo lo codificamos? Además, requiere encontrar una vía de simular el pensamiento metafórico del ser humano que llama de diversas maneras a un sólo concepto, algo que aún no se conseguido técnicamente. ¿cómo “sabe” un ordenador que “hace calor”, “¡vaya calor!”, “ hace un día sofocante” es más o menos lo mismo? ¿cómo codificamos esas infinitas formas de decir? En definitiva, se trata de dotar a la máquina de cierta capacidad de razonar. Un campo de investigación, dicho sea de paso, apasionante que no sólo se da en el ámbito de la red sino, sobre todo, en el de la ingeniería y en el campo militar.
El primer paso será crear la “data web”, una base de datos universal que entienda todos los formatos ahora existentes en los miles de millones de páginas almacenadas en Internet. El estándar RDF parece que puede ser útil en este desarrollo como base de datos de metadatos pero es muy complejo matemáticamente y no se popularizará con facilidad. Hay ya, en estos momentos, aplicaciones que acumulan las relaciones que se establecen en las redes sociales, es decir usan el conocimiento que los seres humanos utilizan al usar la red. En este campo tenemos KnowItAll , Metaweb, PowerSet o RadarNetworks, por ejemplo. El lenguaje RDF/OWL es un paso reciente para codificar conocimiento ontológico. También existen ya formatos locales especializados para almacenar información determinada como los propuestos por Tecnorati para formatear la información de contacto de una persona (microformato hCard), una cita (microformato hCalendar), una opinión (microformato hReview) o una relación en una red social (microformato XFN). Bastantes proyectos están financiados por organismos militares.
Pero, en general ahora mismo, no sólo nos falta aún teoría lógica sino un hardware capaz de computar tal cantidad de información a la velocidad suficiente pues de nada serviría hacer una consulta cuya respuesta perfecta llegara tres años después.Una cuestión que queda en el aire es si esa enorme capacidad de raciocinio de las nuevas máquinas estará gratuitamente en manos del público en general.¿Qué aportaría la web 3.0 – cuando se logre- a la literatura?A la digitalizada está claro que mucho. A la filología también. La facilidad para encontrar textos, para analizar un corpus o para buscar referencias será extrema y esta simplicidad acelerará los estudios literarios por el simple hecho de que se podrá hacer más y mejor en mucho menos tiempo. Podrán establecerse conexiones semánticas entre web lejanas, encontrar nuevas asociaciones y hacer estudios comparativos extremadamente profundos.
¿Y a la literatura digital en sí misma? Es un campo desconocido, una tierra que explorar. Si aún no hemos sido capaces de utilizar de manera creativa y claramente diferenciada –en literatura digital- la web 1.0 y la web 2.0, es difícil imaginar qué se puede conseguir con la web 3.0
Algunas ideas:
- Un uso extensivo de los mash-ups que mediante los metadatos semánticos permitirían escribir obras dinámicas de alta calidad. Utilizando el concepto medieval de que “escribir es reescribir” podría pensarse en combinar textos de alto nivel literario de manera novedosa y creativa. Habría que reconsiderar el concepto de plagio y delimitar los derechos de autor pero las posibilidades son interesantes. Si a estas combinaciones añadimos generadores de textos “inteligentes” más avanzados podríamos obtener textos definitivamente atractivos. ¿Quizá una novela negra en el buen blank verse de Shakespeare?
- Textos que “entiendan” el lenguaje natural (un reto que hunde sus raíces en los inicios de la informática, allá por los cincuenta del siglo pasado, y nunca conseguido) de modo que puedan interactuar con el usuario creando diálogos on-time que tengan sentido y calidad literaria.
- Red de hiperenlaces que siempre lleven a una historia atractiva (lo que sería una evolución del hipertexto adaptativo tal como se describía aquí) y que eviten un curso narrativo aburrido o fallido.
- La novela interactiva en que uno de los personajes sea el lector. La novela se adaptaría a lo que, libremente – y siempre de manera distinta-, escribiera el lector formando el diálogo y los escenarios de manera coherente con esta interacción. Esto podría ser posible dado que la máquina “entendería” el contexto y el significado del texto.

Gestión de bibliotecas


Un campo de la aplicación de los ordenadores a la lengua es la gestión computerizada de las bibliotecas, existiendo un ámbito para aplicaciones tradicionales (es decir, repetir, de manera rápida y cimputerizada las labores bibliotecarias que se han hecho desde siempre de forma manual como clasificación, archivo, préstamo, localización, etc.) y otro para aplicaciones que no podrían existir sin el ordenador. Por ejemplo, pueden citarse las siguientes tareas:

La ordenación de las fichas de clasificación.
Gestión de usuarios y sus datos.
Gestión de préstamos.
La realización de copias.
Realización de las fichas de clasificación con los datos necesarios.
Listado de ubicaciones donde una obra puede consultarse.
La intercalación de las fichas en el catálogo correspondiente.
Gestión económica.
Confección de estadísticas.
Reclamo de libros cuyo préstamo ha vencido.

Todas estas tareas son hoy en día realizadas por programas de ordenador especializados que han permitido una mayor calidad, más rapidez y menores recursos humanos necesarios.
En el ámbito de las tareas difícilmente abordable sin ordenadores podemos citar la digitalización de originales, la anotación inteligente de los corpa, la creación de glosarios interconectados, de thesaurus, elaboración de catálogos de publicaciones por diversos campos, o la elaboración de catálogos colectivos.
Todas estas tareas, en realidad, pueden clasificarse en dos grandes grupos :

* Agilizar los procesos y servicios bibliotecarios
* Crear bases de datos bibliográficos complejas y completas, utilizables de manera abierta y colaborativa entre varias instituciones o personas. Cada biblioteca individual debe poder realizar su base de datos de manera local pero estas bases de datos deben poder ser integradas aguas arriba de manera jerárquica hasta alcanzar a completar la gran base de datos nacional o supranacional. Esto conlleva el que deben existir ciertos estándares para que las informaciones puedan ser compartidas y entendibles por todos los sistemas. Exise, por ejemplo, el formato MARC, los registros ISBD, catálogos COM en microfichas, usar un mismo formato (EPUB por ejemplo) en las digitalizaciones, sistemas de recuperación como QUEST, BLAUSE o SDC, etc.

Algunos aspectos a considerar

Cuando una biblioteca está digitalizada, conviene analizar algunos aspectos como:
· Migración: la rápida evolución del hardware y del software conlleva un riesgo que hasta ahora no había existido. Y es el de que un texto digitalizado simplemente no pueda leerse en el futuro. Yo mismo dispongo de relatos alamcenados en floppies de 5 pulgadas que no sé dónde puedo recuperar (al menos de manera sencilla, sin gastar mucho dinero). Y si aún los floppies pueden ser copiados pagando por el servicio, los que tenemos cintas de casette para ordenadores Amstrad lo tenemos aún más complicado. Y los que tienen cintas magnetófonicas de los primeros ordenadores, más aún. Y los que conservan fichas perforadas más aún. Pero es que sólo han transcurrido 50 años. Y en ese breve espacio de tiempo ya existe muchisima información que es casi innaccesible. Dentro de un siglo, con toda probabilidad, será absolutamente innacesible.
Pero no sólo es un problema de hardware. ¿Cuántos ficheros wen versiones antiguas de WordPerfect o Write existen que son difíclmente accesibles hoy en día ? ¿O que si se recuperan tienen tantos defectos de formato que se hace complicado leerlos? ¿Qué ocurre ya con el caótico océano de estándares: Word, Epub, PDF, Windows, Apple, Linux…)
Por ello, los sistemas digitales de las biliotecas deben prever que existan migraciones constantes que deben ser sólidas y rápidas.
·Durabilidad de los soportes. Aunque pueda parecer lo contrario, los nuevos soportes físicos son más endebles que los antiguos. La piedra era más segura que el papel ; el papel más seguro que la cinta magnética, que el CDROM, que el DVD. En este post un lector dejó un comentario que remitía a este post y a los defetos que aparecen en los soportes digitales con el tiempo. Aquí se señala que el 15% de los CDROMs grabados son ilegibles a los tres años y muy pocos pasan de 10 años. La situación no es mucho mejor con los DVD y muchos autores afirman que pasar de 200 años es complicado. Nada que ver con los miles de años de muchos documentos existentes.
Por ello, el cómo preservar los soportes o, en su defecto, ir haciendo copias de renovación, es indispensable.
·Copyright y derechos: no lo abordamos en este post,pero es evidente que es un problema ya existente y de complicada solución en la medida que las copias son más fáciles de realizar.

Entrada publicada por Félix Remírez en Biblumliteraria


Share/Save/Bookmark

miércoles, 7 de julio de 2010

Poesía cuántica


     La poesía electrónica presenta, como la literatura, una gran variedad de metamorfosis que la hacen  difícil de categorizar. Cuando, además, el artista lucha por conseguir un lenguaje nuevo que se abra paso entre otros lenguajes vanguardistas y experimentales, la tarea se hace aún más ardua. Hoy damos noticia de que Myriam Solar acaba de inaugurar su página Poética Cuántica. La autora tiene una prolongada experiencia en el terreno de la poesía experimental y ha participado desde los años 90 en casi todas las tendencias relacionadas con el web art.
     Forma parte del movimiento ASCI, una red de artistas que se inspiran en la ciencia y la tecnología y que desde 1998 realizan exposiciones de arte cinético, video instalaciones, web art... En esta orientación se inscribe la poesía cuántica de Solar: "ser cuántico es el hábito de ver con pasmo". La subversión que la física cuántica produce en nuestra visión ingenua del mundo físico se traslada también a una nueva forma de mirar el mundo del arte. Como ejemplos de esa forma poético-científica de contemplar la realidad estética, Myriam Solar nos propone obras de arte fractal natural, arte de 4D, arte biónico, arte de bio-organismos... Incluye también un homenaje al fundador de la teoría cuántica con la pieza El Gato de Schrödinger.
    Todo se resume en lo que ella llama arte de la complejidad, a saber, una exploración visual e interactiva de la naturaleza no como la vemos con nuestros ojos sino con los diversos instrumentos tecnológicos que nos muestran la belleza de lo complejo invisible.

Entrada publicada por Juan José Díez

Share/Save/Bookmark

lunes, 5 de julio de 2010

Hipertexto en El Escorial


    Comienza hoy el curso "El texto digital ante la encrucijada del libro electrónico y del hipertexto", dentro de los Cursos de Verano de la Complutense en el Escorial. Se prolongará hasta el  9 de Julio. Dirigido por José Manuel Lucía Megías, profesor titular de Filología de la Universidad Complutense, incluye un interesante  programa en el que se tratarán cuestiones de plena actualidad sobre el futuro del libro y las nuevas tecnologías. Intervendrán figuras relevantes del mundo de la edición, la investigación teórica y la creación literaria digital.

Share/Save/Bookmark

domingo, 4 de julio de 2010

Magazine del domingo (4-7-2010)


* "Une ville flottante" de Verne como si acabaras de comprarla a orillas del Sena.

 
* ¿Dónde está el libro más grande y pesado del mundo? (via Blogodisea)


*Video ficción sobre el futuro de los libros realizado en 2007. Tres años después todo eso parece ya al alcance de la mano.


*Andrew Keen, Nicholas Carr y Kevin Marks discuten sobre si Internet está arruinando nuestro cerebro.

  
Share/Save/Bookmark

viernes, 2 de julio de 2010

Lingüística computacional (XI)



El capítulo anterior de esta serie puede verse
aquí.

Traducción por ordenador

Uno de los primeros campos que atrajo el interés de los lingüistas computacionales fue el de la traducción automática por ordenador ya que tenía una aplicación práctica, inmediata y muy necesaria. La multiplicidad de lenguas humanas obliga a disponer de muchos traductores que, para idiomas minoritarios, deben además encadenarse. Así, por ejemplo, en la Unión Europea con decenas de lenguas oficiales puede ocurrir que no haya traductores directos entre, por ejemplo, el lituano y el islandés. Entonces, se procede a traducir en cadena. El traductor humano lituano traduce al inglés y otro traductor traduce del inglés al islandés. Además de ser un proceso lento y costoso, que requiere recursos humanos no siempre disponibles, puede dar pie a errores y a hacer que el tradicional adagio de traduttore, traditore sea más cierto que nunca.

Además, hay muchos idiomas no oficiales que aspiran a serlo en las instituciones internacionales. Si ya puede resultar complicado hallar traductores entre el islandés y el serbio, imaginémoslo entre el tagalo y el euskera.

El mercado globalizado de hoy en día precisa también de una ingente tarea de traducción. Las empresas venden en todo el mundo y los consumidores esperan las informaciones y los libros de instrucciones en su propia lengua.

La tarea de traducir correctamente es sumamente importante. Incluso, hoy en día, existen normas que evalúan la calidad de una traducción como son la norma EN 15038 en Europa y la ASTM F2575-06 en los Estados Unidos. Y, hoy por hoy, las buenas traducciones las hacen los seres humanos. Las traducciones automáticas, en ocasiones, generan textos tan absurdos y divertidos como el de un fabricante de lectores de CDROM:

INSTALACION DE HARDWARE:

1. Cierra el PC y desconecta todos cordones eléctricos.
2. Refiere a su manual del usuario de PC para quitar la cubierta de PC.
3. Instala su CD-ROM al aparato Master o Slave de acuerdo con la siguiente sección.
4. Ubica un area desocupado al cual se desliza el CD-ROM y monta el mando usando 4 tornillos.
5. Conecta el cable de poder a su mando CD-ROM. NOTE: La definición de pinza del conector de poder debe ser la misma que se da en Figura 1.
6. Conecta el cable E-IDE (40 pinzas) a su C-ROM según la descripción dada en la sección siguiente.
7. Conecta el cable de sonido del Audio Análogo en el panel trasero de su CD-ROM a la tarjeta de sonido si la tiene en su sistema. NOTE: El canal R debe venir normalmente en rojo.
8. Vuelve a colocar la tapa de PC y conectar los cordones de poder.
9.- Set Master or Slave Jumper - Maestro de Colocación o Saltador de Eslavo
10.- Eyaculación de emergencia: Si el usuario no puede eyacular el disco oprimiendo el botón Abrir/Cerrar, él/ella puede insertar una barra pequeña en el hoyo para eyaculación manual.
NOTA: Favor apagar el aparato antes de la eyaculación manual.



Hay que convenir que seguramente, con estas instrucciones, uno será incapaz de instalar el lector CDROM pero reírse, seguro que se ríe.

En los años cincuenta, cuando aparecieron los primeros ordenadores (que, por entonces, eran mastodontes de escasa potencia) se pensó que sería sencillo el traducir de un idioma cualquiera a otro si se disponía de diccionarios digitalizados y se aplicaban algunas normas sencillas. En plena guerra fría, la posibilidad de disponer de traductores ruso-inglés automáticos era muy atractiva. Es famosa la anécdota de que en las primeras pruebas que se hicieron, se observó ya que la tarea no iba a ser tan fácil como parecía. Alimentado un ordenador con una frase de la Biblia:

The flesh is weak but the spirit is strong (La carne es débil pero el espíritu es fuerte)

Y traducida del inglés al ruso y nuevamente al inglés, el resultado fue:

The meat is tender but the vodka is strong (el filete está tierno pero el vodka está muy fuerte

debido a que el programa no pudo resolver la distinción entre flesh y meat o el doble significado de spirit como espíritu y licor.

La creación de algoritmos que traduzcan es complicada por la enorme ambigüedad de las lenguas naturales, la explosión de reglas o rasgos cuando se usan gramáticas formales, la recursividad propia de los idiomas, la gran flexibilidad en la formación de las oraciones o los matices que la emisión sonora da al significado y que no puede ser recogida en un texto. Ni que decir tiene cuando contemplamos los giros idiomáticos, las homonimias o las jergas.

Con el tiempo, los investigadores se han ido decantando por versiones posibilistas. Si es muy complicado conseguir una traducción automática correcta a la primera, parece más factible conseguir crear sistemas que ayuden a traducir, que hagan una primera labor de desbaste produciendo una versión que luego será pulida por un ser humano. Versión inicial que, para personas que desconozcan el otro idioma, puede significar pasar de no entender nada a comprender el significado aunque no esté bien expresado.

Si por ejemplo, tenemos la frase en inglés:

Noam Chomsky has argued that many of the properties of a generative grammar arise from an "innate" Universal grammar, which is common to all languages. Proponents of generative grammar have argued that most grammar is not the result of communicative function and is not simply learned from the environment. In this respect, generative grammar takes a point of view different from functional and behaviourist theories.


La traducción que tenemos en la misma web en su versión en español es (tomada de
aquí ) :

Noam Chomsky ha discutido que muchas de las características de una gramática generativa se presentan de un “natural” Gramática universal, que es común a todas las idiomas. Los autores de la gramática generativa han discutido que la mayoría de la gramática no es el resultado de la función comunicativa y no está aprendida simplemente del ambiente. A este respecto, la gramática generativa toma un punto de vista diferente de funcional y behaviourist teorías.

Que sin duda no es una buena traducción pero que para alguien que no sepa inglés será muy útil ya que al menos le permitirá saber de qué va el asunto.

Estos sistemas se denominan CAT (Computer Assisted Translation) y han proliferado mucho en los últimos años, desde los más sencillos en línea hasta sistemas profesionales que cuestan mucho dinero.

Los traductores actuales han dejado de buscar el modelo teórico perfecto que simule una gramática formal capaz de entender y generar una lengua. Al contrario, se basan bastante en la fuerza bruta. Pero una fuerza bruta inteligente que aúna la rapidez de cálculo de las computadoras con una base teórica que permite acelerar el proceso de traducción.

Particularmente, se están usando:

Corpa de traducciones MT


Se trata de ingentes bases de datos en donde millares de frases típicas de un idioma se memorizan junto a sus traducciones en otros idiomas hechas por humanos y, por tanto, fiables totalmente.

Estos corpus paralelos están además organizados inteligentemente, etiquetando cada oración por separado, señalando los matices que pueden contener, definiendo las frases adyacentes que potencialmente pueden existir, etc.

Además, aplicando las técnicas de lógica difusa (Fuzzy logic) puede determinarse si una frase se aproxima a otra existente en el corpus aunque no sea exactamente igual y se puede definir en cuánto se aproxima, un umbral que además suele ser programable por el usuario.

Así, si tenemos la frase:

La llegada del hombre a Marte supondría uno de los logros más importantes de la técnica al aunar la capacidad de fabricar naves espaciales capaces de soportar viajes de muchos meses, crear condiciones ambientales habitables para una tripulación humana y refinar el cálculo de trayectorias cósmicas con un precisión extraordinaria.


Si el programa encontrara la frase a traducir:

La llegada del hombre a Venus supondría uno de los logros más importantes de la técnica al aunar la capacidad de fabricar naves espaciales capaces de soportar viajes de muchos meses, crear condiciones ambientales habitables para una tripulación humana y refinar el cálculo de trayectorias cósmicas con un precisión extraordinaria.

podría determinar que la aproximación es tan alta que podrá sustituirse (echando mano al diccionario memorizado) Marte por Venus para que la traducción de la frase original sea válida.

Ahora, bien si se enfrentara a la frase:

La llegada del hombre a un planeta supondría un logro importante de la técnica al aunar la capacidad de fabricar naves espaciales capaces de soportar viajes de muchos meses, establecer unas condiciones de relación entre los participantes muy estricta y refinar el cálculo de trayectorias cósmicas con un precisión extraordinaria.


podría usar la frase original o no en función de lo que el usuario del programa le haya indicado en cuanto a necesidad de acercamiento. O bien, podría usar sólo aquellas oraciones que se acercan mucho, desestimando las otras.


Además de que la base de datos debe ser lo más amplia posible, es fundamental disponer de un buen motor de búsqueda. El algoritmo de búsqueda de semejanzas debe ser rápido ya que de nada nos serviría tener una base de datos perfecta si el ordenador necesitara diez años en encontrar la frase traducida. El motor de búsqueda debe permitir explorar una gran cantidad de texto e identificar patrones lingüísticos y terminológicos comunes en un breve intervalo de tiempo (y breve, aquí, significa milisegundos).

Un motor de búsqueda intenta, por tanto, emparejar segmentos entre el corpus del idioma de entrada y el de salida. Puede ocurrir que la similitud sea perfecta o entre dentro del rango aceptado por el usuario. En tal caso, se procede a traducir copiando la frase destino memorizada. Si, por el contrario, la similitud es escasa se presenta al humano lo que se ha conseguido y este la corrige. Esta frase corregida se memoriza, de modo que para la siguiente vez, la base de datos es más rica y completa. Algo similar ocurre si la similitud es tan escasa que el motor de búsqueda no puede ni siquiera sugerir una traducción. En tal caso, la frase original se presenta al humano que ha de traducirla manualmente, memorizándose para una siguiente ocasión. Con el tiempo, será difícil que las sentencias usuales no acaben estando en la base de datos, bien sea al completo o por partes.

Los corpa de traducciones logran altas calidades pero, por el contrario, requieren un periodo largo de aprendizaje(es decir, hasta que la memoria alcanza un valor crítico de datos) y necesita un mantenimiento humano exhaustivo, especialmente en lo concerniente a eliminar contradicciones.


Alineadores

Son programas previos a las bases de datos anteriores. Son algoritmos que extraen segmentos de frase para ser posteriormente unidas en parágrafos mayores que son alimentados a los motores de búsqueda de las bases de datos.


Extractores de terminología

Son programas que detectan y extraen las palabras clave de un texto de modo que estos términos puedan ser usados posteriormente para facilitar la búsqueda en las bases de datos o para indexar y categorizar las frases para un futuro uso.
Así, si un extractor encuentra la frase:

En el sector de la máquina-herramienta, la mecatrónica resulta fundamental hoy en día ya que se precisa un íntima interrelación entre los componentes mecánicos y los autómatas programables que hacen que se muevan en un ciclo coordinado y controlado.

El extractor hallaría como palabras clave máquina-herramienta,mecatrónica y autómata permitiendo al motor de búsqueda lanzarse primeramente a buscar entre frases que contengan estos términos, normalmente con bastante acierto. Podemos imaginar, por ejemplo, que una frase que trate de cirugía cardiovascular difícilmente incluiría esas palabras clave y puede pasarse sin revisarla. Aunque, claro, nunca se sabe.


Gestores de terminología

que son programas que organizan los términos, categorizándolos para que sea más fácil manejarlos automáticamente. Los gestores terminológicos profesionales mayoritariamente tienen una orientación onomasiológica a diferencia de los diccionarios electrónicos de léxico común cuyas unidades se organizan con una orientación semasiológica, esto es, en cada entrada o registro del diccionario se apuntan los diferentes valores semánticos.


Algunos traductores en línea

Aunque existen bastantes programas de traducción profesionales, no los trataremos aquí al entrar en el ámbito comercial. Nos centraremos en los que están disponibles en línea y que, se supone, tienen menor efectividad que los profesionales y costosos.

Softcatalá

Se trata de un traductor castellano- catalán y catalán-castellano que presenta un alto grado de calidad sobre todo para frases comunes. Puede encontrarse
aquí.





Por ejemplo, para la frase en castellano:

Caminamos por el bosque, rodeados de altos robles, tan espesos que parecían construir un manto de hojas en lo alto. La luz que se filtraba a través de ellos estaba llena de reflejos arco iris


Obtenemos:

Caminem pel bosc, envoltats d'alts roures, tan espessos que semblaven construir un mantell de fulles al capdamunt. La llum que es filtrava a través d'ells estava plena de reflexos arc de Sant Martí


Que, si no es perfecta, sí es buena.




Google en el propio buscador

El buscador Google ofrece un traductor de las búsquedas que no lo hace mal dado que se trata de frases muy cortas. Así, para:

Grammar of Medieval Greek project. The University of Cambridge has been awarded a substantial research grant by the Arts and Humanities ....


Obtenemos:

Gramática del proyecto griego medieval. La Universidad de Cambridge ha sido galardonado con una beca de investigación sustancial de la Artes y Humanidades del Consejo de Investigación



Que, aparte de algún error de concordancia es más que aceptable.


Google traductor

Puede accederse a este servicio
aquí:






Por ejemplo, alimentemos el traductor con parte de un relato en Biblumliteraria:

Fuensanta Sanguineri era una joven agraciada e inteligente pero, a sus veinticinco años, permanecía soltera, hecho que causaba asombro entre sus amistades y enojo a sus padres que hacía ya años que deseaban casarla en un matrimonio de provecho.

Los Sanguineri eran oriundos de Padua pero la familia se había trasladado a Venezuela cuando los ejércitos austrohúngaros arrollaron a los italianos en Caporetto. Entonces, Marco Sanguineri, el abuelo de Fuensanta, había reunido a la familia e informado con voz grave y serena que había tomado la decisión de emigrar a América junto a su esposa, su hijo Giuseppe, su nuera Isabella y la hija de ambos, Fuensanta, de apenas seis años de edad. No hubo peros ni preguntas. Dos meses después, arribaron a Maracaibo y, desde entonces, la chiquilla fue educada como venezolana hasta el punto de que su italiano era mediocre. Unos años después, y tras la muerte de Marco, los padres de la chica se mudaron a Caracas donde la fortuna comenzó a sonreír a Giuseppe ya que su negocio de importación de zapatos italianos iba viento en popa.



Google lo traduce al inglés como:

Fuensanta Sanguineri was a graceful and intelligent young man but at twenty years, remained unmarried, a fact that caused amazement among their friends and their parents angry that years ago and they wanted to marry her in a good marriage.

All were born in Padua Sanguineri but the family had moved to Venezuela where Austro-Hungarian forces overran the Italians in Caporetto. Entonces, Marco Sanguineri, el abuelo de Fuensanta, había reunido a la familia e informado con voz grave y serena que había tomado la decisión de emigrar a América junto a su esposa, su hijo Giuseppe, su nuera Isabella y la hija de ambos, Fuensanta, de apenas seis años de edad. Then, Marco Sanguineri, Fuensanta grandfather, had met and informed the family grave and quiet voice that had made the decision to emigrate to America with his wife, his son Giuseppe, his daughter Isabella and daughter, Fuensanta , only six years old. No hubo peros ni preguntas. No buts or questions. Dos meses después, arribaron a Maracaibo y, desde entonces, la chiquilla fue educada como venezolana hasta el punto de que su italiano era mediocre. Two months later, arrived in Maracaibo and, since then, the Venezuelan girl was raised as to the extent that his Italian was mediocre. Unos años después, y tras la muerte de Marco, los padres de la chica se mudaron a Caracas donde la fortuna comenzó a sonreír a Giuseppe ya que su negocio de importación de zapatos italianos iba viento en popa. A few years later, after the death of Marco, the girl's parents moved to Caracas where fortune began to smile as her business Giuseppe import of Italian shoes was booming.




Que presenta segmentos bien traducidos y otros bastante pobres. Pero como antes se ha señalado, si un inglés no sabe nada de español, esta traducción le servirá de mucho. Puede decirse, en cierta medida, que la valoración de la traducción depende del conocimiento del idioma que tenga el usuario.

Worldlingo


Que podemos encontrar
aquí


Si lo alimentamos con este texto en inglés:

The Big Bang: not the best name for a theory, but its what we're stuck with. If we trace back the observed expansion of the universe, we find that the universe has a finite age, one defined by the point at which the universe has an infinite energy density. The theory we have for the expansion can only approach this point. As we go back in time, the conditions of the universe go beyond the limits of our knowledge; we can talk about a bang, but we can only study its aftermath.

The basic theory for cosmological expansion is quite simple: a uniform universe is expanding away from an initial state of infinite density. At a given time after the birth of the universe, every observer in the universe sees the objects in the universe rushing away at the same rate as for every other observer. So, at a given time, every observer also sees the same local density of matter.


El resultado en español es:

La explosión grande: no el mejor nombre para una teoría, pero su con qué nos pegan. Si remontamos detrás la extensión observada del universo, encontramos que el universo tiene una edad finita, uno definido por el punto en el cual el universo tiene una densidad infinita de la energía. La teoría que tenemos para la extensión puede acercar solamente a este punto. Mientras que vamos detrás a tiempo, las condiciones del universo van más allá de los límites de nuestro conocimiento; podemos hablar de una explosión, pero podemos estudiar solamente sus consecuencias.

La teoría básica para la extensión cosmológica es absolutamente simple: un universo uniforme se está ampliando lejos de un estado inicial de la densidad infinita. En un momento dado después del nacimiento del universo, cada observador en el universo ve los objetos en el universo que acomete lejos en la misma tarifa que para cada otro observador. Así pues, en un momento dado, cada observador también ve la misma densidad local de la materia.



que se entiende pero es gramaticalmente bastante incorrecta.



PROMPT


Que puede encontrarse
aquí



Alimentando el programa con el mismo texto del relato anterior, la traducción lograda ahora es mucho mejor:

Fuensanta Sanguineri was an attractive and intelligent young woman but, at his twenty-five years, it was remaining single, fact that was causing astonishment between his friends and annoyance to his parents that was already doing years that wanted to marry it in a profit marriage.

The Sanguineri were native to Padua but the family had moved to Venezuela when the Austro-Hungarian armies wound the Italians in Caporetto. Then, Marco Sanguineri, the grandfather of Fuensanta, had assembled the family and informed with serious and serene voice that it had taken the decision to emigrate to America along with his wife, his son Giuseppe, his daughter-in-law Isabella and the daughter of both, Fuensanta, of only six years of age. There was not peros you nor ask. Two months later, they arrived to Maracaibo and, since then, the small girl was educated as Venezuelan up to the point of which his Italian was mediocre. A few years later, and after the Frame death, the parents of the girl changed Caracas where the fortune began to smile at Giuseppe since his business of import of Italian shoes was going well.



Systran


Una demo puede hallarse
aquí




El mismo fragmento se traduce ahora por:

Fuensanta Sanguineri was an attractive young person and intelligent but, to its twenty-five years, she remained unmarried, fact that astonishment between its friendships caused and anger to its parents who already years ago they wished to marry it in a benefit marriage.

The Sanguineri were native of Padua but the family had moved to Venezuela when the Austrohungarian armies coiled to the Italians in Caporetto. Then, Marco Sanguineri, the grandfathers of Fuensanta, had reunited to the informed family and with serious and calm voice that had made the decision to emigrate to America next to its wife, her son Giuseppe, his daughter-in-law Isabella and the daughter of both, Fuensanta, of hardly six years of age. There were peros nor no questions. Two months later, arrived at Maracaibo and, since then, the child was educated like Venezuelan until the point of which his Italian was mediocre. Some years later, and after the death of Marco, the parents of the girl moved to Caracas where the fortune began to smile to Giuseppe since its business of import of Italian shoes went tailwind.



que en mi opinion no alcanza el nivel de la anterior traducción.



vía Bilbumliteraria...










Share/Save/Bookmark
Related Posts Plugin for WordPress, Blogger...