Posts tonen met het label talen. Alle posts tonen
Posts tonen met het label talen. Alle posts tonen

maandag 24 mei 2021

Het probleem met Roemeens

Toen Top-Typster Katrien Vandenbulcke in maart van dit jaar als eerste deelneemster de Roemeense tekst overtypte voor de Intersteno-internetwedstrijd 2021, kreeg ze te maken met een vervelend probleem, waardoor haar – volkomen ten onrechte – tientallen extra fouten werden aangerekend.

Het probleem zat bij twee van de accentletters die in het Roemeens worden gebruikt. In mijn eerdere artikel over accenten en vreemde letters gaf ik een overzicht van de accentletters die je bij het overtypen van Roemeense teksten kunt tegenkomen.

De twee letters waarover het gaat, zijn de s-komma en de t-komma (ș, ț), met Unicode-waarden U+0219 en U+021B voor de kleine letters en U+0218 en U+021A voor de hoofdletters. Je treft die letters aan op een modern Roemeens toetsenbord. Maar in heel wat Roemeense teksten zul je twee andere tekens aantreffen, die er heel erg op lijken: de s-cedille en de t-cedille (ş, ţ), met Unicode-waarden U+015F en U+0163 voor de kleine letters en U+015E en U+0162 voor de hoofdletters. Die letters vind je enkel nog op de oudere Roemeense toetsenborden.

Hoewel je in het Roemeens officieel de s en de t met komma moet gebruiken, wordt nog heel vaak de s en t met cedille gebruikt. Dat komt doordat de s en t met komma pas laat opgenomen werden in de Unicode-standaard. Dat gebeurde pas in 1999 (Unicode 3.0), op verzoek van de Roemeense organisatie voor normalisering. Vóór die tijd waren wel de s en t met cedille al deel van Unicode, en op Roemeense schrijfmachine- en computertoetsenborden vond je de letters met cedille.

In Windows 10 kun je kiezen tussen de nieuwe Roemeense toetsenbordlay-out (een qwerty-toetsenbordindeling), die de correcte tekens ș en ț met komma produceert, en de verouderde Roemeense toetsenbordlay-out (een qwertz-indeling), die de tekens ş en ţ met cedille produceert.

Gevolg: in Roemeense teksten zul je de ene keer de letters met komma aantreffen, de andere keer de letters met cedille. De meeste mensen (zelfs de Roemenen) zijn er zich niet van bewust dat dit verschillende tekens zijn, elk met hun eigen plaatsje in de Unicode-standaard.

Welke tekens moet je nu gebruiken bij de internetwedstrijd? Als je even oefent met de trainingsteksten, dan merk je dat daar de s en t met cedille gebruikt worden. Je verwacht dus hetzelfde op de wedstrijd. En daar ging het dit jaar weer verkeerd, zoals Katrien mocht ondervinden, die zich als eerste aan het Roemeens waagde. Katrien had enkele keren geoefend op Roemeens, en had daarbij dezelfde toetsenbordindeling gebruikt die ze ook vorig jaar hanteerde. Alles ging goed... tot Katrien aan de wedstrijd begon. De wedstrijdtekst bleek niet de ş en ţ met cedille, maar de ș en ț met komma te bevatten. Het verschil is moeilijk te zien (tenzij je de letters uitvergroot). Katrien was zich van geen kwaad bewust en typte de Roemeense tekst keurig over. Groot was natuurlijk haar verwondering en teleurstelling toen aan het einde van de test de evaluatie op het scherm verscheen: 61 fouten! Overal waar Katrien een ş of een ţ had getypt, had het programma een fout aangerekend!

Jammer dat de organisatoren zich blijkbaar niet bewust waren van dit probleem, of dat ze er zo weinig aandacht aan schonken, want exact hetzelfde probleem had zich in het verleden nog al eens voorgedaan. Uiteindelijk kwam het allemaal in orde en werd het probleem opgelost – Katrien bleek gelukkig tóch geslaagd –, maar het ware natuurlijk beter als men deze verwarring had vermeden.

Onderstaande afbeelding laat de huidige, moderne Roemeense toetsenbordlay-out zien, een qwerty-indeling die de s en t met komma produceert.

In het verleden werd in Roemenië een andere toetsenbordindeling gebruikt, namelijk onderstaande qwertz-lay-out, die de s en t met cedille produceert.

Ik kon de ellende niet langer aanzien en heb de programmeur van de Taki-software, de Italiaan Marco Olivio, gecontacteerd met een suggestie voor een mogelijke oplossing. Hij heeft beloofd de oplossing tegen volgende keer te implementeren, en ondertussen is dat ook gebeurd, zo heeft hij mij laten weten. Het is de bedoeling dat voortaan in het Roemeens zowel de ș en ț met komma als de ş en ţ met cedille correct gerekend worden, ongeacht wat in de opgave staat en ongeacht wat de deelnemer heeft getypt. En zo hoort het ook volgens een aanbeveling in de Unicode Standard Core Specification, een document dat de algemene principes van de Unicode-standaard beschrijft en richtlijnen bevat voor software-implementaties.

Normaal gezien moet het probleem met het Roemeens voortaan dus verleden tijd zijn. Wie het wil, kan het zelf even uitproberen in de Taki-trainingsmodule. Test het even uit met verschillende toetsenbordindelingen: gebruik de ene keer de s/t-komma en de andere keer de s/t-cedille. Ongeacht welke tekens je typt, dit zou vanaf nu geen aanleiding meer mogen geven tot onterecht aangerekende fouten.

www.intersteno.org/intersteno-internet-contests/training-with-taki-version
www.unicode.org/versions/Unicode13.0.0/UnicodeStandard-13.0.pdf

vrijdag 15 januari 2021

Accenten en vreemde letters #3

Deze keer bespreken we de accenten en andere speciale tekens die je kunt tegenkomen bij het overtypen van teksten in het Fins, het Pools, het Hongaars en het Turks.

Fins

In het Fins kom je heel veel trema’s tegen, altijd op een a of een o. De ä en de ö worden in het Fins beschouwd als twee aparte letters, die achteraan in het alfabet komen.

Verder kun je heel af en toe de å tegenkomen op eigennamen die uit het Zweeds komen (maar niet op andere Finse woorden). Het kleine rondje (eigenlijk een kleine letter o) bovenop de a wordt corona (kroon) of ring genoemd. Ook de å is een aparte letter in het Finse alfabet (na de z en voor de ä).

Ten slotte kun je in Finse woorden in theorie ook nog een caron tegenkomen op de letters s en z, in bepaalde leenwoorden. Maar aangezien de s- en z-caron (šŠ, žŽ) niet voorkomen op een Fins toetsenbord, is de kans bijzonder klein. We zullen de caron, die eruitziet als een omgekeerde circumflex, bespreken wanneer we het hebben over de Oost-Europese talen, waar dat accent veelvuldig gebruikt wordt. In het Fins is er een alternatieve schrijfwijze voor š en ž, namelijk sh en zh.

De situatie met de Finse š en ž is dus een beetje dezelfde als met de œ in het Frans: omdat deze tekens niet op het toetsenbord staan, worden ze vaak vervangen door een alternatief. Maar in theorie kunnen ze wel voorkomen in een tekst, dus wees erop voorbereid!

Een weetje: het Fins is niet verwant met de andere Scandinavische talen (Deens, Noors en Zweeds). Het Fins vormt samen met het Hongaars een aparte taalgroep. Beide talen zijn met elkaar verwant, maar verschillen zo veel van elkaar dat er van onderlinge verstaanbaarheid geen sprake is.

Pools

Het enige vertrouwde accent in het Pools is het accent aigu. Dat accent kan voorkomen op de letter o, maar op geen enkele andere klinker. Verder kan het accent aigu wel voorkomen op een aantal medeklinkers, namelijk c, n, s en z.

Bij de letter z moet je goed uitkijken, want behalve een aigu kan er ook nog een punt op de letter geplaatst worden (żŻ).

Bij de a en de e kan een ogonek (Pools voor staartje) voorkomen onder de letter. Verwar de ogonek niet met de komma of de cedille; de ogonek wijst de andere kant op (bv. ąĄ, ęĘ).

Ten slotte maken we in het Pools voor het eerst kennis met een diakritisch teken dat niet boven of onder, maar door de letter geplaatst wordt: het (schuine) streepje door de letter l (bv. łŁ). In het Engels spreekt men van een l-stroke, maar de Polen noemen dit een l kreską. Je hebt wellicht de neiging om deze letter uit te spreken als een l, maar de correcte uitspraak is zoals onze letter w. In het Pools wordt de w dan weer uitgesproken als een v.

In handgeschreven tekst wordt het schuine streepje door de l kreską vervangen door een platte streep boven de letter.

Hongaars

In het Hongaars kunnen we het accent aigu tegenkomen op alle klinkers, en het trema op de o en de u. Daarnaast kent het Hongaars nog een speciaal accent: het dubbel accent aigu. Zo’n dubbel accent aigu is één accent dat, zoals je wellicht al kunt raden, eruitziet als twee accent aigu’s naast elkaar. Dit dubbel accent aigu wordt ook wel Hongaarse umlaut genoemd, omdat het natuurlijk ook wat op een umlaut (trema) lijkt. Het dubbel accent aigu kan voorkomen op de letters o en u.

Let dus heel goed op bij het overtypen van een Hongaarse tekst, want zowel het trema als het dubbel accent aigu worden op dezelfde letters gebruikt (o en u), en het verschil is niet altijd goed te zien wanneer de tekst in een kleiner lettertype staat.

Turks

Ook het Turks gebruikt de c-cedille, maar de cedille kan ook onder een s geplaatst worden. Daarmee wordt in het Turks een sj-klank aangegeven (zoals de ‘ch’ van ‘champagne’). Een ander vertrouwd accent is het trema, dat je kunt tegenkomen op een o of een u. Ten slotte komen we in het Turks ook de breve tegen (die we al kennen uit het Roemeens). In het Turks komt de breve uitsluitend voor op een letter g.

Naast deze accenten kent het Turks nog een speciale letter: de puntloze i (ı), die uitgesproken wordt zoals de doffe e in het Nederlands. Omdat het Turks zowel een i met punt als een i zonder punt gebruikt, zijn er ook twee vormen voor de overeenkomstige hoofdletters. Een gewone i (met punt) krijgt in het Turks ook een punt op de hoofdletter (İ). De puntloze hoofdletter I (zoals wij die gebruiken) wordt in het Turks gebruikt wanneer de doffe, puntloze ı naar een hoofdletter wordt omgezet.

Volgende keer sluiten we ons overzicht van accenten en andere speciale tekens af met drie Oost-Europese talen: het Tsjechisch, het Slowaaks en het Kroatisch.

donderdag 14 januari 2021

Accenten en vreemde letters #2

In een eerder artikel gaf ik een overzicht van de accentletters en andere vreemde tekens die je kunt tegenkomen in het Nederlands, het Engels, het Frans en het Duits. In het tweede artikel van deze reeks behandelen we het Spaans, het Italiaans, het Portugees en het Roemeens, vier talen die net als het Frans tot de Romaanse talen behoren.

Spaans

In het Spaans worden drie accenten gebruikt: het accent aigu op de klinkers (a, e, i, o, u en y), het trema op de letter u en de tilde op de letter n. In Spaanse teksten zul je dus geen accent grave of circumflex tegenkomen.

Daarnaast heeft het Spaans twee extra tekens, die je niet tegenkomt in andere talen: het omgekeerde vraagteken (¿) en het omgekeerde uitroepteken (¡). In andere talen plaats je een vraagteken of een uitroepteken aan het einde van een vraag of een uitroep. Ook in het Spaans is dat zo, maar in het Spaans zet men dan ook nog eens een omgekeerd vraagteken of een omgekeerd uitroepteken aan het begin van de zin.

In tegenstelling tot het Nederlands en heel wat andere talen kent het Spaans geen inversie bij een vraag. Omdat je anders pas aan het einde van een (lange) zin zou merken dat het om een vraag gaat, heeft men dat opgelost door al een (omgekeerd) vraagteken aan het begin van de zin te plaatsen. Je kunt deze praktijk een beetje vergelijken met een aanhaling. Zowel aan het begin als aan het einde van een aanhaling gebruiken we aanhalingstekens. Over aanhalingstekens zullen we het in een later artikel hebben, want ze verschillen per taal en ze komen in vele vormen. Vaak is het aanhalingsteken dat je aan het begin gebruikt, een omgedraaide of gespiegelde versie van het teken dat je aan het einde gebruikt. Ook bij de Spaanse vraag- en uitroeptekens is dat dus zo.

Wees hierop voorbereid, want in een Spaanse wedstrijdtekst kun je die tekens in theorie dus tegenkomen. In een later artikel zullen we het hebben over hoe je deze en andere speciale tekens kunt typen.

Italiaans

In het Italiaans kom je normaal gezien enkel het accent aigu en het accent grave tegen op de klinkers. Zeer uitzonderlijk kun je ook wel eens een circumflex tegenkomen.

Portugees

In het Portugees kun je vijf verschillende accenten tegenkomen: het accent aigu (op a, e, i, o en u), het accent grave (idem), de circumflex (op a, e en o), de cedille (onder de c) en de tilde (op a en o). Net als in het Frans geeft de cedille aan dat de c als s in plaats van als k uitgesproken moet worden (vóór a, o en u).

Het accent grave wordt voornamelijk gebruikt bij de letter a en slechts zeer zelden bij de andere klinkers. In tegenstelling tot het Spaans gebruikt het Portugees geen n-tilde; de tilde komt uitsluitend voor op de klinkers a en o.

Roemeens

In het Roemeens worden we voor het eerst geconfronteerd met accenten die we niet gewoon zijn: behalve de vertrouwde circumflex (op de a en de i) gebruikt het Roemeens namelijk ook nog de breve (op de letter a) en de komma (onder de letters s en t).

De breve (van het Latijn: brevis, kort) is een klein boogje met de bolle kant naar beneden (bv. ăĂ).

Het komma-accent ziet eruit als een gewone komma, maar het wordt onder de letter geplaatst (bv. șȘ, țȚ).

Let op: die komma onder de letters s en t lijkt wat op een cedille, maar dat is niet hetzelfde. De komma plakt niet aan de onderkant van de letter, maar staat op een kleine afstand eronder. Een cedille daarentegen maakt wél contact met de letter en lijkt eigenlijk op een cijfer 5 dat ontdaan is van zijn platte streepje.

Oorspronkelijk (vóór 1999) maakten de s-komma en de t-komma merkwaardig genoeg geen deel uit van de Unicode-standaard, hoewel deze letters al sinds 1825 deel uitmaken van het Roemeens alfabet. Op oudere computersystemen zijn deze tekens niet beschikbaar. Dan werden ze gemakshalve maar vervangen door iets wat erop lijkt: de s-cedille en de t-cedille. Die tekens waren wél in de Unicode-standaard opgenomen. De s-cedille kun je ook in andere talen tegenkomen (bijvoorbeeld in het Turks), maar de t-cedille wordt officieel in geen enkele taal gebruikt!

Daardoor kan het gebeuren dat je in Roemeense teksten toch vaak de s-cedille en de t-cedille tegenkomt in plaats van de s-komma en de t-komma. In principe is dat verkeerd, maar het komt wel vaak voor, zeker in getypte teksten en ook bij de wedstrijdteksten van de Intersteno-internetwedstrijd! We kunnen alleen maar hopen dat in de opgaventeksten voor online typewedstrijden altijd dezelfde tekens gebruikt worden, want stel dat in de opgave een t-cedille staat en je typt een t-komma – het verschil is erg moeilijk te zien –, dan is de kans erg reëel dat de software dat als een typefout zal bestempelen. Ik meen me zelfs te herinneren dat dat in een bepaald jaar inderdaad voor problemen heeft gezorgd bij de Intersteno-internetwedstrijd.

Wanneer je in Windows 10 de Roemeense toetsenbordindeling gebruikt, dan krijg je gelukkig wél de correcte tekens, dus de s en t met een komma-accent, niet met een cedille. Maar het blijft natuurlijk opletten bij de wedstrijd: kijk goed welke tekens er in de opgave staan en zorg dat je dezelfde tekens gebruikt!

Volgende keer bespreken we het Fins, het Pools, het Hongaars en het Turks.

maandag 11 januari 2021

Accenten en vreemde letters #1

Als je een tekst in een vreemde taal typt, kun je geconfronteerd worden met allerlei vreemde tekens die je niet gewoon bent en die niet op je toetsenbord staan. In een later artikel zullen we het hebben over hoe je al die vreemde tekens op een efficiënte manier kunt typen, maar eerst zullen we eens kijken om welke tekens het precies gaat. We zullen ze taal per taal overlopen voor alle West-Europese talen.

In het eerste artikel van deze reeks behandelen we de vier talen waar we het meest vertrouwd mee zijn: Nederlands, Engels, Frans en Duits. De overige talen bewaren we voor een volgend artikel.

Nederlands

Bij Nederlandse woorden die in de officiële woordenlijst van de Nederlandse taal staan (het ‘Groene Boekje’), kunnen zes verschillende accenten voorkomen, ook wel ‘diakritische tekens’ genoemd: het accent aigu (bv. café), het accent grave (bv. carrière), het trema (bv. België), de circumflex (bv. enquête), de cedille (bv. façade) de tilde (bv. piñata).

Het trema wordt ook wel deelteken genoemd; de circumflex wordt ook wel accent circonflexe of kortweg circonflexe genoemd, of ook nog: dakje.

Het accent aigu, het accent grave, de circumflex, de cedille en de tilde komen voornamelijk voor bij woorden van vreemde herkomst, zogenaamde leenwoorden. Het accent aigu wordt daarnaast ook gebruikt om woorden of lettergrepen te beklemtonen (bv. één, vóór, ná). Het trema wordt vaak gebruikt bij klinkerbotsingen (bv. beïnvloeden, tweeënveertig, coördineren, ruïne, vacuüm) en is onmisbaar voor de uitspraak.

Ook woorden die uit het Duits afkomstig zijn, bevatten vaak een trema, maar in dat geval spreken we beter van een umlaut, zoals in het Duits (bv. föhn, glühwein – in het Nederlands schrijven we die woorden overigens zonder hoofdletter).

In Nederlandse woorden kun je het accent aigu, het accent grave, het trema en de circumflex tegenkomen op de klinkers a, e, i, o en u; de cedille enkel onder de letter c, bij leenwoorden uit het Frans of Portugees; de tilde enkel op de letter n, bij leenwoorden uit het Spaans. Bij een accent op de letter i valt het puntje boven de i weg; het accent komt in de plaats. Het puntje zelf is geen accent, maar maakt een integraal deel uit van een (accentloze) i.

Ook de cedille, die je enkel onder een letter c vindt in een aantal leenwoorden die uit het Frans of Portugees afkomstig zijn (bv. façade, reçu, Curaçao), is eigenlijk een accent. We zijn het meest vertrouwd met accenten die bovenop een letter geplaatst worden, maar dat is (vooral in andere talen dan het Nederlands) lang niet altijd het geval. Ook de cedille is strikt genomen een accent, en het wordt niet boven, maar onder de letter geplaatst.

Wanneer je een woord of lettergreep benadrukt, gebruik je altijd een accent aigu, nooit een accent grave. Soms zie je dat ten onrechte een accent grave gebruikt wordt, zo lees je wel eens ‘nà’ i.p.v. ‘ná’. Dat is een onfortuinlijk overblijfsel uit het schrijfmachinetijdperk. Op een azertyklavier heeft de à immers een aparte toets (omdat de a-grave vaak voorkomt in het Frans), de á niet. Daarom gebruikten typisten gemakshalve maar de a-grave. Een andere mogelijkheid was er niet, want een accent aigu kon je met een Belgische schrijfmachine op geen enkele andere letter typen dan op een e.

Een ander fenomeen is dat, eveneens ten onrechte, woorden als ‘de’ en ‘het’ soms benadrukt worden als ‘dè’ of ‘hèt’ i.p.v. ‘dé’ en ‘hét’. Dat heeft dan weer een andere reden. In het Frans wordt de e-aigu immers altijd uitgesproken als een lange ee. Daarom denken veel mensen dat je een woord als ‘dé’ zou moeten uitspreken als ‘dee’. Dat klopt natuurlijk niet. Ook wanneer je het lidwoord ‘de’ beklemtoont door er een accent aigu op te plaatsen, blijf je een doffe e horen, maar dan benadrukt. Bijvoorbeeld: Top-Typers is niet zomaar een blog voor wedstrijdtypisten, het is dé blog voor wedstrijdtypisten!

Belangrijk: in tegenstelling met wat sommigen denken, mag je accenten niet zomaar weglaten op hoofdletters.

Engels

Het Engels is ongetwijfeld de gemakkelijkste vreemde taal om te typen. Het Engels is namelijk de enige West-Europese taal die geen accenten (meer) gebruikt, op een bijzonder klein aantal uitzonderingen na. Die uitzonderingen zijn allemaal leenwoorden die uit andere talen afkomstig zijn (bv. piñata).

Vroeger werd in het Engels gebruikgemaakt van het trema bij klinkerbotsingen (bv. coöperation), maar die schrijfwijze is in onbruik geraakt. Tegenwoordig gebruikt men een koppelteken (co-operation) of laat men het trema gewoon weg (cooperation).

Frans

Het azertyklavier is ontworpen voor de Franse taal, dus Belgische typisten zullen hier geen moeilijkheden ondervinden. In het Frans worden dezelfde accenten gebruikt als in het Nederlands: het accent aigu, het accent grave, het accent circonflexe, het trema, de tilde en de cedille. Het trema komt maar heel zelden voor, en de tilde, net als in het Nederlands en Engels, enkel in Spaanse leenwoorden (bv. piñata).

In het Nederlands schrijven we ‘trema’ en ‘cedille’ (zonder accent aigu); in het Frans schrijven we ‘tréma’ en ‘cédille’ (met accent aigu).

De cedille komt enkel voor onder de letter c, en dient om de uitspraak van de c te veranderen van k naar s. In het Frans is er namelijk een uitspraakregel die zegt dat de c als een s uitgesproken wordt vóór een e of een i, en als een k vóór een a, een o of een u. Met een cedille wordt aangegeven dat de ç vóór een a, een o of een u niet als een k, maar als een s uitgesproken wordt.

Wat het Frans onderscheidt van de meeste andere talen die accentletters gebruiken, is dit: in het Frans mogen (niet moeten!) accenten weggelaten worden bij hoofdletters. Dat is een bijzonder vreemde regel, aangezien het accent in de meeste gevallen onmisbaar is voor de correcte uitspraak van een woord. In getypte teksten (en dus ook in opgaventeksten voor typewedstrijden) worden doorgaans geen accenten op de hoofdletters gezet, omdat een Frans azertyklavier enkel voor de kleine letters aparte accentlettertoetsen heeft. In gedrukte teksten worden meestal wél hoofdletters met accenten gebruikt.

Door deze Franse regel denken veel mensen dat je ook in het Nederlands accenten mag weglaten op hoofdletters, en dat je dus bv. ‘BELGIE’ mag schrijven. Dat is echter niet zo. In het Nederlands, zoals in de meeste andere talen, mag je accenten niet zomaar weglaten, ook niet op hoofdletters! Schrijf dus steeds: ‘BELGIË’.

Behalve accenten heeft het Frans heeft ook nog een extra letter: de œ, een ligatuur samengesteld uit de letters o + e. Je bent die letter vast al tegengekomen in woorden als sœur of œuf. Er is ook een hoofdlettervariant: Œ. Op een schrijfmachineklavier komt deze letter niet voor, en daarom zul je hem ook niet tegenkomen in opgaventeksten voor typewedstrijden. Daar wordt hij vervangen door o + e (of O + E).

Duits

Het Duits kent eigenlijk maar één accent: de umlaut. In het Nederlands schrijven we ‘umlaut’ met een kleine letter, maar in het Duits schrijven we ‘Umlaut’ natuurlijk met een hoofdletter, zoals alle zelfstandige naamwoorden. Je kunt een umlaut tegenkomen op de klinkers a, o en u.

Andere accentletters komen in het Duits niet voor, behalve zeer uitzonderlijk op een beperkt aantal leenwoorden (bv. Café, Piñata).

Soms worden de umlauten weggelaten en vervangen door een e achter de klinker die normaal gezien een umlaut zou krijgen, bv. ÖSTERREICH wordt OESTERREICH, Händel wordt Haendel, Münster wordt Muenster. Dat gaat terug op de oorspronkelijke schrijfwijze van die woorden, vóórdat men de umlaut is gaan gebruiken. In de middeleeuwen werd de umlaut nog niet gebruikt, en toen had men bij dubbele klinkers de gewoonte om de tweede klinker niet naast, maar boven de eerste te schrijven. Men schreef dus bijvoorbeeld niet Muenster, maar Munster met een kleinere letter e boven de u. Uiteindelijk is die kleine e geëvolueerd naar twee puntjes en is op die manier de umlaut ontstaan.

Let op: in eigennamen mag je niet zomaar ae vervangen door ä, oe door ö of ue door ü. Net zoals er in het Nederlands (vooral in Vlaanderen) verschillende schrijfwijzen bestaan voor eigennamen die hetzelfde klinken, is dat ook zo in het Duits. Iemand kan dus bv. Müller heten (met umlaut), terwijl iemand anders Mueller heet (zonder umlaut, maar met ue). De naam van de eerste persoon (Müller) mag je schrijven als Mueller, wanneer je ook alle andere umlauten in de tekst vervangt door een e na de klinker, maar de naam van de tweede persoon (Mueller) mag je nooit schrijven als Müller! Zo wordt de naam van de grote dichter Goethe ook altijd zonder umlaut geschreven.

Maar het Duits heeft ook nog een extra letter: de ß (Eszett of ‘sharfes s’). In het Nederlands spreekt men ook wel van ‘Ringel-s’, maar die term hebben de meeste Duitsers nog nooit gehoord. De ß komt in geen enkele andere taal voor en is eigen aan het Duits. De letter is als ligatuur ontstaan uit de lettercombinatie s + z (Es + Zett), waarbij een archaïsche variant van de letter s werd gebruikt, de zogenaamde ‘lange s’, die eruitziet als een letter f zonder dwarsstreepje. Zo’n lange s (ſ) gevolgd door een z ziet er zo uit: ſz, wat na verloop van tijd geëvolueerd is tot ß.

Vroeger kwam de ß tamelijk vaak voor in het Duits, maar tegenwoordig is dat al heel wat minder. Sinds de Duitse spellinghervorming van 1996 werd de ß immers vervangen door ss wanneer de ß voorafgegaan wordt door een korte klinker. Vroeger schreef men daß en muß; tegenwoordig schrijft men dass en muss.

De ß wordt overigens enkel nog gebruikt in Duitsland en Oostenrijk. In het Duitstalige deel van Zwitserland schrijft men altijd een dubbele s (ss) in plaats van een Eszett (ß). Op straatnaambordjes in Duitsland vind je dus ‘Straße’, op Zwitserse straatnaambordjes lees je ‘Strasse’.

Oorspronkelijk bestond er geen hoofdlettervariant voor de Eszett. Dat komt doordat deze letter nooit aan het begin van een woord kan voorkomen. Dan heb je in principe geen hoofdletter nodig, maar dan heb je natuurlijk wel een probleem wanneer je bijvoorbeeld een titel volledig in hoofdletters wilt plaatsen. Wat doe je dan met de Eszett? Welnu, vroeger werd de Eszett in hoofdlettertekst veelal vervangen door SS, in andere gevallen (meer bepaald in eigennamen) werd gewoon de (kleine letter) Eszett behouden (bv. STRAUß).

Sinds 2017 bestaat er echter een officiële hoofdlettervariant van de Eszett: ẞ. Die letter ziet er bijna hetzelfde uit als een kleine Eszett, maar is wat breder zodat hij beter bij de andere hoofdletters past (bv. STRAUẞ). Let op: verwar de Duitse Eszett niet met de Griekse letter bèta (β)! Om het verschil duidelijk te laten zien, zet ik ze hieronder nog eens alle drie op een rij: links de gewone Eszett, in het midden de hoofdletter Eszett en rechts de Griekse bèta:

ß ẞ β

Bij wijze van experiment kun je eens de regel hierboven kopiëren en plakken in een tekstdocument. Pas vervolgens verschillende lettertypen toe. Je zult merken dat de verschillen in het ene lettertype al wat groter of kleiner zijn dan in het andere.

vrijdag 10 juli 2020

ISO-landcodes en -taalcodes

ISO is de Internationale Organisatie voor Standaardisatie, die tal van internationale normen en standaarden vastlegt. Al die normen en standaarden krijgen een nummer. Er zijn normen voor onder andere productspecificaties, fotografie, lucht- en ruimtevaart, papierformaten, grootheden en eenheden, etc.

In dit artikel zullen we het hebben over de ISO-taalcodes, vastgelegd in ISO-norm 639, en over de ISO-landcodes, vastgelegd in ISO-norm 3166.

Ook in de resultatenlijsten van de Intersteno-internetwedstrijd vinden we deze ISO-land- en -taalcodes terug. Althans, daar lijkt het op het eerste zicht op. Bij nader inzien vinden we echter toch wel een aantal opvallende afwijkingen.

Wanneer je bijvoorbeeld de algemene resultatenlijst van 2020 bekijkt, dan zie je in de derde kolom (‘Town/Nation’) na de plaatsnaam telkens een komma en twee hoofdletters die het land aanduiden, bv. ‘US’ (Verenigde Staten), ‘JP’ (Japan), ‘IT’ (Italië) enz. Die afkortingen zijn inderdaad de ISO-landcodes voor de betreffende landen.

Bij deelnemers uit het Verenigd Koninkrijk staat echter ‘UK’. Dat is niet de juiste code. In de lijst met ISO-landcodes op Wikipedia zien we dat de tweeletterige ISO-code voor het Verenigd Koninkrijk ‘GB’ is. Die code is gebaseerd op ‘Great Britain’ (en niet op ‘United Kingdom’). Toegegeven, dat lijkt niet erg logisch, maar het is nu eenmaal zo.

Verder vond ik in de resultatenlijst van 2009 één deelnemer (Zoran Marković) met landcode ‘YU’, een code die niet (meer) in ISO-3166 voorkomt. Zoran Marković is een deelnemer uit Servië, met landcode ‘RS’. Servië is één van de landen die vroeger tot Joegoslavië behoorden, maar Joegoslavië (‘YU’) hield in 2003 op te bestaan en viel uiteen in een aantal kleinere staten. In de lijst van 2010 staat bij Marković wél correct ‘RS’ vermeld.

En dan zijn er de taalcodes, die in de resultatentabellen in de kolom ‘Language’ in hoofdletters staan. Dat is niet conform de ISO-norm, want ISO-taalcodes worden per definitie met kleine letters geschreven. Misschien ben je geneigd te denken: ach, hoofdletters of kleine letters, dat is toch niet zo belangrijk, maar de makers van de ISO-standaarden hebben daar een goede reden voor.

Het is een heel bewuste keuze. Op die manier wil men zorgen voor een duidelijk onderscheid tussen land- en taalcodes, die anders vaak met elkaar verward zouden worden. Door voor de ene standaard hoofdletters en voor de andere kleine letters te gebruiken, is het onderscheid onmiddellijk duidelijk. Zo is ‘NL’ (in hoofdletters) de landcode voor Nederland, ‘nl’ (in kleine letters) de taalcode voor Nederlands.

Als we het incorrecte hoofdlettergebruik even buiten beschouwing laten, dan komt de inhoud van de kolom ‘Language’ in de resultatenlijsten overeen met de taalcode, eventueel gevolgd door een landcode tussen haakjes, om taalvarianten voor bepaalde landen aan te geven. Er zijn echter twee opvallende uitzonderingen: het Tsjechisch en het Japans.

Tsjechisch is een van de talen die al van bij het prille begin aangeboden werden en is dankzij het grote aantal deelnemers uit Tsjechië een van de meest gebruikte talen binnen de Intersteno-internetwedstrijd. Op de resultatenlijsten wordt Tsjechisch steevast verkeerdelijk aangegeven met de letters ‘CZ’, terwijl de juiste ISO-taalcode ‘cs’ is. ‘CZ’ is de landcode voor Tsjechië, niet de taalcode voor Tsjechisch!

De landcode voor Tsjechië, ‘CZ’, is gebaseerd op de Engelstalige benaming van het land: ‘Czech Republic’ of ‘Czechia’. De taalcode voor Tsjechisch daarentegen is gebaseerd op het Tsjechische woord voor ‘Tsjechisch’, namelijk ‘čeština’ of ‘češký’.

Ook bij het Japans wordt verkeerdelijk ‘JP’ vermeld (de landcode voor Japan) in plaats van ‘ja’ (de taalcode voor Japans).

Er valt nog veel meer te vertellen over ISO-landcodes en -taalcodes, maar na deze beknopte inleiding kunnen we ons dus volgende vragen stellen:

  • Waarom werd bij een deelnemer uit Servië in 2009 ‘YU’ als landcode vermeld in plaats van ‘RS’?
  • Waarom wordt bij Britse deelnemers ‘UK’ vermeld in plaats van ‘GB’?
  • Waarom staan de taalcodes in hoofdletters in plaats van in kleine letters?
  • Waarom wordt voor Tsjechisch ‘CZ’ vermeld in plaats van ‘cs’?
  • Waarom wordt voor Japans ‘JP’ vermeld in plaats van ‘ja’?

Wellicht liggen niet veel mensen ervan wakker, maar ik vond het toch de moeite om hier even bij stil te staan. Het bestaan van normen en standaarden is ongetwijfeld een goede zaak, maar het Intersteno-voorbeeld laat zien dat ze helaas niet altijd correct toegepast worden.

In ieder geval hoop ik dat de lezer dankzij dit artikel iets bijgeleerd heeft over ISO-landcodes en -taalcodes. Wil je er meer over weten, dan verwijs ik naar de ISO-website en naar Wikipedia. Je vindt de links onderaan dit artikel.

O ja, nog dit: de ISO-normen zijn niet in steen gebeiteld, maar worden aangepast wanneer nodig. Het aantal landen op Aarde is geen constante. Af en toe zijn er immers landen die uiteenvallen in kleinere staten (zoals de USSR en Joegoslavië in de recente geschiedenis). Het omgekeerde gebeurt ook: in 1990 smolten West- en Oost-Duitsland samen tot één land, het herenigde Duitsland. Door het opsplitsen en samenvoegen van landen raken bestaande landcodes in onbruik en moeten nieuwe landcodes aan de norm toegevoegd worden.

nl.wikipedia.org/wiki/ISO_3166-1
nl.wikipedia.org/wiki/Lijst_van_ISO_639-codes
www.intersteno.org/intersteno-internet-contests
www.intersteno.org/intersteno-internet-contests/classification-lists
www.iso.org

vrijdag 3 juli 2020

Internetwedstrijd: het moedertaalprobleem

In de reeks artikelen over de Intersteno-internetwedstrijd wil ik het deze keer hebben over het moedertaalprobleem. Normaal gezien zou moedertaal natuurlijk geen probleem mogen zijn, maar bij Intersteno is dat anders. Ik probeer even te verduidelijken waar het precies over gaat.

In een eerder artikel gaf ik al een overzicht van de beschikbare talen. Daarbij werd vermeld dat er van een aantal talen, waaronder Duits, Frans en Nederlands, meer dan één versie aangeboden wordt. Bij de training maakt het niet zoveel uit welke versie je kiest, al zul je wel merken dat de aanslagen verschillend geteld worden bij de twee versies van het Nederlands:

  • ‘Nederlands’ telt de aanslagen volgens het Nederlandse qwertyklavier;
  • ‘Nederlands (België)’ telt de aanslagen volgens het Belgische azertyklavier.

Bij de eigenlijke wedstrijd zul je merken dat je elke taal maar één keer kunt typen. Heb je eenmaal één van beide taalvarianten getypt, dan is daarna ook de andere taalvariant niet langer beschikbaar.

Kies je tijdens de wedstrijd de verkeerde versie van het Nederlands, dan krijg je te maken met het moedertaalprobleem. Je resultaat zal dan niet verschijnen in de moedertaalrangschikking. Bij de inschrijving wordt immers voor iedere deelnemer vastgelegd wat zijn of haar moedertaal is. Voor Nederlandstalige Belgen is dat ‘Nederlands (België)’; voor Nederlanders is dat ‘Nederlands’. Kies je als Belg per ongeluk toch voor ‘Nederlands’, dan heeft dat een aantal gevolgen:

  • de telling van het aantal aanslagen gebeurt volgens qwerty i.p.v. azerty;
  • je resultaat verschijnt niet in de moedertaalrangschikking;
  • je ontvangt geen diploma voor moedertaal.

Door ‘Nederlands’ te kiezen, gebeurt de telling van het aantal aanslagen volgens het Nederlandse qwertyklavier. Als je als Belg verkeerdelijk deze taalvariant kiest, dan zal het aantal aanslagen dat in de resultatenlijst vermeld wordt, lager zijn dan het aantal aanslagen dat je werkelijk hebt gemaakt. Voor elke punt en voor elk cijfer wordt dan immers maar één aanslag gerekend, hoewel je er in werkelijkheid twee gemaakt hebt. Op een Belgisch toetsenbord worden deze tekens immers met de hoofdlettertoets getypt, op een Nederlands niet.

Door ‘Nederlands’ te kiezen, zal je resultaat ook niet op de moedertaallijst verschijnen en zal er ook geen moedertaaldiploma aangemaakt worden. De software die de resultaten verwerkt, gaat er immers van uit dat je moedertaal ‘Nederlands (België)’ is, en in die ‘taal’ heb je geen geslaagde proef afgelegd!

Doordat de Intersteno-software hier beide varianten als verschillende talen beschouwt, krijgen we bijna ieder jaar te maken met het moedertaalprobleem. Er zijn altijd wel een paar deelnemers die per ongeluk de verkeerde taalversie kiezen, vooral Belgen en Zwitsers, vermoed ik.

Soms wordt dat door de nationale verantwoordelijken nog rechtgetrokken vóór het einde van de wedstrijd en wordt de moedertaal in het computersysteem aangepast, zodat deelnemers die verkeerd gekozen hebben, toch nog in de moedertaallijst komen en een moedertaaldiploma krijgen. Maar eenmaal de wedstrijd afgesloten en de rangschikking definitief is en de diploma’s verstuurd zijn, is het onverbiddelijk te laat!

Dit jaar waren twee Belgen het slachtoffer: Tom Termote had ‘Nederlands’ gekozen in plaats van ‘Nederlands (België)’, en Virginie Vermersch had ‘Français’ gekozen in plaats van ‘Français (Belgique)’. Gevolg: de namen van deze deelnemers zijn niet terug te vinden in de moedertaalrangschikking. Hadden ze wél de juiste taalvariant gekozen, dan zou Virginie op plaats 45 en Tom op plaats 47 komen, beiden in de categorie senioren.

Vorig jaar was Benoit David slachtoffer van het moedertaalprobleem, in 2016 was het Andy Gevaert.

Ik heb dit probleem ondertussen aangekaart bij de organisatoren. Hopelijk wordt de software tegen volgend jaar aangepast, zodat het moedertaalprobleem tegen dan verleden tijd is en het voor de moedertaalrangschikking niet meer uitmaakt welke variant van de taal je kiest.

Hieronder vind je een aangepaste moedertaallijst met de resultaten van de Belgische senioren van de Intersteno-internetwedstrijd 2020, inclusief de resultaten van Virginie en Tom. De lijst vermeldt naast de Belgen ook de drie beste internationale deelnemers, met goud voor Celal Aşkın, zilver voor Sean Wrona en brons voor Oksana Chernykh.

www.intersteno.org/intersteno-internet-contests

donderdag 2 juli 2020

Internetwedstrijd 2020: beschikbare talen

Bij de meertalenwedstrijd kon je dit jaar kiezen uit 16 verschillende talen. Eigenlijk hadden dat er 17 moeten zijn, maar het Japans, dat vijf jaar geleden aan het lijstje van beschikbare talen werd toegevoegd, viel in 2020 uit de boot.

In de TAKI-trainingsmodule krijg je alle beschikbare talen te zien:

De trainingsmodule laat je momenteel kiezen uit 17 talen, zoals je kunt zien in de illustratie hierboven. Het gaat om volgende talen – op de wedstrijdsite wordt de naam van elke taal in de betreffende taal zelf vermeld:

  1. Duits / Deutsch
  2. Engels / English
  3. Fins / Suomi
  4. Frans / Français
  5. Hongaars / Magyar
  6. Italiaans / Italiano
  7. Japans / 日本語
  8. Kroatisch / Hrvatski
  9. Nederlands
  1. Pools / Polski
  2. Portugees / Português
  3. Roemeens / Română
  4. Russisch / Русский
  5. Slowaaks / Slovenčina
  6. Spaans / Español
  7. Tsjechisch / Český
  8. Turks / Türkçe

Merk op dat je bij een aantal talen meerdere keuzemogelijkheden hebt. Zo heb je telkens twee mogelijkheden voor Duits, Nederlands en Japans en zelfs drie voor Frans:

  • Deutsch
  • Deutsch (Schweiz)
  • Français
  • Français (Belgique)
  • Français (Suisse)
  • Nederlands
  • Nederlands (België)
  • 日本語
  • 日本語 (transliterated)

Het Japans laten we voorlopig even buiten beschouwing, daar zullen we het in een later artikel wel eens over hebben. De verschillende versies voor Duits, Frans en Nederlands zijn er voor deelnemers die verschillende toetsenbordindelingen gebruiken. Het gaat om drie talen die in meer dan één Europees land gesproken worden.

Onder de deelnemers die Duits als moedertaal hebben, zijn er zowel Duitsers, Oostenrijkers als Zwitsers. In Zwitserland wordt echter een andere toetsenbordindeling gebruikt dan in Duitsland en Oostenrijk. Op een Zwitsers toetsenbord zul je geen Eszett (ß) aantreffen, want de Zwitsers hebben daar al lang komaf mee gemaakt. Dat is de reden waarom er gekozen kan worden tussen twee versies van het Duits.

Ook Franstalige deelnemers uit Frankrijk, België en Zwitserland gebruiken elk hun eigen toetsenbordindeling, net als Nederlandstalige deelnemers uit Nederland en België.

Lezers van deze blog weten ongetwijfeld dat in Nederland het qwertyklavier gebruikt wordt, in België het azertyklavier. Een belangrijk verschil tussen deze twee toetsenbordindelingen zit in de cijfers van de bovenste toetsenrij, die bij azerty met de hoofdlettertoets getypt worden, wat bij qwerty niet het geval is. Er is ook een verschil bij de leestekens. Zo moet een Belgische azertytypist bij iedere punt de hoofdlettertoets gebruiken, maar een Nederlandse qwertytypist niet. Omdat er voor beide deelnemers dus verschillend geteld moet worden, worden er twee versies van de Nederlandse proef ter beschikking gesteld.

Hoewel de twee versies van het Duits in de eerste plaats bedoeld zijn voor wie Duits als moedertaal heeft (in de praktijk dus deelnemers uit Duitsland, Oostenrijk en Zwitserland), kunnen ook wij ons voordeel doen met het feit dat er twee mogelijkheden voor Duits aangeboden worden. Immers: in tegenstelling tot Duitsland en Oostenrijk wordt in Zwitserland geen gebruik gemaakt van de Eszett (ß). Zwitsers schrijven dus niet 'Straße' maar 'Strasse'. Voor ons is het daarom het handigst om voor ‘Deutsch (Schweiz)’ te kiezen. Dan kunnen we er immers op rekenen dat we niet geconfronteerd zullen worden met de lastige ß, die niet op ons azertytoetsenbord staat. Dat maakt de Zwitserse versie voor ons gemakkelijker.

Voor de meertalenwedstrijd maakt het verder eigenlijk weinig uit welke versie van Frans of Duits je kiest. Van zodra je bij de wedstrijd een van die talen getypt hebt, bijvoorbeeld Duits via ‘Deutsch (Schweiz)’, zul je merken dat ook de andere mogelijkheid (‘Deutsch’) niet langer beschikbaar is. Idem dito voor Frans en Nederlands. Je kunt elke taal immers maar één keer afleggen.

Al die verschillende taalversies kunnen wel voor een ongewenst neveneffect zorgen: het moedertaalprobleem. Maar daar heb ik het in een volgend artikel over.

www.intersteno.org/intersteno-internet-contests/training-with-taki-version