Waar in een PDF een woord aan het einde van een regel met een streepje wordt afgebroken, levert de tekstextractie één samengeplakt woord op dat in het Nederlands niet bestaat. Dat woord staat zo in de index, en de twee echte woorden staan er dan niet.
Concreet voorbeeld. In Kamerstuk 2021D15415 staat de zin:
Klopt het dat het protocol vooral toeziet op opsporings- en vervolging afspraken?
In de index staat daar opsporingsen. Zoeken op de frase "toeziet op opsporings en vervolging" levert daardoor nul treffers, terwijl "vervolging afspraken Ziet" uit dezelfde zin het stuk wel vindt.
Het is geen incident: zoeken op opsporingsen levert 158 documenten. Dat is één toevallig gekozen samenstelling; elk woord dat in een stuk aan een regeleinde is afgebroken heeft hetzelfde.
Gevolg voor de gebruiker: die twee woorden zijn in dat stuk onvindbaar, en frasezoeken over zo'n plek heen mislukt altijd. Het valt niet op, want je krijgt gewoon minder treffers.
Grapje tussendoor: Natuurkundeleraar vertelde ooit over leerling die na drie kwartier gefrustreerd naar voren kwam met het proefwerk en vroeg wat voor soort geld "betegeld" is (afgebroken als "bete-" en op volgende regel "geld").
Reproductie
Waargenomen op 2026-08-14.
Het samengeplakte woord, 158 documenten:
https://berthub.eu/tkconv/search.html?q=opsporingsen&twomonths=false&soorten=alles
De frase zoals die in het stuk staat, nul treffers:
<https://berthub.eu/tkconv/search.html?q="toeziet op opsporings en vervolging"&twomonths=false&soorten=alles>
Een frase uit dezelfde zin, net na de afbreekplek, die het stuk wel vindt:
<https://berthub.eu/tkconv/search.html?q="vervolging afspraken Ziet"&twomonths=false&soorten=alles>
Het stuk zelf:
https://berthub.eu/tkconv/get/2021D15415
Verwachting
Twee wegen, de tweede is waarschijnlijk goedkoper dan hij klinkt.
- Bij het indexeren een afbreekstreep gevolgd door een regeleinde herstellen. Let op dat een streepje middenin een regel juist moet blijven staan (
niet-verwijderd, Kamer-breed), dus het gaat specifiek om de combinatie streepje plus regeleinde. Een verfijning zou zijn om te kijken of een woord kan bestaan met een "-" als deel van een ander woord en/of het samengestelde woord in de spelldict staat. Dat lost mogelijk 90% op.
- Voor Kamerstukken de XML-uitgave van Koop gebruiken in plaats van de PDF. Die bestaat voor 163.075 stukken en is via de API van de Tweede Kamer op te halen; hij heeft dit probleem niet, want daar is geen bladspiegel. Voor de stukken waar hij bestaat is dat meteen ook een schonere en veel kleinere bron dan de PDF. Voor de rest blijft de PDF nodig.
Ter verhouding: op 48 stukken die zowel als PDF als in die XML-vorm bestaan, komt 99,4% van de woorden uit de XML ook in de tekst uit de PDF voor. De extractie is dus goed. Dit is een edge case die er bij het testen uitkwam.
Waar in een PDF een woord aan het einde van een regel met een streepje wordt afgebroken, levert de tekstextractie één samengeplakt woord op dat in het Nederlands niet bestaat. Dat woord staat zo in de index, en de twee echte woorden staan er dan niet.
Concreet voorbeeld. In Kamerstuk 2021D15415 staat de zin:
In de index staat daar
opsporingsen. Zoeken op de frase"toeziet op opsporings en vervolging"levert daardoor nul treffers, terwijl"vervolging afspraken Ziet"uit dezelfde zin het stuk wel vindt.Het is geen incident: zoeken op
opsporingsenlevert 158 documenten. Dat is één toevallig gekozen samenstelling; elk woord dat in een stuk aan een regeleinde is afgebroken heeft hetzelfde.Gevolg voor de gebruiker: die twee woorden zijn in dat stuk onvindbaar, en frasezoeken over zo'n plek heen mislukt altijd. Het valt niet op, want je krijgt gewoon minder treffers.
Grapje tussendoor: Natuurkundeleraar vertelde ooit over leerling die na drie kwartier gefrustreerd naar voren kwam met het proefwerk en vroeg wat voor soort geld "betegeld" is (afgebroken als "bete-" en op volgende regel "geld").
Reproductie
Waargenomen op 2026-08-14.
Het samengeplakte woord, 158 documenten:
https://berthub.eu/tkconv/search.html?q=opsporingsen&twomonths=false&soorten=alles
De frase zoals die in het stuk staat, nul treffers:
<https://berthub.eu/tkconv/search.html?q="toeziet op opsporings en vervolging"&twomonths=false&soorten=alles>
Een frase uit dezelfde zin, net na de afbreekplek, die het stuk wel vindt:
<https://berthub.eu/tkconv/search.html?q="vervolging afspraken Ziet"&twomonths=false&soorten=alles>
Het stuk zelf:
https://berthub.eu/tkconv/get/2021D15415
Verwachting
Twee wegen, de tweede is waarschijnlijk goedkoper dan hij klinkt.
niet-verwijderd,Kamer-breed), dus het gaat specifiek om de combinatie streepje plus regeleinde. Een verfijning zou zijn om te kijken of een woord kan bestaan met een "-" als deel van een ander woord en/of het samengestelde woord in de spelldict staat. Dat lost mogelijk 90% op.Ter verhouding: op 48 stukken die zowel als PDF als in die XML-vorm bestaan, komt 99,4% van de woorden uit de XML ook in de tekst uit de PDF voor. De extractie is dus goed. Dit is een edge case die er bij het testen uitkwam.