Vous avez extrait les données. Pourquoi est-ce encore le chaos ?
Dmitry, founder of Conversion Tools
Il y a quelque temps, quelqu’un s’est inscrit, a essayé nos outils, puis est reparti. Ce qui m’a marqué, c’est le pourquoi. Ses documents étaient déjà analysés - un bon outil avait transformé ses PDF en un texte propre et lisible. Ce n’est pas pour ça qu’il est venu nous voir. Il est venu parce qu’il était toujours bloqué, et il est reparti parce que nous ne résolvions pas encore la partie sur laquelle il bloquait vraiment.
Cela m’a appris une chose qui, pour moi, résume tout : analyser un document et extraire vos données sont deux tâches distinctes, et presque tout le monde vous vend la première.
L’analyse est presque résolue. L’extraction, non.
Transformer une page en texte fidèle, ou en un déversement brut de tout ce qu’elle contient, est devenu vraiment excellent. Les bons outils sont nombreux et les prix continuent de baisser. C’est formidable - et c’est aussi pour cela que la valeur n’est plus là. Quand une chose fonctionne bien et ne coûte presque rien, c’est un produit banalisé, pas un avantage défendable.
La douleur n’a pas disparu pour autant. Elle s’est déplacée en aval, dans la partie que personne ne met sur une page d’accueil :
- La sortie a une forme différente pour chaque document, donc votre code casse dès la mise en page suivante.
- Le champ dont vous avez besoin est bien là - simplement à un endroit différent à chaque fois.
- Rien ne vous prévient quand un chiffre est ressorti faux.
- Une fois, à la main, ça marche. Le faire à l’identique mille fois, sans surveillance, est une tout autre affaire.
C’est le milieu désordonné. Rien de glorieux là-dedans, c’est là que meurent silencieusement les vrais pipelines, et c’est exactement ce qu’un analyseur vous renvoie en vous laissant le démêler.
À quoi ressemble vraiment "terminé"
Terminé, ce n’est pas le PDF est devenu du texte. Terminé, c’est ceci : vous définissez une seule fois la poignée de champs qui vous intéressent, et chaque facture, chaque relevé, chaque formulaire - quelle que soit sa mise en page - revient sous la forme du même enregistrement structuré, dans la même structure, prêt à être versé directement dans votre tableur ou votre base de données. La même réponse à chaque fois, qu’il s’agisse du document numéro un ou du document numéro dix mille.
Remarquez ce dont tout cela ne dépend pas : le moteur d’analyse qui tourne en dessous. Le moteur est une pièce interchangeable - nous utilisons celui qui lit le mieux vos champs aujourd’hui et nous pourrons passer au meilleur demain, sans que vous vous en aperceviez, parce que ce sur quoi vous vous appuyez, c’est la forme de la sortie, pas le modèle qui l’a produite.
L’essentiel
Si vous avez déjà éprouvé ce sentiment - je l’ai analysé, et c’est toujours le chaos - vous ne vous y preniez pas mal. On vous a donné la partie facile et laissé la partie difficile. Combler cet écart - définir la structure une fois et la récupérer de façon fiable, pour toujours - c’est toute la raison d’être de Parse.
Si c’est votre douleur, prenez un seul document et essayez. Définissez un ou deux champs sur un échantillon et regardez le résultat revenir exactement comme vous l’entendiez - sans inscription, sans code.