Dataset opportunity

Tolid — Corpus anotados por LLM: noticias de criptomonedas, patentes biomédicas, videos de belleza

Una empresa de datos que vende los corpus que construyó y que aún opera el pipeline que los creó.

Corpus anotados por LLM / grafos de conocimientotextoEntrenamiento de LLM de dominio, grafos de conocimiento, modelos de sentimiento🌍 Francetolid.io16 jul 2026

Confidence

60%

Market size (indicative estimate)

Datos de entrenamiento anotados cuya calidad de etiqueta está MEDIDA, no afirmada, una afirmación que casi ningún corpus competidor puede hacer. Vendido con sus defectos declarados, y con el pipeline que lo produjo disponible como servicio.

Lineage

How this lead was derived

The signal-first chain, end to end: recent external signals → qualified niche → resolved data-holder → site verification → scored opportunity. Every lead is explainable.

Profile

Dataset profile

Type

Corpus anotados por LLM / grafos de conocimiento

Modality

texto

Sector

Datos de entrenamiento de IA

Volume

2,47M docs · 723k patentes · 449 rutinas

Freshness

Archivo: pipelines reiniciables

Rarity

Alta: la anotación, no el texto

Accessibility

Inmediata: espejos de BigQuery / Firestore

Legal

Las anotaciones, grafos y metadatos son obras derivadas producidas por Tolid y son transferibles. El texto de prensa fuente NO lo es (pertenece a los editores), se excluye de cada entrega. BIOPORTAL: medido y liquidado (2026-07-14): se utilizan 707 ontologías, ni una sola. Las 13.757 filas (1,6% de la tabla de mapeo) provenientes de fuentes con licencia restrictiva — SNOMED CT, MedDRA, RxNorm, OMIM, NDDF, Read Codes, ICD, CPT — se EXCLUYEN de cada entrega. Todo lo demás es abierto por construcción (OBO Foundry exige CC-BY/CC0 a sus miembros; MeSH es gratuito para uso comercial). CC-BY es una obligación de ATRIBUCIÓN, no un copyleft: un aviso de atribución se envía con los datos. AÚN ABIERTO: el estado ODbL de Open Beauty Facts (corpus de belleza) — la revisión adversarial refutó la lectura de 'Obra Producida', por lo que la restricción puede resultar BINARIA en lugar de un descuento. Las cuatro columnas de inferencia biométrica (sexo percibido, rango de edad, emoción, tono de piel) se excluyen de cualquier entrega.

Buyer persona

Editores de LLM de dominio y modelos de PNL financiera · I+D farmacéutica y biotecnológica (inteligencia de patentes) · grupos cosméticos y belleza-tech · proveedores de datos que desean entrenar su propio clasificador. NO fondos de cobertura ni proveedores de señales para el corpus de criptomonedas: no tiene alfa, y lo decimos.

Tolid es una empresa de datos. No revende datos de terceros: construyó los pipelines de recopilación y anotación por LLM que produjeron estos corpus, y todavía los opera. Lo que se ofrece son, por lo tanto, dos cosas a la vez: un stock de datos anotados y la máquina que los produjo.

Tres corpus están sobre la mesa.

1. Noticias de criptomonedas, anotadas (2.469.218 documentos, Oct 2023 → Sep 2025). Sentimiento, tema, resumen y una etiqueta de compra/mantener/vender, en tickers normalizados. Lea esto antes que nada: la señal de trading NO tiene poder predictivo medido. Ejecutamos el backtest contra precios reales nosotros mismos, en las 1.198.479 señales: supera un lanzamiento de moneda por 0,7 puntos, y su alfa neutral al mercado es nulo. La razón está en los datos: el sentimiento de la prensa se correlaciona en +0,60 con los retornos PASADOS y +0,07 con los futuros. Sigue el precio; no lo precede. No vendemos alfa, y este corpus no es para una mesa de trading. Lo que ese mismo +0,60 sí demuestra es que la anotación es fiel: es un corpus financiero etiquetado por LLM cuya calidad de etiqueta ha sido validada contra una verdad fundamental externa. Eso es lo que usted compra: datos de entrenamiento con una calidad medida, no una señal.

2. Patentes biomédicas, estructuradas como un grafo de conocimiento (723.149 documentos). El activo más valioso de los tres, y el que presenta la mayor pregunta abierta: los términos de licencia de las ontologías de BioPortal a las que se alinea están en revisión. Lo decimos antes de que pregunte.

3. Video de belleza procedimental (449 rutinas, 7.656 gestos con marca de tiempo, 21.441 videos). No "datos de video": una superficie analítica sobre lo que la gente hace realmente, paso a paso, con qué productos. Dos restricciones declaradas de antemano: la cuestión ODbL de Open Beauty Facts no está resuelta y puede ser binaria en lugar de un descuento, y las cuatro columnas de inferencia biométrica (sexo percibido, edad, emoción, tono de piel) están excluidas de cualquier entrega. El grafo procedimental conserva todo su valor sin ellas.

Lo que no vendemos: el texto del artículo fuente. Pertenece a los editores, no a Tolid. Lo que es transferible es la obra derivada: las anotaciones, las URL, los metadatos, el grafo.

Services

What the holder can also do for you

This dataset is not only a stock — its holder still operates the pipeline that produced it. Each capability below is backed by an observed fact, not a claim.

Human validation of the annotations, on demand

Tolid can run a human review pass over any corpus it has produced — full or sampled, to your own guidelines and quality bar.

EvidenceThe entire human-in-the-loop layer already exists — nine moderation tables, an escalation queue, prompt structures — and has never been run on a single document (0 of 4,841,938). The machine is built and wired; it has simply never been switched on.

A corpus built to your theme, from scratch

Give a domain and a taxonomy; Tolid runs collection, LLM annotation and graph construction end-to-end — the same pipeline that produced these corpora.

EvidenceThe pipeline is theme-driven, and there is proof: a seventh theme ("Geopolitical Tensions and Alliances") is fully configured — prompt and JSON template written — with no collection and no deployed service. A theme conceived, written, never launched. That is what "give us a subject" looks like in this codebase.

Entity resolution and normalisation

Mapping the messy surface forms of a domain onto canonical entities — the unglamorous work that decides whether a corpus is joinable with your own data.

Evidence21,359 alias → canonical-ticker mappings were built for the crypto corpus; 19,080 semantic mappings for the beauty ontology. This is the domain's price of entry, already paid.

Cleaning and extending an existing signal

Re-parsing, de-duplicating and extending a field that was produced once and never curated.

EvidenceDeclared openly: the buy/hold/sell field covers only 33.4% of the crypto rows (1,198,479 of 3,588,282 — the other 66% read `Not mentioned`) and carries parsing leaks (`buy (implied)`, `hold/sell`). Tolid can clean and extend it. We would rather sell you the fix than hide the defect.

Scoring

Scored dimensions

Explainable, evidence-based dimensions (0–100). The radar shows the investment axes.

-

See dimension details
SpecificityRarityVolumeTraining ValueBuyer DemandEvidence StrengthData Orientation

Evidence

Dataset evidence & lineage

What the typed evidence proves the company holds — reframed for clarity and set against the market.

-

Marketplace

Dataset details

Geographic coverage

Global (multilingual sources)

Time range

2023-10 → 2025-09 (crypto) · patents and beauty: see each dataset

Delivery

Secure extract download, or scoped access

Formats

parquet, csv, jsonl

License

Derived works (annotations, graphs, metadata) are transferable. Source press text is not.

Personal data

No PII

· licence· final price on request

There is no public price grid for these corpora, and we will not manufacture one. Our own valuation engine returns wide, UNANCHORED ranges — dispersion up to ×7 on the crypto asset across three identical runs — and a dedicated deep-research study (July 2026, 103 agents, 86 claims → 25 adversarially verified) confirmed WHY: for an LLM-annotated news archive sold as annotations-only, no defensible market comparable exists. The published editor↔LLM deals disclose amounts but never volumes, so no per-document price can be derived; and the closest academic comparable (Financial PhraseBank) anchors label PEDIGREE, never a number. The gap is in the market, not in our research. So we price ON REQUEST, against two things we can defend: a measured production cost (from real cloud billing) and a label quality validated against external ground truth. The biomedical-patents asset — the strongest of the three — is under its own valuation study; its price will be shown only once anchored on real dataset transactions, never on a SaaS-subscription proxy. You do not buy the bundle: each dataset is priced on its own.

Detailed schema & sample available on access request.

Want this data?

Request access — we broker a secure deal room. Operator-reviewed, no automatic sharing.

Share this opportunity

This listing was generated automatically from public signals. It is not verified, and we are not affiliated with this company.

Coverage

Scanned sources

https://tolid.iodiscovered

Deliverable

Premium dataset report

A teaser is generated for each dataset opportunity. The full report is available on unlock.

Teaser is public · premium is locked behind access.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case