Dataset opportunity
Tolid — Corpus anotados por LLM: noticias de criptomonedas, patentes biomédicas, videos de belleza
Una empresa de datos que vende los corpus que construyó y que aún opera el pipeline que los creó.
Score
84
Score (0–100) blends weighted dimensions — dataset rarity, training value, buyer demand, evidence strength and right-to-license. 70+ is deal-ready. See the scored dimensions below for the breakdown.Confidence
60%
Action
Licenciar
The recommended deal structure for this dataset: Acquire (full buyout), License (paid usage rights), Data Sharing Agreement (controlled access, no transfer of ownership), Partnership (co-development) or Annotation Program (labeling). Chosen from data ownership, licensing complexity and accessibility.Market size (indicative estimate)
Datos de entrenamiento anotados cuya calidad de etiqueta está MEDIDA, no afirmada, una afirmación que casi ningún corpus competidor puede hacer. Vendido con sus defectos declarados, y con el pipeline que lo produjo disponible como servicio.
Lineage
How this lead was derived
The signal-first chain, end to end: recent external signals → qualified niche → resolved data-holder → site verification → scored opportunity. Every lead is explainable.
Profile
Dataset profile
Type
Corpus anotados por LLM / grafos de conocimiento
Modality
texto
Sector
Datos de entrenamiento de IA
Volume
2,47M docs · 723k patentes · 449 rutinas
Freshness
Archivo: pipelines reiniciables
Rarity
Alta: la anotación, no el texto
Accessibility
Inmediata: espejos de BigQuery / Firestore
Legal
Las anotaciones, grafos y metadatos son obras derivadas producidas por Tolid y son transferibles. El texto de prensa fuente NO lo es (pertenece a los editores), se excluye de cada entrega. BIOPORTAL: medido y liquidado (2026-07-14): se utilizan 707 ontologías, ni una sola. Las 13.757 filas (1,6% de la tabla de mapeo) provenientes de fuentes con licencia restrictiva — SNOMED CT, MedDRA, RxNorm, OMIM, NDDF, Read Codes, ICD, CPT — se EXCLUYEN de cada entrega. Todo lo demás es abierto por construcción (OBO Foundry exige CC-BY/CC0 a sus miembros; MeSH es gratuito para uso comercial). CC-BY es una obligación de ATRIBUCIÓN, no un copyleft: un aviso de atribución se envía con los datos. AÚN ABIERTO: el estado ODbL de Open Beauty Facts (corpus de belleza) — la revisión adversarial refutó la lectura de 'Obra Producida', por lo que la restricción puede resultar BINARIA en lugar de un descuento. Las cuatro columnas de inferencia biométrica (sexo percibido, rango de edad, emoción, tono de piel) se excluyen de cualquier entrega.
Buyer persona
Editores de LLM de dominio y modelos de PNL financiera · I+D farmacéutica y biotecnológica (inteligencia de patentes) · grupos cosméticos y belleza-tech · proveedores de datos que desean entrenar su propio clasificador. NO fondos de cobertura ni proveedores de señales para el corpus de criptomonedas: no tiene alfa, y lo decimos.
Tolid es una empresa de datos. No revende datos de terceros: construyó los pipelines de recopilación y anotación por LLM que produjeron estos corpus, y todavía los opera. Lo que se ofrece son, por lo tanto, dos cosas a la vez: un stock de datos anotados y la máquina que los produjo.
Tres corpus están sobre la mesa.
1. Noticias de criptomonedas, anotadas (2.469.218 documentos, Oct 2023 → Sep 2025). Sentimiento, tema, resumen y una etiqueta de compra/mantener/vender, en tickers normalizados. Lea esto antes que nada: la señal de trading NO tiene poder predictivo medido. Ejecutamos el backtest contra precios reales nosotros mismos, en las 1.198.479 señales: supera un lanzamiento de moneda por 0,7 puntos, y su alfa neutral al mercado es nulo. La razón está en los datos: el sentimiento de la prensa se correlaciona en +0,60 con los retornos PASADOS y +0,07 con los futuros. Sigue el precio; no lo precede. No vendemos alfa, y este corpus no es para una mesa de trading. Lo que ese mismo +0,60 sí demuestra es que la anotación es fiel: es un corpus financiero etiquetado por LLM cuya calidad de etiqueta ha sido validada contra una verdad fundamental externa. Eso es lo que usted compra: datos de entrenamiento con una calidad medida, no una señal.
2. Patentes biomédicas, estructuradas como un grafo de conocimiento (723.149 documentos). El activo más valioso de los tres, y el que presenta la mayor pregunta abierta: los términos de licencia de las ontologías de BioPortal a las que se alinea están en revisión. Lo decimos antes de que pregunte.
3. Video de belleza procedimental (449 rutinas, 7.656 gestos con marca de tiempo, 21.441 videos). No "datos de video": una superficie analítica sobre lo que la gente hace realmente, paso a paso, con qué productos. Dos restricciones declaradas de antemano: la cuestión ODbL de Open Beauty Facts no está resuelta y puede ser binaria en lugar de un descuento, y las cuatro columnas de inferencia biométrica (sexo percibido, edad, emoción, tono de piel) están excluidas de cualquier entrega. El grafo procedimental conserva todo su valor sin ellas.
Lo que no vendemos: el texto del artículo fuente. Pertenece a los editores, no a Tolid. Lo que es transferible es la obra derivada: las anotaciones, las URL, los metadatos, el grafo.
Services
What the holder can also do for you
This dataset is not only a stock — its holder still operates the pipeline that produced it. Each capability below is backed by an observed fact, not a claim.
Human validation of the annotations, on demand
Tolid can run a human review pass over any corpus it has produced — full or sampled, to your own guidelines and quality bar.
Evidence — The entire human-in-the-loop layer already exists — nine moderation tables, an escalation queue, prompt structures — and has never been run on a single document (0 of 4,841,938). The machine is built and wired; it has simply never been switched on.
A corpus built to your theme, from scratch
Give a domain and a taxonomy; Tolid runs collection, LLM annotation and graph construction end-to-end — the same pipeline that produced these corpora.
Evidence — The pipeline is theme-driven, and there is proof: a seventh theme ("Geopolitical Tensions and Alliances") is fully configured — prompt and JSON template written — with no collection and no deployed service. A theme conceived, written, never launched. That is what "give us a subject" looks like in this codebase.
Entity resolution and normalisation
Mapping the messy surface forms of a domain onto canonical entities — the unglamorous work that decides whether a corpus is joinable with your own data.
Evidence — 21,359 alias → canonical-ticker mappings were built for the crypto corpus; 19,080 semantic mappings for the beauty ontology. This is the domain's price of entry, already paid.
Cleaning and extending an existing signal
Re-parsing, de-duplicating and extending a field that was produced once and never curated.
Evidence — Declared openly: the buy/hold/sell field covers only 33.4% of the crypto rows (1,198,479 of 3,588,282 — the other 66% read `Not mentioned`) and carries parsing leaks (`buy (implied)`, `hold/sell`). Tolid can clean and extend it. We would rather sell you the fix than hide the defect.
Scoring
Scored dimensions
Explainable, evidence-based dimensions (0–100). The radar shows the investment axes.
-
See dimension details ↓- Dataset Specificity88
Profundidad de anotación, no texto bruto: sentimiento, tema, resumen, tripletes — en 2,5M de documentos, más un grafo de conocimiento de 723k patentes.
How sharply the data targets a specific, hard-to-substitute domain or task. Niche, well-defined data scores higher than generic. - Dataset Rarity88
El texto es abundante; la anotación a esta profundidad e historial no lo es. Mediana del motor en tres ejecuciones: 85–90.
How scarce and proprietary the data is. Unique domain data scores high; openly available data lowers it. - Dataset Volume90
2.469.218 documentos de criptomonedas anotados · 723.149 documentos de patentes · 449 rutinas de belleza procedimentales con 7.656 gestos con marca de tiempo.
Apparent scale of the data, inferred from the number of evidence hits and any explicit volume mentions. - Training Value85
Construido para el entrenamiento de modelos, no para informes, y la calidad de la etiqueta se mide, no se afirma (ver el estudio de validez de criptomonedas).
How useful the data is for the target AI use-case — its fit for model training or fine-tuning. - Buyer Demand87
Mediana del motor 85–90 una vez que la demanda se pondera por la solvencia del comprador en lugar del número de nombres.
How strongly AI builders and companies are likely to want this data, based on market signals. - Evidence Strength45
Deliberadamente bajo: el rango de precios proviene de nuestro motor de valoración, y NINGÚN comparable de mercado externo lo ancla todavía. Dos estudios de investigación profunda están pendientes. Preferimos mostrar una puntuación débil que un número seguro que no podemos defender.
How solid the proof is that the company holds this data — diversity of evidence types and number of hits. - Data Orientation95
Una empresa de datos: los pipelines, el grafo y la capa de anotación son el producto, no un subproducto.
How actively the company invests in data, measured by its data-appetite signals (hires, products, APIs…). - Dormant Data Surplus92
Producido, almacenado y nunca monetizado. La capa de moderación nunca se ha ejecutado; el corpus de criptomonedas ha estado congelado desde el 2025-09-20.
Volume and value of proprietary data this company holds BEYOND what it already monetises — the dormant surplus we can unlock. A company can sell some insights AND still sit on a far larger dormant asset.
Evidence
Dataset evidence & lineage
What the typed evidence proves the company holds — reframed for clarity and set against the market.
-
Marketplace
Dataset details
Geographic coverage
Global (multilingual sources)
Time range
2023-10 → 2025-09 (crypto) · patents and beauty: see each dataset
Delivery
Secure extract download, or scoped access
Formats
parquet, csv, jsonl
License
Derived works (annotations, graphs, metadata) are transferable. Source press text is not.
Personal data
No PII
There is no public price grid for these corpora, and we will not manufacture one. Our own valuation engine returns wide, UNANCHORED ranges — dispersion up to ×7 on the crypto asset across three identical runs — and a dedicated deep-research study (July 2026, 103 agents, 86 claims → 25 adversarially verified) confirmed WHY: for an LLM-annotated news archive sold as annotations-only, no defensible market comparable exists. The published editor↔LLM deals disclose amounts but never volumes, so no per-document price can be derived; and the closest academic comparable (Financial PhraseBank) anchors label PEDIGREE, never a number. The gap is in the market, not in our research. So we price ON REQUEST, against two things we can defend: a measured production cost (from real cloud billing) and a label quality validated against external ground truth. The biomedical-patents asset — the strongest of the three — is under its own valuation study; its price will be shown only once anchored on real dataset transactions, never on a SaaS-subscription proxy. You do not buy the bundle: each dataset is priced on its own.
Detailed schema & sample available on access request.
Want this data?
Request access — we broker a secure deal room. Operator-reviewed, no automatic sharing.
This listing was generated automatically from public signals. It is not verified, and we are not affiliated with this company.
Coverage
Scanned sources
Deliverable
Premium dataset report
A teaser is generated for each dataset opportunity. The full report is available on unlock.
From the marketplace
Explore live data opportunities
Accordiaglobal — Oportunidad de Conjunto de Datos de Informes de Inspección
View opportunity →saludFusixbiotech — Oportunidad de Conjunto de Datos de Operaciones Industriales
View opportunity →movilidadTuenvioya — Oportunidad de Conjunto de Datos de Contratación Pública
View opportunity →