EProxies logoEProxies
Datos públicos de YouTube, listos para entrenar

Datasets de YouTube para equipos de IA

Recopilamos y entregamos datos públicos de YouTube sobre nuestra propia red de más de 72M de IPs residenciales en más de 195 países. Tú defines el alcance; nosotros entregamos datos limpios y estructurados en JSON, CSV o Parquet.

Qué contiene cada registro

Ocho campos estructurados por vídeo, siempre con sus nombres originales en inglés. Pide todos o solo los que necesita tu pipeline.

title

Título del vídeo tal como aparece publicado en la plataforma.

channel

Nombre del canal e información básica del canal que publica el vídeo.

views

Número total de reproducciones en el momento de la captura.

likes

Número de me gusta registrados en el momento de la captura.

duration_sec

Duración del vídeo expresada en segundos.

published_at

Fecha y hora de publicación en formato ISO.

tags

Etiquetas del vídeo junto con el idioma detectado, en el campo language.

comments_count

Número de comentarios. El texto completo de los comentarios está disponible como opción.

Ejemplo de registroJSON · CSV · Parquet
{
  "video_id": "dQw4w9WgXcQ",
  "title": "Never Gonna Give You Up",
  "channel": "Rick Astley",
  "views": 1620000000,
  "likes": 18400000,
  "duration_sec": 213,
  "published_at": "2009-10-25T06:57:33Z",
  "language": "en",
  "tags": ["music", "80s", "pop"],
  "comments_count": 2300000
}

Tres formas de recibir tus datos

Del dataset empaquetado al acceso en tiempo real: elige el modo que encaje con tu flujo de trabajo. Todos entregan en JSON, CSV o Parquet.

Dataset listo

Cortamos el dataset según tus requisitos y lo empaquetamos en una entrega única. Descargas los archivos y empiezas a entrenar.

Recopilación a medida

Definimos el rastreo por palabras clave, canales, regiones o ventanas de tiempo, y lo mantenemos actualizado con la frecuencia que acordemos.

Acceso por API

Extrae datos bajo demanda y en tiempo real. Pensado para integrarse directamente en tu propio pipeline de datos.

Para qué lo usan los equipos

Corpus para LLM y modelos multimodales

Títulos, metadatos y comentarios como corpus de entrenamiento para LLM y modelos multimodales, entregados limpios y estructurados.

Evaluación de recomendación y búsqueda

Señales reales de interacción — reproducciones, me gusta, comentarios — para evaluar tus sistemas de recomendación y búsqueda con datos frescos.

Tendencias y análisis de opinión

Sigue temas, creadores y reacciones del público por región e idioma para detectar tendencias antes de que exploten.

Brand safety y moderación de contenido

Audita junto a qué contenido aparece tu marca y entrena clasificadores de moderación con ejemplos reales de la plataforma.

Cumplimiento y seguridad

Datos públicos, procesos auditables y entrega cifrada, para que tu equipo legal apruebe tan rápido como el de ingeniería.

Solo recopilamos datos públicamente accesibles. Nunca tocamos contenido privado de cuentas ni datos que requieran iniciar sesión.
Soportamos flujos de cumplimiento GDPR y CCPA, incluido un acuerdo de procesamiento de datos si tu equipo legal lo requiere.
Transmisión y entrega cifradas, con canales de entrega auditables en todo momento.

Preguntas frecuentes

¿Listo para hablar de tu dataset?

Cuéntanos por Telegram qué datos necesitas — alcance, campos y frecuencia — y te respondemos con un plan y una cotización. ¿Prefieres recopilarlos por tu cuenta? Nuestros proxies residenciales son la alternativa.