超过6,000名开发者信赖

新闻空气污染指数 用于 RAG & 向量管道

检索的好坏取决于其背后的语料库。APITube 为 RAG 管道提供完整的文章正文和结构化元数据 — 包括实体、实体情感、IPTC 类别、来源权威性和将重复报道分组的故事集 — 可导出为 JSONL 或 Parquet,并通过 SSE、WebSocket 或 Webhook 保持实时更新。
免费试用-无需信用卡
额定5星 过了 848 用户
实时新闻文章177 国家
60 语言
  • CNN
  • Techcrunch
  • Vox
  • Apple
  • Microsoft
  • IBM
  • Bloomberg
  • Spotify

好处

一个为检索而构建的语料库,而非标题信息流

用于 RAG 的新闻 API 提供用于检索管道嵌入、索引并作为可引用上下文提供给 LLM 的文档。APITube 提供来自 300,000 多个来源、涵盖 59 种语言和 177 多个国家的完整文章正文 — 每篇都包含实体、每实体情感、IPTC 类别、来源权威性和将重复报道分组的故事 ID — 可导出为 JSONL 或 Parquet,并通过 SSE、WebSocket 或 Webhook 保持最新。

1
每个响应中的文章全文 — 准备好进行分块和嵌入
2
故事聚类会在污染您的索引之前对重复的报道进行分组
3
9种类型的实体,链接到维基百科和维基数据,并带有按实体划分的情感分析
4
来源权威性(Open PageRank 0-10)和偏见标签,用于语料库策展
5
用于批量采集的 JSONL 和 Parquet 导出
6
SSE、WebSocket 和 Webhook 在无需轮询的情况下保持索引最新
7
历史存档可按日期范围查询以进行回填
8
免费计划中的完整丰富模式

发现可能性

我们的解决方案旨在帮助您实现目标。 无论你是小企业还是大公司,我们都有适合你的解决方案。

RAG

新闻感知聊天和问答

使用检索到的、已引用的文章而不是过时的训练集来回答有关时事的问题。

代理人

研究代理

多步代理,用于跨语言和来源检索、比较和引用报道。

财务

市场与投资组合副驾驶

用新鲜的、带实体标签的、带有按实体情感分析的新闻报道来构建金融问答。

Risk

合规与风险检索

在提问时检索有关交易对手方和供应商的负面情绪报道。

媒体报道

新闻编辑室助手

将 40 篇重复文章汇总成一个故事集,并附带来源。

验证

基于事实的核查

根据实时索引验证声明,并返回由排名来源支持的判决。

特征

不要把时间浪费在复杂的功能上

复杂的功能变得简单。 我们的API提供了一个简单的方法来访问来自世界各地的新闻文章。 我们提供了一个简单、一致和易于使用的API来访问来自数千个来源的新闻文章。

新闻空气污染指数

  • 以多种格式导出数据
  • 行业监控
  • 品牌监控
  • 市场情报
  • 风险管理
  • 竞争情报
  • 传媒监察
  • 情绪分析
  • 趋势分析
  • 故事分组
  • 预测社会趋势
  • 多语言支持
  • 观众参与
  • 地理分析
  • 实时突发新闻
  • 历史数据访问
  • Custom News Feeds
  • News Aggregation
  • Content Filtering
  • 超过50个集成

提取其他数据

  • 工业界
  • 地点
  • 机构名称
  • Brands
  • Events
  • Disasters
  • Diseases
  • 连结
  • 媒体报道
  • Images & Videos
  • 主题标签
  • 作者
  • 资料来源
  • 重复检测
  • 出版商排名
  • 文章情感
  • Readability Score
  • Language Detection

分析

  • 情绪分析
  • 舆情分析
  • 分类
  • 财务分析
  • 趋势分析
  • 故事分组
  • 内容摘要
  • 实体识别
  • 关键词提取
  • 主题建模
  • 事件检测
  • 命名实体识别
  • 文本分类
  • Controversy Detection
  • Trust Score Analysis
  • 参与度指标
  • 源偏差检测
  • 质量排名
  • 垃圾邮件检测
  • 情绪检测

高级搜索

  • 按地点搜寻
  • 按日期范围搜索
  • 按资料来源搜寻
  • 按类别搜寻
  • 按行业搜寻
  • 按情绪搜寻
  • 按故事搜寻
  • 按出版商排名搜寻
  • 按语言搜索
  • 按实体搜索
  • 按关键词搜索
  • 布尔搜索
  • 邻近搜索
  • 分面搜索
  • 范围查询
  • 按作者搜索
  • 按媒体类型搜索
  • 按突发新闻搜索
  • 按阅读时间搜索

超过 300,000+ 资料来源

APITube受到世界各地团队的信任,帮助他们以前所未有的速度构建和交付令人惊叹的数字体验。

Last updated
5s ago
来源总数
300.000k
昨天的请求
20.888
昨天添加的文章
157.157k
文章总数
3.85b

常见问题解答

APITube 是一个为检索增强生成而构建的新闻 API。它提供来自 59 种语言的 300,000 多个来源的完整文章正文,每篇文章都经过实体、每实体情感、IPTC 分类、来源权威性和用于对相关报道进行分组的故事端点的丰富化处理 — 可导出为 JSONL 或 Parquet 以用于嵌入式管道,并通过 SSE、WebSocket 或 Webhooks 保持最新。
LLM 在其训练截止日期之后就停止了解世界。RAG 管道通过在提问时检索当前文档来弥补这一差距 — 而新闻是信息量变化最快的内容库。新闻 API 可为管道提供干净、结构化、有来源的文章以供嵌入和引用,而不是带有样板文字和重复内容的抓取 HTML。
是的。来自 /v1/news/everything 的每篇文章都附有完整的正文以及标题和描述,因此您可以分块和嵌入实际文本,而不是仅标题。无论何种计划,包括免费套餐,都会返回相同的丰富化模式。
三种方式。保持流(Server-Sent Events 或 WebSocket)打开,并在文章到达时嵌入它们;注册一个 Webhook,让 APITube 将新的匹配项 POST 到您的提取端点;或者按计划使用日期过滤器轮询 REST API。所有通道都接受相同的过滤器,因此索引只接收您的管道实际检索到的内容。
每篇 APITube 文章都带有一个故事 ID,该 ID 将同一事件的相关报道分组到一个集群中。每篇故事仅摄取一篇代表性文章,而不是 40 份联合副本,这样您的检索器就可以停止为同一查询返回几乎相同的块。
每篇 APITube 文章都包含 9 种类型的实体,这些实体链接到维基百科和维基数据、整体、标题、正文和每个实体的级别(从 -1 到 1)的情感分析、具有相关性得分的 IPTC 媒体主题类别、带有政治偏见标签的来源、0 到 10 的 Open Page Rank 权威评分、语言、发布日期和故事 ID。将它们存储为向量数据库元数据,您可以在相似性搜索运行之前按公司、主题、情感、权威性或时新性预过滤检索。
REST API 导出 JSON、JSONL、Parquet、CSV、TSV、XML、RSS 和 XLSX。JSONL 按行流式传输到批量嵌入作业中,而 Parquet 则直接加载到大多数数据收集管道已在使用的数据仓库和数据框工具中。
是的。APITube 保留了一个历史存档,您可以使用已发布过滤器按日期范围进行查询,这样您就可以在切换到实时更新之前,按时间窗口倒序浏览并批量摄取语料库所需的深度。
不总是。APITube 在 https://mcp.apitube.io/ 运行一个托管的 MCP 服务器,该服务器将新闻搜索作为代理可以直接调用的工具公开 — 无需向量数据库。并且 /v1/news/fact-check 端点在服务器端运行检索增强验证:它会对照实时索引检查声明,并返回一个带有其覆盖范围的结论。
每篇文章都包含其规范 URL、来源域、来源权威分数和发布日期。将它们保存在您的块元数据中,模型就可以将每个陈述归因于一个可链接的、已排序的来源——这正是扎实答案和貌似合理答案的区别所在。

相关解决方案

资源

开发者

我们用曲奇饼

通过单击"接受",您同意在您的设备上存储cookie以进行功能和分析。