获取文档详情
返回单个文档的详细信息。
curl --request GET \
--url https://{api_base_url}/datasets/{dataset_id}/documents/{document_id} \
--header 'Authorization: Bearer <token>'import requests
url = "https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}"
headers = {"Authorization": "Bearer <token>"}
response = requests.get(url, headers=headers)
print(response.text)const options = {method: 'GET', headers: {Authorization: 'Bearer <token>'}};
fetch('https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "GET",
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"net/http"
"io"
)
func main() {
url := "https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}"
req, _ := http.NewRequest("GET", url, nil)
req.Header.Add("Authorization", "Bearer <token>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.get("https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}")
.header("Authorization", "Bearer <token>")
.asString();require 'uri'
require 'net/http'
url = URI("https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer <token>'
response = http.request(request)
puts response.read_body{
"archived": false,
"average_segment_length": 70,
"completed_at": 1741267260,
"created_at": 1741267200,
"created_by": "ad313dd6-ef04-4dd1-a5b0-c0f0b9e2e7e4",
"created_from": "api",
"data_source_info": {
"upload_file": {
"created_at": 1741267200,
"created_by": "ad313dd6-ef04-4dd1-a5b0-c0f0b9e2e7e4",
"extension": "txt",
"id": "a1b2c3d4-e5f6-7890-abcd-ef1234567890",
"mime_type": "text/plain",
"name": "guide.txt",
"size": 2048
}
},
"data_source_type": "upload_file",
"dataset_process_rule": {
"id": "e1f2a3b4-c5d6-7890-ef12-345678901234",
"mode": "custom"
},
"dataset_process_rule_id": "e1f2a3b4-c5d6-7890-ef12-345678901234",
"disabled_at": null,
"disabled_by": null,
"display_status": "available",
"doc_form": "text_model",
"doc_language": "English",
"doc_metadata": [],
"doc_type": null,
"document_process_rule": {
"mode": "custom",
"rules": {
"pre_processing_rules": [],
"segmentation": {
"chunk_overlap": 50,
"max_tokens": 500,
"separator": "###"
}
}
},
"enabled": true,
"error": null,
"hit_count": 0,
"id": "a8e0e5b5-78c6-4130-a5ce-25feb0e0b4ac",
"indexing_latency": 60,
"indexing_status": "completed",
"name": "guide.txt",
"need_summary": false,
"position": 1,
"segment_count": 5,
"summary_index_status": null,
"tokens": 512,
"updated_at": 1741267260
}Authorizations
Query Parameters
all 返回所有字段(包括元数据)。only 仅返回 id、doc_type 和 doc_metadata。without 返回除 doc_type 和 doc_metadata 外的所有字段。
all, only, without Response
文档详情。返回的字段取决于 metadata 查询参数。
文档是否已归档。
分段的平均字符长度。
处理完成的 Unix 时间戳,尚未完成时为 null。
文档创建的 Unix 时间戳。
创建该文档的用户 ID。
文档来源。通过 API 创建时为 api,通过 UI 创建时为 web。
数据源详情。文件上传时,此详情接口在 upload_file 下返回完整的文件对象,而列表接口仅返回 upload_file_id。
Show child attributes
Show child attributes
文档的上传方式。文件上传为 upload_file,Notion 导入为 notion_import。
知识库级别的处理规则配置。
应用于该文档的处理规则 ID。
文档被禁用的 Unix 时间戳,启用时为 null。
禁用该文档的用户 ID,启用时为 null。
适合 UI 显示的索引状态。
文档分块模式。text_model 表示标准文本,hierarchical_model 表示父子结构,qa_model 表示问答对。
文档内容的语言。
此文档的自定义元数据键值对。
Show child attributes
Show child attributes
文档类型分类,未设置时为 null。
文档级别的处理规则配置。
该文档是否启用检索。
索引失败时的错误消息,否则为 null。
该文档被检索的次数。
文档标识符。
索引耗时(秒),未完成时为 null。
当前索引状态,例如 waiting、parsing、cleaning、splitting、indexing、completed、error、paused。
文档名称。
该文档是否需要生成摘要。
在知识库中的位置索引。
文档中的分段数。
摘要索引的状态,未启用摘要索引时为 null。
文档中的令牌数。
最后更新的 Unix 时间戳,从未更新时为 null。
Was this page helpful?
curl --request GET \
--url https://{api_base_url}/datasets/{dataset_id}/documents/{document_id} \
--header 'Authorization: Bearer <token>'import requests
url = "https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}"
headers = {"Authorization": "Bearer <token>"}
response = requests.get(url, headers=headers)
print(response.text)const options = {method: 'GET', headers: {Authorization: 'Bearer <token>'}};
fetch('https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "GET",
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"net/http"
"io"
)
func main() {
url := "https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}"
req, _ := http.NewRequest("GET", url, nil)
req.Header.Add("Authorization", "Bearer <token>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.get("https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}")
.header("Authorization", "Bearer <token>")
.asString();require 'uri'
require 'net/http'
url = URI("https://{api_base_url}/datasets/{dataset_id}/documents/{document_id}")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer <token>'
response = http.request(request)
puts response.read_body{
"archived": false,
"average_segment_length": 70,
"completed_at": 1741267260,
"created_at": 1741267200,
"created_by": "ad313dd6-ef04-4dd1-a5b0-c0f0b9e2e7e4",
"created_from": "api",
"data_source_info": {
"upload_file": {
"created_at": 1741267200,
"created_by": "ad313dd6-ef04-4dd1-a5b0-c0f0b9e2e7e4",
"extension": "txt",
"id": "a1b2c3d4-e5f6-7890-abcd-ef1234567890",
"mime_type": "text/plain",
"name": "guide.txt",
"size": 2048
}
},
"data_source_type": "upload_file",
"dataset_process_rule": {
"id": "e1f2a3b4-c5d6-7890-ef12-345678901234",
"mode": "custom"
},
"dataset_process_rule_id": "e1f2a3b4-c5d6-7890-ef12-345678901234",
"disabled_at": null,
"disabled_by": null,
"display_status": "available",
"doc_form": "text_model",
"doc_language": "English",
"doc_metadata": [],
"doc_type": null,
"document_process_rule": {
"mode": "custom",
"rules": {
"pre_processing_rules": [],
"segmentation": {
"chunk_overlap": 50,
"max_tokens": 500,
"separator": "###"
}
}
},
"enabled": true,
"error": null,
"hit_count": 0,
"id": "a8e0e5b5-78c6-4130-a5ce-25feb0e0b4ac",
"indexing_latency": 60,
"indexing_status": "completed",
"name": "guide.txt",
"need_summary": false,
"position": 1,
"segment_count": 5,
"summary_index_status": null,
"tokens": 512,
"updated_at": 1741267260
}