メインコンテンツまでスキップ

Conversion Files API

概要: 変換ジョブにアップロードされた元PDFやページ画像を取得するAPIです。RAG結果のハイライト座標と組み合わせてビューワーを構築する場合などに利用します。


GET /v1/user/conversions/{conversion_id}/downloadpdf

変換ジョブにアップロードされた元PDFファイルをダウンロードします。

GET /v1/user/conversions/{conversion_id}/downloadpdf

Headers

  • api-key : string(required) - rokadoc APIキー
必須パラメータ
  • conversion_id : string(required) - 変換ID(パスパラメータ)
オプショナルパラメータ
  • space_id : string(optional) - スペース機能を利用する場合はスペースIDを指定

Request Example

curl -X 'GET' \
"https://api.rokadoc.ntt.com/v1/user/conversions/${CONVERSION_ID}/downloadpdf" \
-H "api-key: ${ROKADOC_API_KEY}" \
-o "${CONVERSION_ID}.pdf"

Response

200 OK - PDFバイナリ
  • Content-Type: application/pdf
  • Content-Disposition: attachment; filename={conversion_id}.pdf
  • ボディ: PDFのバイナリデータ(ストリーミング)
404 Not Found - 変換IDが存在しない
{
"error": {
"code": 404,
"message": "Not Found",
"details": "リソースが見つかりませんでした。"
}
}

注意事項

  • 返却されるのはアップロード時の元PDFそのものです(変換結果のテキストは Document API で取得してください)
  • ジョブ削除後 (DELETE /v1/user/conversions/{id}) は取得不可になります

GET /v1/user/conversions/{conversion_id}/part/jpeg

変換ジョブのPDFから指定したページのJPEG画像を取得します。reading_order を指定するとそのページ内の特定要素(画像・図表等)の切り出し画像を取得できます。

GET /v1/user/conversions/{conversion_id}/part/jpeg

Headers

  • api-key : string(required) - rokadoc APIキー
必須パラメータ
  • conversion_id : string(required) - 変換ID(パスパラメータ)
オプショナルパラメータ
  • page_number : integer(optional) - 取得するページ番号(1始まり、デフォルト: 1)
  • reading_order : integer(optional) - ページ内の要素のreading_order(1始まり)。指定するとその要素のみを切り出した画像を返却。未指定の場合はページ全体を画像化
  • space_id : string(optional) - スペース機能を利用する場合はスペースIDを指定

Request Example

curl -X 'GET' \
"https://api.rokadoc.ntt.com/v1/user/conversions/${CONVERSION_ID}/part/jpeg?page_number=1" \
-H "api-key: ${ROKADOC_API_KEY}" \
-o "page1.jpg"

Response

200 OK - JPEGバイナリ
  • Content-Type: image/jpeg
  • Content-Disposition: attachment; filename=image.jpeg(ページ全体)または attachment; filename=images/p{page}_{reading_order}.jpg(要素切り出し)
  • ボディ: JPEGのバイナリデータ
200 OK - 切り出し画像が存在しない(reading_order 指定時)

reading_order を指定したが対象の切り出し画像が存在しない場合、HTTP 200 で以下のJSONが返ります。クライアントでは Content-Type を確認したうえで処理してください。

{
"img_name": "images/p1_999.jpg",
"conversion_id": "xxxx-xxxx-xxxx-xxxx-xxxxxxxxxxxx"
}
404 Not Found - 変換IDが存在しない
{
"error": {
"code": 404,
"message": "Not Found",
"details": "リソースが見つかりませんでした。"
}
}

注意事項

  • 切り出し画像は type: image の要素に対してのみ作成されますtitle / text / table などの要素には切り出し画像が存在せず、reading_order で指定しても取得できません
  • 変換時に vllm_name=null を指定して画像キャプション生成を無効にした場合、type: image の要素であっても切り出し画像が作成されない可能性があります
  • レスポンスを処理する際は Content-Type を必ず確認し、image/jpeg 以外(例: application/json)の場合は失敗ケースとして扱ってください
  • ハイライト表示の用途では、RAG API のレスポンス highlight_elementspage / reading_order / coordinates と組み合わせて利用すると、検索結果に該当する位置を強調表示できます