تنزيل manga image translator - تنزيل كود مصدر manga image translator

مترجم الصور/المانغا

ترجمة النصوص في المانجا / الصور.
中文说明 | تغيير السجل
انضم إلينا على الديسكورد https://discord.gg/Ak8APNy4vb

بعض المانغا/الصور لن تتم ترجمتها أبدًا، ولذلك ولد هذا المشروع.

مترجم الصور/المانجا
- عينات
- العرض التوضيحي عبر الإنترنت
- تنصل
- تثبيت
  - الإعداد المحلي
    - بيب/فينف
    - تعليمات إضافية لنظام التشغيل Windows
  - عامل ميناء
    - استضافة خادم الويب
    - باستخدام CLI
    - ضبط أسرار الترجمة
    - باستخدام مع نفيديا GPU
    - البناء محليا
- الاستخدام
  - الوضع الدفعي (الافتراضي)
  - الوضع التجريبي
  - وضع الويب
  - وضع واجهة برمجة التطبيقات
- المشاريع ذات الصلة
- المستندات
  - الوحدات الموصى بها
    - نصائح لتحسين جودة الترجمة
  - خيارات
  - مرجع رمز اللغة
  - مرجع المترجمين
  - مرجع تكوين GPT
  - استخدام برنامج Gimp للعرض
  - توثيق واجهة برمجة التطبيقات
    - الوضع المتزامن
    - الوضع غير المتزامن
    - الترجمة اليدوية
- الخطوات التالية
- ادعمنا
  - شكرا لجميع المساهمين لدينا:

عينات

يرجى ملاحظة أن العينات قد لا يتم تحديثها دائمًا، وقد لا تمثل إصدار الفرع الرئيسي الحالي.

إبداعي	مترجم
(المصدر @09ra_19ra)	(قناع)
(المصدر @VERTIGRIS_ART)	`--detector ctd` (قناع)
(المصدر @hiduki_yayoi)	`--translator none` (قناع)
(المصدر@ريكاك)	(قناع)

العرض التوضيحي عبر الإنترنت

العرض التوضيحي الرسمي (بواسطة zyddnys): https://touhou.ai/imgtrans/
نص مستخدم المتصفح (بواسطة QiroNT): https://greasyfork.org/scripts/437569

لاحظ أن هذا قد لا يعمل في بعض الأحيان بسبب استمرار google gcp الغبي في إعادة تشغيل المثيل الخاص بي. في هذه الحالة، يمكنك الانتظار حتى أقوم بإعادة تشغيل الخدمة، الأمر الذي قد يستغرق ما يصل إلى 24 ساعة.
لاحظ أن هذا العرض التوضيحي عبر الإنترنت يستخدم إصدار الفرع الرئيسي الحالي.

تنصل

خليفة MMDOCR-HighPerformance.
هذا مشروع هواية، أنتم مدعوون للمساهمة!
هذا حاليًا مجرد عرض توضيحي بسيط، هناك العديد من العيوب، ونحن بحاجة إلى دعمكم لجعل هذا المشروع أفضل!
مصمم في المقام الأول لترجمة النص الياباني، ولكنه يدعم أيضًا اللغات الصينية والإنجليزية والكورية.
يدعم الرسم الداخلي وتقديم النص والتلوين.

تثبيت

الإعداد المحلي

بيب/فينف

 # First, you need to have Python(>=3.8) installed on your system
# The latest version often does not work with some pytorch libraries yet
$ python --version
Python 3.10.6

# Clone this repo
$ git clone https://github.com/zyddnys/manga-image-translator.git

# Create venv
$ python -m venv venv

# Activate venv
$ source venv/bin/activate

# For --use-gpu option go to https://pytorch.org/ and follow
# pytorch installation instructions. Add `--upgrade --force-reinstall`
# to the pip command to overwrite the currently installed pytorch version.

# Install the dependencies
$ pip install -r requirements.txt

سيتم تنزيل النماذج إلى ./models في وقت التشغيل.

تعليمات إضافية لنظام التشغيل Windows

قبل البدء في تثبيت النقطة، قم أولاً بتثبيت أدوات Microsoft C++ Build Tools (التنزيل والتعليمات) حيث لن يتم تجميع بعض تبعيات النقطة بدونها. (انظر رقم 114).

لاستخدام cuda على نظام التشغيل Windows، قم بتثبيت إصدار pytorch الصحيح وفقًا للتعليمات الموجودة على https://pytorch.org/.

عامل ميناء

متطلبات:

Docker (الإصدار 19.03+ مطلوب لتسريع CUDA / GPU)
Docker Compose (اختياري إذا كنت تريد استخدام الملفات الموجودة في المجلد demo/doc )
وقت تشغيل حاوية Nvidia (اختياري إذا كنت تريد استخدام CUDA)

يتمتع هذا المشروع بدعم عامل الإرساء ضمن zyddnys/manga-image-translator:main image. تحتوي صورة عامل الإرساء هذه على جميع التبعيات/النماذج المطلوبة للمشروع. تجدر الإشارة إلى أن هذه الصورة كبيرة إلى حد ما (~ 15 جيجابايت).

استضافة خادم الويب

يمكن استضافة خادم الويب باستخدام (لوحدة المعالجة المركزية)

docker run -p 5003:5003 -v result:/app/result --ipc=host --rm zyddnys/manga-image-translator:main -l ENG --manga2eng -v --mode web --host=0.0.0.0 --port=5003

أو

docker-compose -f demo/doc/docker-compose-web-with-cpu.yml up

اعتمادا على الذي تفضله. يجب أن يبدأ خادم الويب على المنفذ 5003 ويجب أن تصبح الصور في المجلد /result .

باستخدام CLI

لاستخدام عامل الإرساء مع CLI (أي في الوضع الدفعي)

docker run -v < targetFolder > :/app/ < targetFolder > -v < targetFolder > -translated:/app/ < targetFolder > -translated  --ipc=host --rm zyddnys/manga-image-translator:main --mode=batch -i=/app/ < targetFolder > < cli flags >

ملاحظة: في حالة احتياجك إلى الرجوع إلى الملفات الموجودة على جهازك المضيف، ستحتاج إلى تحميل الملفات المرتبطة كوحدات تخزين في المجلد /app داخل الحاوية. يجب أن تكون مسارات واجهة سطر الأوامر (CLI) هي مسار عامل الإرساء الداخلي /app/... بدلاً من المسارات الموجودة على جهازك المضيف

ضبط أسرار الترجمة

تتطلب بعض خدمات الترجمة مفاتيح API لتعمل لتعيينها وتمريرها كمتغيرات env في حاوية عامل الإرساء. على سبيل المثال:

docker run --env= " DEEPL_AUTH_KEY=xxx " --ipc=host --rm zyddnys/manga-image-translator:main < cli flags >

باستخدام مع نفيديا GPU

للاستخدام مع وحدة معالجة الرسومات المدعومة، يرجى قراءة قسم Docker الأولي أولاً. هناك بعض التبعيات الخاصة التي ستحتاج إلى استخدامها

لتشغيل الحاوية مع مجموعة العلامات التالية:

docker run ... --gpus=all ... zyddnys/manga-image-translator:main ... --use-gpu

أو (لخادم الويب + GPU)

docker-compose -f demo/doc/docker-compose-web-with-gpu.yml up

البناء محليا

لإنشاء صورة عامل الإرساء محليًا، يمكنك تشغيلها (سوف تحتاج إلى إنشاء على جهازك)

make build-image

ثم لاختبار تشغيل الصورة المضمنة

make run-web-server

الاستخدام

الوضع الدفعي (الافتراضي)

 # use `--use-gpu` for speedup if you have a compatible NVIDIA GPU.
# use `--target-lang <language_code>` to specify a target language.
# use `--inpainter=none` to disable inpainting.
# use `--translator=none` if you only want to use inpainting (blank bubbles)
# replace <path> with the path to the image folder or file.
$ python -m manga_translator -v --translator=google -l ENG -i < path >
# results can be found under `<path_to_image_folder>-translated`.

الوضع التجريبي

 # saves singular image into /result folder for demonstration purposes
# use `--mode demo` to enable demo translation.
# replace <path> with the path to the image file.
$ python -m manga_translator --mode demo -v --translator=google -l ENG -i < path >
# result can be found in `result/`.

وضع الويب

 # use `--mode web` to start a web server.
$ python -m manga_translator -v --mode web --use-gpu
# the demo will be serving on http://127.0.0.1:5003

وضع واجهة برمجة التطبيقات

 # use `--mode web` to start a web server.
$ python -m manga_translator -v --mode api --use-gpu
# the demo will be serving on http://127.0.0.1:5003

المشاريع ذات الصلة

تنفيذ واجهة المستخدم الرسومية: BallonsTranslator

المستندات

الوحدات الموصى بها

كاشف:

انج : ؟؟
جي بي ان :؟؟
سي اتش اس:؟؟
كور:؟؟
يمكن أن يؤدي استخدام --detector ctd إلى زيادة كمية أسطر النص المكتشفة

التعرف الضوئي على الحروف:

انج : ؟؟
جي بي ان :؟؟
سي اتش اس:؟؟
كور: 48 بكسل

مترجم:

اليابان -> إنج: سوجوي
CHS -> ENG: ؟؟
CHS -> اليابان: ؟؟
اليابان -> CHS: ؟؟
إنج -> جي بي إن: ؟؟
ENG -> CHS: ؟؟

الرسام :؟؟

الملون: mc2

نصائح لتحسين جودة الترجمة

قد تؤدي الدقة الصغيرة في بعض الأحيان إلى تعثر الكاشف، وهو ليس جيدًا في التقاط أحجام النص غير المنتظمة. للتحايل على ذلك، يمكنك استخدام أداة ترقية عن طريق تحديد --upscale-ratio 2 أو أي قيمة أخرى
إذا كان النص الذي يتم عرضه صغيرًا جدًا بحيث لا يمكن قراءته، فحدد --font-size-minimum 30 على سبيل المثال أو استخدم عارض --manga2eng الذي سيحاول التكيف مع فقاعات النص المكتشفة
حدد خطًا باستخدام --font-path fonts/anime_ace_3.ttf على سبيل المثال

خيارات

 -h, --help                                   show this help message and exit
-m, --mode {demo,batch,web,web_client,ws,api}
                                             Run demo in single image demo mode (demo), batch
                                             translation mode (batch), web service mode (web)
-i, --input INPUT [INPUT ...]                Path to an image file if using demo mode, or path to an
                                             image folder if using batch mode
-o, --dest DEST                              Path to the destination folder for translated images in
                                             batch mode
-l, --target-lang {CHS,CHT,CSY,NLD,ENG,FRA,DEU,HUN,ITA,JPN,KOR,PLK,PTB,ROM,RUS,ESP,TRK,UKR,VIN,ARA,CNR,SRP,HRV,THA,IND,FIL}
                                             Destination language
-v, --verbose                                Print debug info and save intermediate images in result
                                             folder
-f, --format {png,webp,jpg,xcf,psd,pdf}      Output format of the translation.
--attempts ATTEMPTS                          Retry attempts on encountered error. -1 means infinite
                                             times.
--ignore-errors                              Skip image on encountered error.
--overwrite                                  Overwrite already translated images in batch mode.
--skip-no-text                               Skip image without text (Will not be saved).
--model-dir MODEL_DIR                        Model directory (by default ./models in project root)
--use-gpu                                   Turn on/off gpu
--use-gpu-limited                           Turn on/off gpu (excluding offline translator)
--detector {default,ctd,craft,none}          Text detector used for creating a text mask from an
                                             image, DO NOT use craft for manga, it's not designed
                                             for it
--ocr {32px,48px,48px_ctc,mocr}              Optical character recognition (OCR) model to use
--use-mocr-merge                             Use bbox merge when Manga OCR inference.
--inpainter {default,lama_large,lama_mpe,sd,none,original}
                                             Inpainting model to use
--upscaler {waifu2x,esrgan,4xultrasharp}     Upscaler to use. --upscale-ratio has to be set for it
                                             to take effect
--upscale-ratio UPSCALE_RATIO                Image upscale ratio applied before detection. Can
                                             improve text detection.
--colorizer {mc2}                            Colorization model to use.
--translator {google,youdao,baidu,deepl,papago,caiyun,gpt3,gpt3.5,gpt4,none,original,offline,nllb,nllb_big,sugoi,jparacrawl,jparacrawl_big,m2m100,m2m100_big,sakura}
                                             Language translator to use
--translator-chain TRANSLATOR_CHAIN          Output of one translator goes in another. Example:
                                             --translator-chain "google:JPN;sugoi:ENG".
--selective-translation SELECTIVE_TRANSLATION
                                             Select a translator based on detected language in
                                             image. Note the first translation service acts as
                                             default if the language isn't defined. Example:
                                             --translator-chain "google:JPN;sugoi:ENG".
--revert-upscaling                           Downscales the previously upscaled image after
                                             translation back to original size (Use with --upscale-
                                             ratio).
--detection-size DETECTION_SIZE              Size of image used for detection
--det-rotate                                 Rotate the image for detection. Might improve
                                             detection.
--det-auto-rotate                            Rotate the image for detection to prefer vertical
                                             textlines. Might improve detection.
--det-invert                                 Invert the image colors for detection. Might improve
                                             detection.
--det-gamma-correct                          Applies gamma correction for detection. Might improve
                                             detection.
--unclip-ratio UNCLIP_RATIO                  How much to extend text skeleton to form bounding box
--box-threshold BOX_THRESHOLD                Threshold for bbox generation
--text-threshold TEXT_THRESHOLD              Threshold for text detection
--min-text-length MIN_TEXT_LENGTH            Minimum text length of a text region
--no-text-lang-skip                          Dont skip text that is seemingly already in the target
                                             language.
--inpainting-size INPAINTING_SIZE            Size of image used for inpainting (too large will
                                             result in OOM)
--inpainting-precision {fp32,fp16,bf16}      Inpainting precision for lama, use bf16 while you can.
--colorization-size COLORIZATION_SIZE        Size of image used for colorization. Set to -1 to use
                                             full image size
--denoise-sigma DENOISE_SIGMA                Used by colorizer and affects color strength, range
                                             from 0 to 255 (default 30). -1 turns it off.
--mask-dilation-offset MASK_DILATION_OFFSET  By how much to extend the text mask to remove left-over
                                             text pixels of the original image.
--font-size FONT_SIZE                        Use fixed font size for rendering
--font-size-offset FONT_SIZE_OFFSET          Offset font size by a given amount, positive number
                                             increase font size and vice versa
--font-size-minimum FONT_SIZE_MINIMUM        Minimum output font size. Default is
                                             image_sides_sum/200
--font-color FONT_COLOR                      Overwrite the text fg/bg color detected by the OCR
                                             model. Use hex string without the "#" such as FFFFFF
                                             for a white foreground or FFFFFF:000000 to also have a
                                             black background around the text.
--line-spacing LINE_SPACING                  Line spacing is font_size * this value. Default is 0.01
                                             for horizontal text and 0.2 for vertical.
--force-horizontal                           Force text to be rendered horizontally
--force-vertical                             Force text to be rendered vertically
--align-left                                 Align rendered text left
--align-center                               Align rendered text centered
--align-right                                Align rendered text right
--uppercase                                  Change text to uppercase
--lowercase                                  Change text to lowercase
--no-hyphenation                             If renderer should be splitting up words using a hyphen
                                             character (-)
--manga2eng                                  Render english text translated from manga with some
                                             additional typesetting. Ignores some other argument
                                             options
--gpt-config GPT_CONFIG                      Path to GPT config file, more info in README
--use-mtpe                                   Turn on/off machine translation post editing (MTPE) on
                                             the command line (works only on linux right now)
--save-text                                  Save extracted text and translations into a text file.
--save-text-file SAVE_TEXT_FILE              Like --save-text but with a specified file path.
--filter-text FILTER_TEXT                    Filter regions by their text with a regex. Example
                                             usage: --text-filter ".*badtext.*"
--pre-dict FILe_PATH                         Path to the pre-translation dictionary file. One entry per line,
                                             Comments can be added with `#` and `//`.
                                             usage: //Example
                                                    dog cat #Example
                                                    abc def
                                                    abc
--post-dict FILE_PATH                        Path to the post-translation dictionary file. Same as above.
--skip-lang                                  Skip translation if source image is one of the provide languages, 
                                             use comma to separate multiple languages. Example: JPN,ENG
--prep-manual                                Prepare for manual typesetting by outputting blank,
                                             inpainted images, plus copies of the original for
                                             reference
--font-path FONT_PATH                        Path to font file
--gimp-font GIMP_FONT                        Font family to use for gimp rendering.
--host HOST                                  Used by web module to decide which host to attach to
--port PORT                                  Used by web module to decide which port to attach to
--nonce NONCE                                Used by web module as secret for securing internal web
                                             server communication
--ws-url WS_URL                              Server URL for WebSocket mode
--save-quality SAVE_QUALITY                  Quality of saved JPEG image, range from 0 to 100 with
                                             100 being best
--ignore-bubble IGNORE_BUBBLE                The threshold for ignoring text in non bubble areas,
                                             with valid values ranging from 1 to 50, does not ignore
                                             others. Recommendation 5 to 10. If it is too low,
                                             normal bubble areas may be ignored, and if it is too
                                             large, non bubble areas may be considered normal
                                             bubbles

مرجع رمز اللغة

يتم استخدامه بواسطة الوسيطة --target-lang أو -l .

 CHS : Chinese (Simplified)
CHT : Chinese (Traditional)
CSY : Czech
NLD : Dutch
ENG : English
FRA : French
DEU : German
HUN : Hungarian
ITA : Italian
JPN : Japanese
KOR : Korean
PLK : Polish
PTB : Portuguese (Brazil)
ROM : Romanian
RUS : Russian
ESP : Spanish
TRK : Turkish
UKR : Ukrainian
VIN : Vietnames
ARA : Arabic
SRP : Serbian
HRV : Croatian
THA : Thai
IND : Indonesian
FIL : Filipino (Tagalog)

مرجع المترجمين

اسم	مفتاح واجهة برمجة التطبيقات	غير متصل	ملحوظة
~~جوجل~~			معطل مؤقتا
com.youdao	✔️		يتطلب `YOUDAO_APP_KEY` و `YOUDAO_SECRET_KEY`
بايدو	✔️		يتطلب `BAIDU_APP_ID` و `BAIDU_SECRET_KEY`
عميق	✔️		يتطلب `DEEPL_AUTH_KEY`
كايون	✔️		يتطلب `CAIYUN_TOKEN`
gpt3	✔️		ينفذ النص davinci-003. يتطلب `OPENAI_API_KEY`
gpt3.5	✔️		ينفذ gpt-3.5-turbo. يتطلب `OPENAI_API_KEY`
gpt4	✔️		ينفذ gpt-4. يتطلب `OPENAI_API_KEY`
باباجو
ساكورا			يتطلب `SAKURA_API_BASE`
غير متصل		✔️	يختار المترجم الأكثر ملاءمة للغة حاليا
سوغوي		✔️	نماذج سوغوي V4.0
m2m100		✔️	يدعم كل لغة
m2m100_big		✔️
لا أحد		✔️	ترجمة إلى النصوص الفارغة
إبداعي		✔️	احتفظ بالنصوص الأصلية

مفتاح API: ما إذا كان المترجم يحتاج إلى تعيين مفتاح API كمتغير بيئة. لهذا يمكنك إنشاء ملف .env في الدليل الجذر للمشروع الذي يحتوي على مفاتيح API الخاصة بك كما يلي:

 OPENAI_API_KEY = sk-xxxxxxx...
DEEPL_AUTH_KEY = xxxxxxxx...

غير متصل: ما إذا كان يمكن استخدام المترجم دون اتصال بالإنترنت.
تم إنشاء Sugoi بواسطة mingshiba، يرجى دعمه على https://www.patreon.com/mingshiba

مرجع تكوين GPT

يتم استخدامه بواسطة وسيطة --gpt-config .

 # The prompt being feed into GPT before the text to translate.
# Use {to_lang} to indicate where the target language name should be inserted.
# Note: ChatGPT models don't use this prompt.
prompt_template : >
  Please help me to translate the following text from a manga to {to_lang}
  (if it's already in {to_lang} or looks like gibberish you have to output it as it is instead):n

# What sampling temperature to use, between 0 and 2.
# Higher values like 0.8 will make the output more random,
# while lower values like 0.2 will make it more focused and deterministic.
temperature : 0.5

# An alternative to sampling with temperature, called nucleus sampling,
# where the model considers the results of the tokens with top_p probability mass.
# So 0.1 means only the tokens comprising the top 10% probability mass are considered.
top_p : 1

# The prompt being feed into ChatGPT before the text to translate.
# Use {to_lang} to indicate where the target language name should be inserted.
# Tokens used in this example: 57+
chat_system_template : >
  You are a professional translation engine, 
  please translate the story into a colloquial, 
  elegant and fluent content, 
  without referencing machine translations. 
  You must only translate the story, never interpret it.
  If there is any issue in the text, output it as is.

  Translate to {to_lang}.

# Samples being feed into ChatGPT to show an example conversation.
# In a [prompt, response] format, keyed by the target language name.
#
# Generally, samples should include some examples of translation preferences, and ideally
# some names of characters it's likely to encounter.
#
# If you'd like to disable this feature, just set this to an empty list.
chat_sample :
  Simplified Chinese : # Tokens used in this example: 88 + 84
    - <|1|>恥ずかしい… 目立ちたくない… 私が消えたい…
      <|2|>きみ… 大丈夫⁉
      <|3|>なんだこいつ 空気読めて ないのか…？
    - <|1|>好尴尬…我不想引人注目…我想消失…
      <|2|>你…没事吧⁉
      <|3|>这家伙怎么看不懂气氛的…？

# Overwrite configs for a specific model.
# For now the list is: gpt3, gpt35, gpt4
gpt35 :
  temperature : 0.3

استخدام برنامج Gimp للعرض

عند ضبط تنسيق الإخراج على { xcf ، psd ، pdf } سيتم استخدام Gimp لإنشاء الملف.

في نظام التشغيل Windows، يفترض هذا تثبيت Gimp 2.x على C:Users<Username>AppDataLocalProgramsGimp 2 .

يحتوي ملف .xcf الناتج على الصورة الأصلية باعتبارها الطبقة الأدنى ويحتوي على اللوحة الداخلية كطبقة منفصلة. تحتوي مربعات النص المترجمة على طبقات خاصة بها مع النص الأصلي كاسم الطبقة لسهولة الوصول إليها.

القيود:

سيقوم Gimp بتحويل طبقات النص إلى صور عادية عند حفظ ملفات .psd .
لا يتم التعامل مع النص الذي تم استدارته بشكل جيد في Gimp. عند تحرير مربع نص تم تدويره، ستظهر أيضًا نافذة منبثقة تشير إلى أنه تم تعديله بواسطة برنامج خارجي.
يتم التحكم في عائلة الخطوط بشكل منفصل، باستخدام الوسيطة --gimp-font .

توثيق واجهة برمجة التطبيقات

واجهة برمجة التطبيقات V2

 # use `--mode api` to start a web server.
$ python -m manga_translator -v --mode api --use-gpu
# the api will be serving on http://127.0.0.1:5003

تقبل واجهة برمجة التطبيقات json(post) ومتعددة الأجزاء.
نقاط نهاية واجهة برمجة التطبيقات هي /colorize_translate ، /inpaint_translate ، /translate ، /get_text .
الوسائط الصالحة لواجهة برمجة التطبيقات هي:

 // These are taken from args.py. For more info see README.md
detector: String
ocr: String
inpainter: String
upscaler: String
translator: String 
target_language: String
upscale_ratio: Integer
translator_chain: String
selective_translation: String
attempts: Integer
detection_size: Integer // 1024 => 'S', 1536 => 'M', 2048 => 'L', 2560 => 'X'
text_threshold: Float
box_threshold: Float
unclip_ratio: Float
inpainting_size: Integer
det_rotate: Bool
det_auto_rotate: Bool
det_invert: Bool
det_gamma_correct: Bool
min_text_length: Integer
colorization_size: Integer
denoise_sigma: Integer
mask_dilation_offset: Integer
ignore_bubble: Integer
gpt_config: String
filter_text: String
overlay_type: String

// These are api specific args
direction: String // {'auto', 'h', 'v'}
base64Images: String //Image in base64 format
image: Multipart // image upload from multipart
url: String // an url string

تحل الترجمة اليدوية محل الترجمة الآلية مع المترجمين البشريين. يمكن العثور على العرض التوضيحي الأساسي للترجمة اليدوية على http://127.0.0.1:5003/manual عند استخدام وضع الويب.

واجهة برمجة التطبيقات

يتم توفير وضعين لخدمة الترجمة من خلال العرض التوضيحي: الوضع المتزامن والوضع غير المتزامن.
في الوضع المتزامن، سينتهي طلب HTTP POST بمجرد انتهاء مهمة الترجمة.
في الوضع غير المتزامن، سوف يستجيب طلب HTTP POST الخاص بك باستخدام task_id على الفور، ويمكنك استخدام task_id هذا لاستقصاء حالة مهمة الترجمة.

الوضع المتزامن

نشر طلب نموذج مع file:<content-of-image> إلى http://127.0.0.1:5003/run
انتظر الرد
استخدم task_id الناتج للعثور على نتيجة الترجمة في دليل result/ ، على سبيل المثال استخدام Nginx لكشف result/

الوضع غير المتزامن

نشر طلب نموذج مع file:<content-of-image> إلى http://127.0.0.1:5003/submit
الحصول على task_id الترجمة
استقصاء لحالة مهمة الترجمة عن طريق نشر JSON {"taskid": <task-id>} إلى http://127.0.0.1:5003/task-state
تنتهي الترجمة عندما finished الحالة الناتجة أو error أو error-lang
ابحث عن نتيجة الترجمة في دليل result/ ، على سبيل المثال استخدام Nginx لكشف result/

الترجمة اليدوية

انشر طلب نموذج مع file:<content-of-image> إلى http://127.0.0.1:5003/manual-translate وانتظر الرد.

سوف تحصل على استجابة JSON مثل هذا:

{
  "task_id" : " 12c779c9431f954971cae720eb104499 " ,
  "status" : " pending " ,
  "trans_result" : [
    {
      "s" : " ☆上司来ちゃった…… " ,
      "t" : " "
    }
  ]
}

املأ النصوص المترجمة:

{
  "task_id" : " 12c779c9431f954971cae720eb104499 " ,
  "status" : " pending " ,
  "trans_result" : [
    {
      "s" : " ☆上司来ちゃった…… " ,
      "t" : " ☆Boss is here... "
    }
  ]
}

انشر ترجمة JSON إلى http://127.0.0.1:5003/post-manual-result وانتظر الرد.
بعد ذلك يمكنك العثور على نتيجة الترجمة في دليل result/ ، على سبيل المثال، استخدام Nginx لكشف result/ .

الخطوات التالية

قائمة بما يجب القيام به بعد ذلك، فنحن نرحب بك للمساهمة.

استخدم نموذج الانتشار في الطلاء لتحقيق نتيجة شبه مثالية، ولكن هذا قد يكون أبطأ بكثير.
هام!!!المساعدة المطلوبة!!! محرك عرض النص الحالي بالكاد قابل للاستخدام، ونحن بحاجة لمساعدتكم لتحسين عرض النص!
يتم تحديد منطقة عرض النص من خلال أسطر النص المكتشفة، وليس من خلال فقاعات الكلام.
يعمل هذا مع الصور التي لا تحتوي على فقاعات كلام، ولكنه يجعل من المستحيل تحديد مكان وضع النص الإنجليزي المترجم. ليس لدي أي فكرة عن كيفية حل هذا.
ريوتا وآخرون. مقترح باستخدام الترجمة الآلية متعددة الوسائط، ربما يمكننا إضافة ميزات ViT لبناء نماذج NMT مخصصة.
اجعل هذا المشروع يعمل للفيديو (أعد كتابة الكود في C++ واستخدم GPU/مسرع NN للأجهزة الأخرى).
يستخدم لاكتشاف الترجمات الصعبة في مقاطع الفيديو وإنشاء ملفات الحمار وإزالتها بالكامل.
تحسين القناع يعتمد على استخدام خوارزميات التعلم غير العميق، وأنا أقوم حاليًا باختبار الخوارزمية المستندة إلى CRF.
~~دمج منطقة النص ذات الزاوية غير مدعوم حاليًا~~
إنشاء مستودع النقطة