خرید API تبدیل گفتار به متن فارسی Whisper
فایلِ صوتی، ویسِ تلگرام یا ضبطِ جلسه را بفرست و متنِ فارسی — یا زیرنویسِ زمانبندیشده — تحویل بگیر. 1xAi همان API استانداردِ Whisper را از داخلِ ایران در دسترس میگذارد: بدونِ ویپیان، بدونِ کارتِ ارزی، با شارژِ تومانیِ زرینپال و همان SDK رسمیِ OpenAI.
whisper-1 با صدای فارسیات چه میکند.
فارسی جزو زبانهای رسمی Whisper
مدل whisper-1 زبان فارسی را بهصورت رسمی پشتیبانی میکند. با فرستادن پارامتر language="fa" مدل از همان ثانیهٔ اول فارسی گوش میدهد و دقتِ تشخیص — بهخصوص روی اسمها و کلمههای همآوا — محسوس بهتر میشود.
تایماستمپ برای هر قطعه و هر کلمه
با response_format="verbose_json" زمانِ شروع و پایانِ هر قطعه را میگیری و با timestamp_granularities میتوانی تا سطحِ تککلمه ریز شوی — پایهٔ ساختِ زیرنویس، جستجو در صوت و هایلایتِ همزمانِ متن.
خروجی زیرنویسِ آماده: SRT و VTT
لازم نیست خودت زیرنویس بسازی؛ response_format را روی srt یا vtt بگذار و فایلِ زیرنویسِ زمانبندیشده تحویل بگیر. خروجیهای json و text هم برای متنِ خام در دسترساند.
ورودیِ تقریباً هر فایلِ صوتی
فرمتهای mp3، mp4، m4a، wav، webm، ogg و mpeg پذیرفته میشوند — یعنی ویسِ تلگرام و خروجیِ ضبطِ موبایل بدون تبدیل کار میکنند. سقفِ هر درخواست طبق محدودیتِ OpenAI حدود ۲۵ مگابایت است؛ فایلهای بلندتر را تکهتکه بفرست.
از داخل ایران، با صورتحسابِ تومانی
1xAi همان مسیرِ استانداردِ /v1/audio/transcriptions را از داخلِ ایران پروکسی میکند: بدونِ ویپیان، بدونِ کارتِ ارزی، و هزینهٔ هر فایل مستقیم از کیفِ پولِ تومانیات کم میشود.
سازگار با SDK رسمی OpenAI
همان کدی که برای OpenAI نوشتهای کار میکند — فقط base_url را به https://1xai.ir/v1 تغییر بده و کلیدِ بومیِ 1xai-* را بگذار. هیچ کتابخانهٔ اختصاصیای لازم نیست.
- [01]
ثبتنام
با ایمیل حساب بساز — نه ویپیان لازم است، نه کارتِ ارزی.
- [02]
چرخاندنِ گردونهٔ هدیه (۱۰۰ هزار تا ۱ میلیون تومان)
پس از ثبتنام یک چرخش داری؛ جایزه مستقیم به کیف پولت مینشیند و منقضی نمیشود — برای ساعتها تبدیلِ صوت کافی است.
- [03]
ساختِ کلید
از داشبورد یک کلیدِ بومیِ 1xAi صادر کن — با سقفِ مصرف و انقضای دلخواه.
- [04]
آپلودِ اولین فایل
یک mp3 یا ویس را به /v1/audio/transcriptions بفرست؛ چند ثانیه بعد متنِ فارسی (یا زیرنویسِ SRT) برگشته است.
قیمتِ دقیقهای، با فرمولِ شفاف.
برخلافِ مدلهای چت که توکنی حساب میشوند، Whisper بر اساسِ طولِ فایلِ صوتی قیمت میخورد — یعنی هزینهٔ هر فایل از قبل قابلِ پیشبینی است. محاسبه هم همان قاعدهٔ همیشگیِ 1xAi است، بدونِ پلن و هزینهٔ پنهان:
مارکآپ همان ۲۰٪ ثابتِ همهٔ مدلهاست و نرخِ دلار به تومان هر روز ساعتِ ۹ صبح بهوقتِ تهران بهصورتِ خودکار با نرخِ بازار همگام میشود. قیمتِ لحظهایِ همهٔ مدلها را در صفحهٔ قیمتها ببین و هزینهٔ ماهانهات را — بر اساسِ دقیقههای صوتی که تبدیل میکنی — با محاسبهگرِ تومانی تخمین بزن. هزینهٔ هر درخواست بعد از اجرا، شفاف در گزارشِ مصرفِ داشبورد ثبت میشود.
یک mp3 آپلود کن، متن بگیر.
سرویس با API استانداردِ OpenAI سازگار است: base_url را به https://1xai.ir/v1 تغییر بده، کلیدِ بومیات را از داشبورد بگیر و فایل را به /v1/audio/transcriptions بفرست — بقیهٔ کدت دستنخورده میماند.
curl https://1xai.ir/v1/audio/transcriptions \
-H "Authorization: Bearer 1xai-..." \
-F model="whisper-1" \
-F file="@voice.mp3" \
-F language="fa" \
-F response_format="srt"from openai import OpenAI
client = OpenAI(
base_url="https://1xai.ir/v1", # فقط همین خط عوض میشود
api_key="1xai-...",
)
with open("voice.mp3", "rb") as audio:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio,
language="fa", # فارسی — بدون حدسزدن زبان
# response_format="srt", # زیرنویس آماده؛ یا "vtt" / "verbose_json"
)
print(transcript.text)فایل بهصورتِ multipart/form-data آپلود میشود؛ برای متنِ خام response_format را حذف کن (پیشفرض json است و متنِ نهایی در فیلدِ text برمیگردد).
مستنداتِ کاملچهار جایی که همین امروز جواب میدهد.
جلسهٔ کاری
ضبطِ جلسه را بفرست و صورتجلسهٔ متنی بگیر؛ با تایماستمپها هر تصمیم به دقیقهٔ خودش لینک میشود.
پادکست
متنِ کاملِ هر قسمت را استخراج کن — هم برای سئو و ایندکسشدنِ محتوای صوتی، هم برای بریدنِ نقلقولها.
کلاس و جزوه
صدای کلاس یا وبینار را به جزوهٔ قابلِ جستجو تبدیل کن؛ خروجیِ VTT همان زیرنویسِ ویدیوی آموزشی است.
ویس تلگرام
ویسهای طولانی را برنامهات خودکار به متن تبدیل کند — فرمتِ ogg تلگرام بدونِ هیچ تبدیلی پذیرفته میشود.
آیا Whisper واقعاً فارسی را میفهمد؟+
بله. فارسی جزو زبانهای رسماً پشتیبانیشدهٔ مدل whisper-1 است و روی صوتِ تمیز نتیجهٔ قابلِ اتکایی میدهد. برای بهترین دقت پارامتر language را روی fa بگذار تا مدل حدس نزند، و تا جای ممکن صدای کمنویز با میکروفونِ نزدیک بفرست.
برای خرید API Whisper از ایران به ویپیان یا کارت ارزی نیاز دارم؟+
خیر. ثبتنام و پرداخت کاملاً داخلی است: کیف پول را از طریقِ درگاهِ زرینپال (حداقل ۱۰۰٬۰۰۰ تومان) شارژ میکنی و فراخوانیِ /v1/audio/transcriptions از داخلِ ایران، بدونِ ویپیان و بدونِ کارتِ ارزی کار میکند.
قیمت تبدیل صدا به متن به تومان چطور محاسبه میشود؟+
Whisper بر اساسِ طولِ فایلِ صوتی (دقیقهای) قیمت میخورد، نه توکنی. فرمول شفاف است: قیمتِ هر دقیقه در لیستِ OpenAI × مارکآپِ ثابتِ ۲۰٪ × نرخِ روزِ دلار به تومان. نرخِ دلار هر روز ساعتِ ۹ صبح بهوقتِ تهران خودکار با بازار همگام میشود؛ قیمتِ لحظهای را در صفحهٔ قیمتها و برآوردِ ماهانه را با محاسبهگر ببین.
میتوانم مستقیم زیرنویس SRT یا VTT بگیرم؟+
بله. کافی است در همان درخواست response_format را روی srt یا vtt بگذاری تا فایلِ زیرنویسِ زمانبندیشده تحویل بگیری. برای متنِ خام از text یا json استفاده کن و برای تایماستمپِ کلمهبهکلمه از verbose_json بههمراهِ timestamp_granularities.
چه فرمتهایی پشتیبانی میشود و سقف حجم فایل چقدر است؟+
فرمتهای mp3، mp4، mpeg، mpga، m4a، wav، webm و ogg پذیرفته میشوند — ویسِ تلگرام هم همینطور مستقیم کار میکند. طبق محدودیتِ OpenAI هر درخواست حداکثر حدودِ ۲۵ مگابایت فایل میپذیرد؛ فایلهای طولانیتر را قطعهقطعه کن و بهترتیب بفرست.
ثبتنام کن، گردونهٔ هدیه را بچرخان (۱۰۰ هزار تا ۱ میلیون تومان)، اولین ویس را متن کن.
شارژِ بعدی هر وقت خواستی — از ۱۰۰٬۰۰۰ تومان با زرینپال. اعتبارِ کیف پولت هم هیچوقت منقضی نمیشود.