<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>VLLM on Sueboy</title>
    <link>https://blog.mkinweb.com/tags/vllm/</link>
    <description>Recent content in VLLM on Sueboy</description>
    <image>
      <title>Sueboy</title>
      <url>https://blog.mkinweb.com/images/</url>
      <link>https://blog.mkinweb.com/images/</link>
    </image>
    <generator>Hugo -- 0.149.0</generator>
    <language>zh-tw</language>
    <lastBuildDate>Sun, 02 Aug 2026 11:06:15 +0800</lastBuildDate>
    <atom:link href="https://blog.mkinweb.com/tags/vllm/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>企業 AI OCR 高並發實戰：從爆掉到穩定，vLLM 才是能上線的那個</title>
      <link>https://blog.mkinweb.com/posts/2026/2026-08-02/2026-08-02/</link>
      <pubDate>Sun, 02 Aug 2026 11:06:15 +0800</pubDate>
      <guid>https://blog.mkinweb.com/posts/2026/2026-08-02/2026-08-02/</guid>
      <description>&lt;h2 id=&#34;環境與模型&#34;&gt;環境與模型&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;硬體：NVIDIA GB10&lt;/li&gt;
&lt;li&gt;模型：Qwen 3.6 27B（Q4_K_M 量化）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;推理引擎實測結論&#34;&gt;推理引擎實測結論&lt;/h2&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;引擎&lt;/th&gt;
          &lt;th&gt;結果&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;strong&gt;vLLM&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;✅ 多人同時連線 8 線、16 線都撐得住——唯一通過考驗&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;SGLang&lt;/td&gt;
          &lt;td&gt;理論上更強，但 demo 和實際上線是兩回事，實戰未驗證&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Ollama&lt;/td&gt;
          &lt;td&gt;很快掛掉，必須自己建 queue 排隊處理&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;LM Studio&lt;/td&gt;
          &lt;td&gt;單人測試正常，多人一測就爆，試多次都爆&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;測試過程&#34;&gt;測試過程&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;一開始放棄 Ollama，改用 LM Studio 先測 OCR：找到可用模型、設定正確的 threads&lt;/li&gt;
&lt;li&gt;寫一個循環 Windows script，上網抓發票、表格圖片至少二、三十張&lt;/li&gt;
&lt;li&gt;打到 LM Studio API，一張一張跑，單人全部正常&lt;/li&gt;
&lt;li&gt;打包給 MIS 相關人員與預使用人員同時測試 → 多人一測，LM Studio 直接爆掉（試多次都爆）&lt;/li&gt;
&lt;li&gt;改用 vLLM 版本 → 不再爆&lt;/li&gt;
&lt;li&gt;改成無限循環版本（打開就一直送不停），單一 PC 開 4 線、8 線，從週五下班跑到週一早上 → 完全正常，辨識也正確&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;只有這樣才證明撐得過高峰並發多人使用，這才是企業內真正的實際運用。&lt;/p&gt;
&lt;h2 id=&#34;應用場景&#34;&gt;應用場景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;會計大量作帳、內部文件 OCR：不定時、大量文件&lt;/li&gt;
&lt;li&gt;未來：現場設定即時不斷辨識，壓力更大——每 1 分鐘跑一次；30~50 台設備同時上線，沒有高並發直接爆&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;文件類型&#34;&gt;文件類型&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;客戶報價單、公司報價單回填、材料相關表格&lt;/li&gt;
&lt;li&gt;MES / WMS / SCM 相關文件、產生履歷文件（目標：減少打字時間）&lt;/li&gt;
&lt;li&gt;跟發票這種千奇百怪的類型不同：手寫單據、出場、驗收——人寫的，這些真的要靠 AI 高並發&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;真實場景&#34;&gt;真實場景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;一車來三櫃驗收單，一次來二十車，不同廠區同時運作&lt;/li&gt;
&lt;/ul&gt;</description>
    </item>
  </channel>
</rss>
