Podczas przepisywania rozmowy z pliku audio bardzo szybko okazuje się, że najwięcej trudności nie wynika z samego pisania, lecz z konieczności właściwego odczytania tego, co w rzeczywistości zostało powiedziane. Nagranie może zawierać dłuższe przerwy, zmiany tematu, poprawianie własnych wypowiedzi albo fragmenty wypowiadane bardzo cicho. Transkrypcja nagrań wymaga więc jednoczesnego słuchania i zapisywania informacji w sposób uporządkowany.
Przy prostych rozmowach wystarcza zwykle rozpoznanie kolejnych wypowiedzi, jednak przy bardziej złożonym materiale dochodzi identyfikacja osób, zarządzanie kolejności oraz zaznaczanie miejsc, których nie można niedwuznacznie odczytać. Ważne jest również rozróżnienie pośród zapisem dosłownym a treścią po redakcji. W pierwszym przypadku pozostawia się naturalne cechy mowy, takie jak powtórzenia czy niedokończone zdania. W drugim można ograniczyć elementy utrudniające lekturę, jednakże każda ingerencja w treść powinna posiadać określony cel i nie może prowadzić do zmiany znaczenia wypowiedzi.
Duże znaczenie ma jakość samego nagrania. Plik zarejestrowany w cichym pomieszczeniu daje w całości inne sposobności niż materiał pochodzący z miejsca, w którym słychać ruch uliczny, pracujące urządzenia lub kilka rozmów prowadzonych jednocześnie. Problematyczne bywają też nagrania z telefonu, gdy urządzenie znajduje się daleko od osoby mówiącej. W takich warunkach pojedyncze słowa mogą być trudne do rozpoznania, a próba odtworzenia ich jedynie na bazie kontekstu prowadzi do ryzyka błędu. W praktyce nie gorzej pozostawić oznaczenie niezrozumiałego fragmentu niż wpisać frazę, które jedynie wydaje się prawdopodobne. Przy dłuższych materiałach przydaje się także oznaczanie czasu nagrania. Umożliwia ono szybko wrócić do dokładnie sprecyzowanej wypowiedzi i porównać zapis z oryginalnym plikiem. Ma to znaczenie zwłaszcza wtedy, gdy dokument będzie analizowany przez osoby, które nie uczestniczyły w rozmowie.
W materiałach związanych z postępowaniem prawnym sposób opracowania zapisu może posiadać dodatkowe znaczenie. Transkrypcja do sądu powinna przedstawiać treść nagrania w sposób czytelny, ale bez swobodnego interpretowania wypowiedzi uczestników. Nie trzeba poprawiać sensu zdania jedynie dlatego, że rozmówca użył błędnej formy językowej lub przerwał wypowiedź w połowie (warto zobaczyć:stenogram cennik). O ile na nagraniu występuje kilka osób, niezbędne jest konsekwentne oznaczanie ich wypowiedzi. Jeszcze trudniejsza sytuacja pojawia się przy mówieniu jednoczesnym, ponieważ wówczas nie za każdym razem da się ustalić pełną tekst obu wypowiedzi. W tak zaistniałej okoliczności warto podkreślić nakładanie się głosów, zamiast zbudować pozornie kompletny zapis. Znaczenie mogą mieć też dłuższe pauzy, śmiech, podniesiony głos czy odgłosy wskazujące na reakcję uczestników, jeżeli są wyraźnie słyszalne i ważne dla przebiegu rozmowy.
W współzależności od celu dokumentu używa się różnorodne sposoby przedstawiania materiału. Stenogram może być przygotowany w formie bardzo zbliżonej do rzeczywistego przebiegu rozmowy, z zachowaniem kolejności wypowiedzi i charakterystycznych elementów mowy. Przy innych zastosowaniach treść może zostać uporządkowany tak, ażeby łatwiej było wyszukać konkretne informacje, bez zmieniania ich znaczenia. W obu przypadkach ważna pozostaje konsekwencja przy stosowaniu oznaczeń a także dokładne sprawdzanie nazwisk, dat, liczb i nazw własnych. To właśnie takie najmniejsze elementy są podatne na pomyłki, zwłaszcza gdy dźwięk jest niewyraźny lub rozmówca posługuje się mało znanym określeniem. Przy pracy z nagraniem warto też pamiętać, że treść nie oddaje wszystkich cech komunikacji ustnej. Nie każdą intonację czy emocję można jednoznacznie opisać, dlatego zapis powinien oddzielać to, co de facto wynika z nagrania, od interpretacji osoby przygotowującej dokument.
Zobacz więcej: transkrypcja nagrań.